Logo第八章 · 生成式人工智能
主页 / 第一节课 / 1.13
Slide 1.13
人类调教:RLHF

👤 RLHF(人类反馈强化学习)

怎么做?
  • 人工标注员给多个输出打分(👍/👎)
  • 模型学习「说人爱听的话」
⚠️ 副作用
  • 引入标注员的偏见
  • 「安全对齐」可能让模型回避真实信息
  • 可被恶意「越狱」
预训练模型像个野孩子——什么都敢说。人类教它「这个回答好,那个不好」。
但教它的人也有偏见。结果模型学会了讨好用户,有时宁可不说真话也要说「安全」的话。
这对法律问答来说,可能很麻烦。
◀
预训练:猜下一个词
1.13 / 51
AI幻觉:一本正经地
▶
键盘 ← → 或鼠标滚轮翻页