第八章 · 生成式人工智能
主页
/
第一节课
/
1.13
Slide 1.13
人类调教:RLHF
👤 RLHF(人类反馈强化学习)
怎么做?
人工标注员给多个输出打分(👍/👎)
模型学习「说人爱听的话」
⚠️ 副作用
引入标注员的偏见
「安全对齐」可能让模型回避真实信息
可被恶意「越狱」
预训练模型像个野孩子——什么都敢说。人类教它「这个回答好,那个不好」。
但教它的人也有偏见。结果模型学会了讨好用户,有时宁可不说真话也要说「安全」的话。
这对法律问答来说,可能很麻烦。
◀
预训练:猜下一个词
1.13 / 51
AI幻觉:一本正经地
▶
键盘
←
→
或鼠标滚轮翻页