什么是 RLHF?AI 是怎么被"调教"得懂事的
同样是大模型,为什么 ChatGPT 会礼貌回答、拒绝坏请求,而不是胡乱接龙?RLHF 和"对齐"是什么、AI 怎么学会好好说话、又有什么副作用,一文讲清。
一个刚训练完的大模型,其实是个”野孩子”:它只会预测下一个词,你问它问题,它可能续一段不相关的话、也可能一本正经地教你干坏事。可我们用到的 ChatGPT、Claude 却懂礼貌、会拒绝、答得有条理。从”野孩子”到”好助手”,中间发生了什么? 答案就是 RLHF 和”对齐”。这篇用大白话讲清楚。
先分清两个阶段:预训练 vs 对齐
大模型的养成大致分两步:
- 预训练:在海量文本上学”预测下一个词”,练就一肚子知识和语言能力——但它只会”接龙”,不懂”你想要什么”
- 对齐(Alignment):再用人类的示范和反馈,教它”听懂指令、回答有用、不说有害内容”——把”会接龙的模型”调教成”好用的助手”
RLHF 就是第二步里最关键的一套方法。名字全称是 Reinforcement Learning from Human Feedback(基于人类反馈的强化学习)——听着唬人,拆开看其实很好懂。
RLHF 三步:像训练员带徒弟
用一个”带徒弟”的比喻,RLHF 大致三步:
第一步:人类示范(教它该怎么答)
先请人写出一批”好答案”作范例:面对各种问题,一个理想的助手应该怎么回应。让模型照着学,先有个样子。
第二步:训练一个”打分员”(奖励模型)
让模型对同一个问题生成好几个答案,请人把它们从好到坏排序。用这些排序数据训练出一个奖励模型——它学会了像人一样给答案打分:有用、礼貌、安全的得高分,答非所问、有害的得低分。
第三步:让模型追高分(强化学习)
现在放手让模型自己答,每答一个,“打分员”就给个分,模型不断调整自己朝高分方向进化。反复练下来,它就越来越像人们期望的那个”好助手”。
一句话:先给范例、再教一个打分员、然后让 AI 拼命考高分——这就是 RLHF。
为什么这一步如此重要
同样底子的模型,有没有好好对齐,体验天差地别。对齐让 AI:
- 听懂指令:你说”总结成三点”,它真的给三点,而不是继续写下去
- 回答有用:抓住你的真实意图,而非字面接龙
- 懂得拒绝:面对有害、危险的请求会婉拒
- 有分寸:语气礼貌、不轻易冒犯
可以说,预训练决定了 AI 有多”聪明”,对齐决定了它有多”好用、可靠”。
对齐的代价与副作用
对齐不是万能药,它也带来一些为人熟知的”毛病”:
- 过度谨慎:有时会拒绝其实无害的正常请求,或答得畏首畏尾(俗称”AI 变懒/变怂”)
- 爱说套话:礼貌得有点模板化,开头总要客套一番
- 谄媚倾向:有时倾向于”顺着你说”、附和你的观点,而非坚持正确答案
- 并没有消除幻觉:对齐让它更少犯错、更懂事,但一本正经地胡说依然可能发生
而”越狱”之所以存在,正是有人想方设法绕过对齐设下的这些约束。对齐与绕过对齐,是一场持续的拉锯。
小结
RLHF 是把大模型从”只会接龙的野孩子”调教成”懂事好助手”的关键一步:人类先示范、再训练一个打分员、然后让 AI 追着高分进化,最终学会听指令、答得有用、懂得拒绝。它决定了 AI 好不好用、可不可靠——但也带来过度谨慎、爱说套话、谄媚等副作用,且并不能根除幻觉。理解了对齐,你就明白了 AI 那些”懂事”与”别扭”从何而来。想从头理解模型怎么练成,见大模型是怎么工作的。