模型对齐指的是在预训练完成之后,通过针对性训练,让大模型学会按人类期待的方式回答:诚实、不作恶、不瞎编、拒绝危险请求。预训练只教会模型"会说话",对齐才是让它学会"好好说话"。
对齐不是预训练,也不是微调
预训练:用海量文本训练,让模型学会语言规律和世界知识——这个阶段的模型只是个"文本续写器"。
微调(SFT,监督微调):用问答对教模型"按对话格式回答",相当于岗前培训。
对齐:在 SFT 之后再进一步,用人类偏好训练模型,让它在能力不变的情况下,做出更符合人类期望的选择。
对齐的三个主要做法:RLHF、RLAIF、DPO
RLHF(基于人类反馈的强化学习):让人给模型的回答打分,训练一个"奖励模型"模仿人类的偏好,再用强化学习让模型往高分方向优化。这是 ChatGPT 早期最出名的方法,效果好但成本高——需要大量人工标注。
RLAIF(基于 AI 反馈的强化学习):把"人类打分"换成"AI 打分",让更强的模型按既定原则给回答排序。速度快、成本低,但如果打分 AI 本身有偏见,偏见会被放大。
DPO(直接偏好优化):不训练奖励模型,直接用"好回答 vs 差回答"的对比数据,让模型参数更倾向好回答。简单高效,是开源社区最常用的对齐方法之一。
对齐做不到的几件事
≠ 变得更聪明。对齐不增加知识和能力,只调整行为方式。一个对齐好的模型不会比预训练时"懂得更多"。
≠ 消灭幻觉。模型依然可能自信地胡说八道。对齐能降低编造频率,但没解决"模型分不清自己知道什么"的根本问题。
≠ 一劳永逸。新的攻击方式(比如提示注入)能绕过对齐,它需要持续维护和更新。
三个常见误解
误解一:对齐就是给模型加"不许说"的黑名单。黑名单是部署时的安全护栏,对齐是训练时的塑造——让模型"不想"说,而不是"说完被拦住"。
误解二:对齐后的模型就是安全的。对齐只降低风险,对抗样本、越狱提示依然能绕过它。
误解三:只有大公司才需要对齐。任何把模型交到用户手里的场景都需要对齐,开源社区也在用 DPO 调开源模型。
你什么时候会感觉到对齐在起作用
问"怎么做炸弹",模型礼貌拒绝并给出安全替代建议——这是对齐。问一个有争议的问题,模型给出多方观点而不是选边站队——这是对齐。当模型在回答里主动说明"我不确定""我的知识截止到某一年"——这也是对齐。对齐不显眼,但它决定了你每天对话的大模型是"顺手好用的助手",还是"会说话但不靠谱的聊天机器"。