ToolNavs 发现实用AI工具
提交工具 登录
返回AI百科
模型对齐:大模型“会说话”之后,还要学会“好好说话”

模型对齐:大模型“会说话”之后,还要学会“好好说话”

AI百科 • Admin • • 6 次浏览

模型对齐指的是在预训练完成之后,通过针对性训练,让大模型学会按人类期待的方式回答:诚实、不作恶、不瞎编、拒绝危险请求。预训练只教会模型"会说话",对齐才是让它学会"好好说话"。

对齐不是预训练,也不是微调

预训练:用海量文本训练,让模型学会语言规律和世界知识——这个阶段的模型只是个"文本续写器"。

微调(SFT,监督微调):用问答对教模型"按对话格式回答",相当于岗前培训。

对齐:在 SFT 之后再进一步,用人类偏好训练模型,让它在能力不变的情况下,做出更符合人类期望的选择。

对齐的三个主要做法:RLHF、RLAIF、DPO

RLHF(基于人类反馈的强化学习):让人给模型的回答打分,训练一个"奖励模型"模仿人类的偏好,再用强化学习让模型往高分方向优化。这是 ChatGPT 早期最出名的方法,效果好但成本高——需要大量人工标注。

RLAIF(基于 AI 反馈的强化学习):把"人类打分"换成"AI 打分",让更强的模型按既定原则给回答排序。速度快、成本低,但如果打分 AI 本身有偏见,偏见会被放大。

DPO(直接偏好优化):不训练奖励模型,直接用"好回答 vs 差回答"的对比数据,让模型参数更倾向好回答。简单高效,是开源社区最常用的对齐方法之一。

对齐做不到的几件事

≠ 变得更聪明。对齐不增加知识和能力,只调整行为方式。一个对齐好的模型不会比预训练时"懂得更多"。

≠ 消灭幻觉。模型依然可能自信地胡说八道。对齐能降低编造频率,但没解决"模型分不清自己知道什么"的根本问题。

≠ 一劳永逸。新的攻击方式(比如提示注入)能绕过对齐,它需要持续维护和更新。

三个常见误解

误解一:对齐就是给模型加"不许说"的黑名单。黑名单是部署时的安全护栏,对齐是训练时的塑造——让模型"不想"说,而不是"说完被拦住"。

误解二:对齐后的模型就是安全的。对齐只降低风险,对抗样本、越狱提示依然能绕过它。

误解三:只有大公司才需要对齐。任何把模型交到用户手里的场景都需要对齐,开源社区也在用 DPO 调开源模型。

你什么时候会感觉到对齐在起作用

问"怎么做炸弹",模型礼貌拒绝并给出安全替代建议——这是对齐。问一个有争议的问题,模型给出多方观点而不是选边站队——这是对齐。当模型在回答里主动说明"我不确定""我的知识截止到某一年"——这也是对齐。对齐不显眼,但它决定了你每天对话的大模型是"顺手好用的助手",还是"会说话但不靠谱的聊天机器"。

推荐工具

更多