ToolNavs 发现实用AI工具
提交工具 登录
返回AI百科
SFT 监督微调是什么?为什么聊天模型都要先“培训”再上岗

SFT 监督微调是什么?为什么聊天模型都要先“培训”再上岗

AI百科 • Admin • • 6 次浏览

SFT 监督微调(Supervised Fine-Tuning)是聊天模型“上岗”前的培训环节:用成千上万条“指令-回答”示范数据,教预训练好的大模型按人类期望的方式说话做事。注意,它不是给模型灌输新知识,而是教模型“把已经学到的东西,用对格式讲出来”。

预训练、SFT、RLHF 各管什么

聊天模型的训练流水线通常是三步走:预训练 → SFT → RLHF(或 DPO 等对齐方法),三者分工完全不同:

阶段学什么一句话
预训练从海量文本中学语言规律和世界知识学会“说话和懂事”
SFT从指令示范中学“听从指令、按期望格式回答”学会“按要求办事”
RLHF / DPO从人类偏好中学“更安全、更有用”学会“让人满意”

SFT 是怎么做的

第一,准备指令数据集:成千上万条“用户指令-理想回答”对,覆盖问答、写作、代码、推理等任务。第二,训练时损失只算回答部分:模型看完整条数据,但只被考核“回答得像不像示范”,指令部分不算分。第三,质量远比数量重要:研究已表明,几百到上千条高质量示范,效果往往超过几十万条粗糙数据。

顺带一提,SFT 不一定需要全量微调。LoRA 微调等参数高效方法可以用低成本完成 SFT,是个人和小团队的常用选择。

SFT 的天花板

第一,学不会训练截止后的新知识:知识上限由预训练决定,SFT 只教“表达方式”。第二,行为克隆的天花板:模型最多学到示范数据的水平,超不过示范者的能力。第三,数据里的偏差会被放大:示范数据里的偏见和错误,模型会一并学会并巩固。

三个常见误解

误解一:“SFT 数据越多越好。” 错。烂数据会教出坏习惯,高质量示范才是关键。

误解二:“SFT 后模型就变聪明了。” 错。模型的知识量没有变,只是更会答题了;能力天花板在预训练阶段就已定型。

误解三:“做了 SFT 就不需要提示词工程和 RAG 了。” 错。SFT 定的是模型的“默认行为”,RAG 解决“实时知识”,提示词工程解决“当下任务”,三层各管各的,互相替代不了。

SFT 的本质,是给模型做一次“职业习惯培训”:它不改变模型知道什么,只改变模型怎么回答。

推荐工具

更多