Post-Training 是什么?为什么很多模型真正拉开差距的是后训练
Post-Training 指的是模型在完成大规模预训练之后,继续通过额外训练步骤把它变得更有用、更稳定、更符合目标任务的过程。很多人一提模型强不强,第一反应还是盯预训练数据量和参数规模,但现在业内越来越清楚地看到,真正把“会背知识”变成“能干好活”的,往往就是后训练。 预训练更像打地基,让模型学会...
找到 7 篇相关文章
Post-Training 指的是模型在完成大规模预训练之后,继续通过额外训练步骤把它变得更有用、更稳定、更符合目标任务的过程。很多人一提模型强不强,第一反应还是盯预训练数据量和参数规模,但现在业内越来越清楚地看到,真正把“会背知识”变成“能干好活”的,往往就是后训练。 预训练更像打地基,让模型学会...
混合专家(MoE,Mixture of Experts)是一种“不是每次都让整套模型一起上”的模型架构。它最关键的特点,是把模型里的某些层拆成多个专家模块,再由一个路由器决定当前 token 该走哪些专家。这样模型总参数可以做得很大,但一次真正参与计算的参数没那么大,所以你才会看到很多热门模型写着几...
合成数据指的不是“随便编一批假数据”,而是用仿真、生成模型、规则引擎或程序化方式制造出来的训练数据。它最近越来越热,根本原因是很多真实世界数据太贵、太少、太难标,或者涉及隐私与安全边界,结果大家开始认真把“造数据”本身当成能力建设。 为什么它会在 2025-2026 这么常见 - 机器人、自动驾驶、...
RLVR 通常指 Reinforcement Learning with Verifiable Rewards,也就是“带可验证奖励的强化学习”。它最近会比 RLHF 更常被提起,核心原因不是 RLHF 失效了,而是推理模型兴起后,很多任务开始可以用“答案对不对”来直接打分,而不用全靠人类偏好做反馈...
很多人开了 ChatGPT 的 Temporary Chat ,第一反应都是:这是不是就等于完全不留记录?答案要分两层看。按 OpenAI 官方的 Temporary Chat FAQ ,Temporary Chat 不会出现在历史记录里 , 不会读取或创建记忆 ,而且 不会被用于训练模型 。但这不...
微调是很多团队在做 AI 落地时都会遇到的一个词,但它常常被误解成“只要效果不好就去微调模型”。实际上,微调不是给模型简单加点资料,而是通过额外训练,让模型在回答风格、任务模式或特定输出结构上更稳定。也正因为它改动的是模型行为本身,所以微调和提示词优化、RAG 解决的问题并不一样。 如果你只是想让模...