返回文章列表

大语言模型

找到 5 篇相关文章

Post-Training 是什么?为什么很多模型真正拉开差距的是后训练

Post-Training 是什么?为什么很多模型真正拉开差距的是后训练

Post-Training 指的是模型在完成大规模预训练之后,继续通过额外训练步骤把它变得更有用、更稳定、更符合目标任务的过程。很多人一提模型强不强,第一反应还是盯预训练数据量和参数规模,但现在业内越来越清楚地看到,真正把“会背知识”变成“能干好活”的,往往就是后训练。 预训练更像打地基,让模型学会...

AI百科 Admin
60
混合专家(MoE)是什么?为什么很多热门模型参数很大、激活却没那么大

混合专家(MoE)是什么?为什么很多热门模型参数很大、激活却没那么大

混合专家(MoE,Mixture of Experts)是一种“不是每次都让整套模型一起上”的模型架构。它最关键的特点,是把模型里的某些层拆成多个专家模块,再由一个路由器决定当前 token 该走哪些专家。这样模型总参数可以做得很大,但一次真正参与计算的参数没那么大,所以你才会看到很多热门模型写着几...

AI百科 Admin
68
推理模型:为什么它会成为 2025-2026 AI 圈最热的新范式

推理模型:为什么它会成为 2025-2026 AI 圈最热的新范式

推理模型是 2025-2026 年 AI 领域最常被提到的关键词之一。和早期更偏“快速生成”的大语言模型相比,推理模型更强调多步分析、复杂判断和在不确定信息里的决策能力。这也是为什么一旦问题涉及数学、编程、规划、图表理解或长链路决策,推理模型会被单独拿出来讨论。 它之所以会火,不只是因为更“聪明”,...

AI百科 Admin
66

推荐工具

更多