ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Mellum2.1 发布:JetBrains 用强化学习把 12B 开源模型练成编程智能体

Mellum2.1 发布:JetBrains 用强化学习把 12B 开源模型练成编程智能体

AI资讯 • Admin • • 6 次浏览

Mellum2.1 是 JetBrains 在 2026 年 10 月 8 日发布的开源编程模型,定位是给编程智能体当干活的工人:它能自己翻代码库、改文件、再检查自己改得对不对。模型已上线 Hugging Face,按 Apache 2.0 许可开放。这一版最值得看的不是参数,而是 JetBrains 把整个夏天押在了强化学习上,试图用一个小模型解决大模型太贵、太慢的部署账。

架构一动没动,功夫全在预训练之后

Mellum2.1 沿用 Mellum2 的架构:120 亿参数的混合专家模型,每个 token 只激活 25 亿参数。JetBrains 在官方博客中说,上一代速度够快,却没法在真实代码库里把活干到需要的水平;这一版的变化几乎全部发生在后训练阶段。强化学习从过去的收尾步骤变成了训练的主体部分,JetBrains 为此自建了数千个强化学习环境,整个训练过程运行了数百万次沙箱。训练任务新增了数学、竞赛编程、科学、工具调用和软件工程等类别,开放数据在进入训练前先过滤掉损坏的测试、无法验证的答案和难度失衡的题目。

成绩怎么看:强项很亮,短板也别藏

按 JetBrains 公布的同口径评测,Mellum2.1 在所列 17 项基准中有 15 项超过上一代,智能体编程是进步最大的一块。LiveCodeBench v6 它拿到 82.0,高于同级对手 Qwen3.5-9B 的 75.4;但在更考验端到端干活能力的 Terminal-Bench 2.1 上,它只有 17.4,反而低于 Qwen3.5-9B 的 21.7。速度是它更硬的卖点:架构没变,后训练没有拖慢推理,多 token 预测让单请求速度约为原来的 1.6 倍;官方在单张 H200 上的测试显示,高负载时它的吞吐接近 Qwen3.5-9B 的两倍。换句话说,它赢在快和便宜,输在最难的那类长链条任务上。

适合谁,不适合谁

最适合的用法,是把它放进智能体系统里当子智能体:定位失败测试的根因、起草修复、验证改动这类边界清楚的活,正是它训练时反复练的。其次是私有化部署:模型可以跑在自有硬件上,代码和数据不出内网,对合规要求高的团队比调用外部大模型更容易交代。GGUF 版本(面向 llama.cpp、Ollama 和 LM Studio)以及多 token 预测组件官方称即将提供,现阶段主要通过 Hugging Face 获取权重自行部署。不适合的期待也很明确:指望它单独扛起最复杂的端到端软件工程任务,或者把它当知识面最广的通用助手,Terminal-Bench 的分数已经给出了提醒。

推荐工具

更多