Kolibri 是德国人工智能公司 Aleph Alpha 在 2026 年 10 月 3 日正式发布的开放权重模型。发布日恰逢德国统一日,Aleph Alpha 在官方博客《Kolibri Has Landed》中宣布,模型完整权重已上架 Hugging Face 的 Aleph-Alpha/Kolibri-1 仓库,采用 Apache 2.0 许可证,任何人都可以下载、本地部署并用于商业用途。它瞄准的也不是聊天榜单,而是公共管理、工业、航空航天这类受监管、数据不能离开内网的场景。
先看规格:身子大,胃口小
| 项目 | Kolibri 1 |
|---|---|
| 总参数 | 78.1B(781 亿) |
| 每 token 激活参数 | 约 3.46B |
| 架构 | MoE,50 层,384 个专家 |
| 上下文 | 最长 1,048,576 token,官方建议日常使用不超过 262,144 |
| 权重体积 | 约 78GB(FP8) |
| 许可证 | Apache 2.0 |
混合专家架构的关键在于,总参数决定知识容量,激活参数决定每一步的计算成本。Kolibri 每个 token 只调用约 3.5B 参数,推理开销接近一个小模型,但全部 781 亿参数必须常驻显存。官方给出的最低硬件是 2 张 A100 80GB、2 张 H100,或 1 张 H200、B200、B300——它能在企业自己的机房里跑,但不是能塞进笔记本的模型。
德语不是翻译出来的,是训出来的
Aleph Alpha 反复强调的一点是双语设计:预训练语料里德语占 21.3%,机器翻译只占约 6%,团队还专门为德语构词法做了分词器,理由是翻译文本会带上源语言的文化指纹。整个模型在德国和芬兰的基础设施上训练,预训练用了 20 万亿 token,从 200 万亿以上的原始数据中筛选而来。
按官方自评,Kolibri 的数学和代码表现放在同激活量级里相当靠前:AIME 2025 得分 96.9,GPQA Diamond 84.3,LiveCodeBench v6 85.9;德语综合得分 70.8,在同类开放 MoE 模型中排在前面。不过要提醒一句,这些数字全部来自厂商自己的评测,独立复现还没跟上;同一张表里,稠密模型 Qwen3.8 27B 的德语得分更高,只是它每个 token 的计算量约为 Kolibri 的 8 倍。
它真正想卖的是"主权"
Aleph Alpha 给"主权"下了两层定义:一是模型怎么造出来的——数据筛选、训练、评测全在欧洲法律框架内完成,团队称其从设计之初就对齐欧盟《人工智能法案》、通用人工智能行为准则和 GDPR;二是模型怎么交到客户手里——开放权重意味着客户可以把模型搬进自己的机房,供应商关停服务也影响不到已经部署的系统。
两个细节能看出它是冲着生产环境去的。一是拒答训练:配合 Merlin-Arthur 协议,上下文里没有依据时,Kolibri 被训练成直接说"不知道",而不是编一个答案,这对政务和合规场景比多答对两道题更重要。二是四档推理强度(无、低、中、高)和工具调用都已开放,官方提供基于 vLLM 的推理插件,部署路径是现成的。
下手之前先算三笔账
第一笔是显存账:78GB 权重起步,双卡 80GB 是入场券,先确认机房里有这笔预算。第二笔是语言账:它只在德语和英语上做深度优化,中文任务不在它的主场。第三笔是验证账:厂商自评只能当参考,真要放进受监管流程,先用自己的文档集跑一轮拒答准确率和长文档问答,再谈上线。对欧洲机构和与欧洲客户做生意的团队来说,Kolibri 的价值不在参数,而在于它把"数据不出境、模型可审计、部署不受制于人"这三件事一次打包了。