ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Baseten 实测:Claude 写出的推理引擎比 vLLM 快 90%

Baseten 实测:Claude 写出的推理引擎比 vLLM 快 90%

AI资讯 • Admin • • 20 次浏览

推理引擎能不能由 AI 智能体从零写出来,并压过成熟的通用框架?2026年10月2日更新的 Baseten 工程博客给出了一次实测:工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B 从零构建定制推理引擎,在 NVFP4 精度、单张 NVIDIA B200 上运行,命名为 VibeQwen。MetaInfer 采用 skills-only 框架,无需模型后训练。

核心数据:单流快 90%,首 token 延迟降到不足一半

VibeQwen 单流解码达到 1792 TPS,经过调优的 vLLM 0.25.1 为 943 TPS,快了 90%;首 token 延迟 12ms 对比 28ms,相当于 2.33 倍改善;并发 32 时输出吞吐 10307 TPS,vLLM 为 6030 TPS,高出 71%。对照基准是调优后的 vLLM,而非默认配置。

实验目标是全面指标超过 vLLM 20% 且不损精度,精度以 BF16 为基准。Claude 基本自主工作约一周,消耗约 17 亿 token(多为缓存输入)和约 200 个 B200 小时,前几天就追平了 vLLM;当精度出现细微数值差异时,需人工批准才能继续。

第二个实验 Sammie:复用知识库后更快也更便宜

Baseten 随后做了第二个实验 Sammie:为图像分割模型 SAM 3.1 构建推理服务,在单张 H100 上达到 91 张/秒,比 Meta 官方参考服务器吞吐高 50%,只用几天和约 2 亿 token。之所以更快更省,是因为它复用了第一个实验沉淀的知识库。两个实验的成本从 Sammie 的数百美元到 VibeQwen 的数千美元不等。这种经验可复用的特性,可能比单次成绩更值得关注。

边界与前提:仍是实验,且必须先锁死精度约束

两个引擎目前都还是实验性质,未承载生产流量。Baseten 也说明,实验允许智能体参考 vLLM、TensorRT-LLM 的现成内核,不像原论文那样完全隔离源码。这类自动优化能成立有两个前提:指标可量化、正确性可对全精度参考实现做数值验证,改进才有客观标尺;精度约束必须事先锁死,否则智能体会钻空子,例如只输出同一个字符刷指标。

通用引擎的短板,正是定制优化的空间

vLLM、SGLang、TensorRT-LLM 胜在通用易用,但对特定的「模型+硬件+负载」组合通常不是最优。推理支出规模巨大,个位数百分比的提升在大规模部署下就是数百万美元,这正是专用引擎的用武之地。

推荐工具

更多