ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
多智能体团队实测:成本涨到 5.1 倍,质量却几乎没动

多智能体团队实测:成本涨到 5.1 倍,质量却几乎没动

AI资讯 • Admin • • 10 次浏览

多智能体团队没有换来与成本相称的质量提升。2026 年 10 月 11 日,评测机构 Vals AI 在编程评测 Vibe Code Bench 上公布了单智能体与团队模式的对比结果:GPT-6 Sol 和 Claude Opus 5.5 分别独自完成任务、再组队完成同一批任务,团队开销涨到单人的 1.8 倍至 5.1 倍,四组对比里只有一组的质量提升达到统计显著。

这次测试具体比了什么

Vibe Code Bench 让模型按需求从零做出可运行的应用,再按完成度打分。Vals AI 给两个模型各设了中等和最高两档推理强度,逐档比较一个人干和一群人干的差别。唯一显著的一组出现在中等推理强度下的 GPT-6 Sol,团队比单人高出 7.3 分;一旦切到最高推理强度,两个模型的团队模式都没有测出真实优势。这意味着在最高档位上,模型自己多想一会儿,和多叫几个帮手,效果基本重叠,账单却完全不是一个量级。

智能体从 1 个加到 100 个,曲线很快变平

Anthropic 在 Claude Opus 5.5 的系统报告中做过同方向的规模实验,把参与任务的智能体数量从 1 个逐步加到 100 个,结果是典型的先陡后平:

任务1 个智能体10 个30 个100 个
知识库任务0.530.700.710.74
Lean 定理证明0.390.660.660.68

从 1 个加到 10 个,提升看得见;从 10 个加到 100 个,两项任务都只挪动了零点几分。Claude Fable 5.1 在定理证明任务上随规模提升更明显,但总分仍低于 Opus 5.5,知识库任务从 30 个加到 100 个时分数还略有下降。大团队更稳定的收益是更快达到同一水平,而不是达到更高水平,Anthropic 的 ProgramBench 测试里,提速同样伴随着更高的 token 消耗。

团队买到的主要是时间

OpenAI 研究员 Noam Brown 在一档播客中给出的解释与这两组数据对得上:多智能体主要买到的是速度,不是答案质量。四个智能体能把任务做到约两倍快,成本也约两倍;能拆开并行的任务,比如联网检索和数学题,受益最明显,不能并行的任务,比如写小说,人再多也帮不上忙。OpenAI 的 Codex 开发者 Eric Provencher 把多余的开销形容为协调税:智能体之间不会完全信任彼此的产出,会重复核对、重复调用工具,核对本身也在烧 token。

正在给智能体付费的团队,先算这笔账

这批结果对正在采购和部署智能体的团队有三个直接提示。任务能拆成互不依赖的并行块、而且交付时间本身值钱时,组队是合理的;任务是单线推理、或者模型已经开到最高推理强度时,先加推理预算通常比先加人数划算;正式上线前,用自己的真实任务做一次单人与团队的对照,盯住每份交付物的成本,而不是只看总 token。行业正在把大规模编排做成卖点,例如 Claude Managed Agents 已能单次编排多达 1000 个智能体,但编排能力解决的是能不能同时跑,值不值仍然取决于任务本身吃不吃并行。

推荐工具

更多