美团 LongCat 团队推出智能体评测集 VitaBench,选取外卖配送、餐饮到店与在线出行三大高频生活服务场景,抽象出 66 个可组合工具,构建 100 个跨场景与 300 个单场景任务,系统衡量推理、工具使用与自适应交互能力。项目页与论文同步公开代码、数据与榜单,便于复现与对比。
最新结果显示,跨场景 Avg@4 为 30.0%,单场景 Avg@4 为 48.3%;跨场景 Pass@4 约 60%,Pass⁴(4/4 全部成功)接近 0%。这些数据表明,尽管顶级“思考型/非思考型”模型在个别维度具潜力,但在复杂真实环境中的稳定性与生产级可靠性仍不足,仍需面对长程规划、跨域切换与多工具协同的挑战。
常见问题
Q:VitaBench 覆盖哪些能力与场景?
A:覆盖外卖、餐饮与在线出行,评测推理、工具调用与自适应交互,含 66 种工具与 400 个任务。
Q:关键指标怎么解读?
A:Avg@4 为四次尝试的平均成功率;Pass@4 为四次中至少一次成功;Pass⁴ 为四次全成。
Q:为何跨场景更难?
A:需要在更大工具集合与跨域规则中做长程规划与切换,易引发错误累积与稳定性下降。
Q:是否开源?
A:是。提供项目页、代码库与 Hugging Face 数据集,并维护公开榜单。
Q:对落地有什么启示?
A:当前智能体在真实业务的可用性与一致性尚不足,需强化工具依赖建模、鲁棒性与纠错策略。