返回AI资讯
美团 LongCat 团队发布 VitaBench:聚焦外卖、餐饮与出行的真实场景智能体评测

美团 LongCat 团队发布 VitaBench:聚焦外卖、餐饮与出行的真实场景智能体评测

AI资讯 Admin 102 次浏览

美团 LongCat 团队推出智能体评测集 VitaBench,选取外卖配送、餐饮到店与在线出行三大高频生活服务场景,抽象出 66 个可组合工具,构建 100 个跨场景与 300 个单场景任务,系统衡量推理、工具使用与自适应交互能力。项目页与论文同步公开代码、数据与榜单,便于复现与对比。

最新结果显示,跨场景 Avg@4 为 30.0%,单场景 Avg@4 为 48.3%;跨场景 Pass@4 约 60%,Pass⁴(4/4 全部成功)接近 0%。这些数据表明,尽管顶级“思考型/非思考型”模型在个别维度具潜力,但在复杂真实环境中的稳定性与生产级可靠性仍不足,仍需面对长程规划、跨域切换与多工具协同的挑战。

常见问题

Q:VitaBench 覆盖哪些能力与场景?

A:覆盖外卖、餐饮与在线出行,评测推理、工具调用与自适应交互,含 66 种工具与 400 个任务。

Q:关键指标怎么解读?

A:Avg@4 为四次尝试的平均成功率;Pass@4 为四次中至少一次成功;Pass⁴ 为四次全成。

Q:为何跨场景更难?

A:需要在更大工具集合与跨域规则中做长程规划与切换,易引发错误累积与稳定性下降。

Q:是否开源?

A:是。提供项目页、代码库与 Hugging Face 数据集,并维护公开榜单。

Q:对落地有什么启示?

A:当前智能体在真实业务的可用性与一致性尚不足,需强化工具依赖建模、鲁棒性与纠错策略。

推荐工具

更多