Meituan LongCatチームは、インテリジェントエージェントベンチマークスイートであるVitaBenchをリリースしました。このフレームワークは、フードデリバリー、レストランでの食事、オンライン旅行という3つの高頻度生活サービスシナリオを選択し、66のコンポーザブルツールを抽象化し、100のクロスシナリオタスクと300のシングルシナリオタスクを構築します。このシステムは、推論、ツールの使用、そして適応型インタラクション能力を体系的に測定します。プロジェクトページと論文では、コード、データ、リーダーボードが同時に公開されており、容易に複製・比較できます。
最新の結果では、クロスシナリオAvg@4は30.0%、シングルシナリオAvg@4は48.3%でした。クロスシナリオPass@4率は約60%、Pass⁴(4/4完全成功)率はほぼ0%です。これらのデータは、トップクラスの「思考型/非思考型」モデルは特定の分野で潜在能力を有しているものの、複雑な実世界環境における安定性と実用レベルの信頼性に欠けており、長期計画、クロスドメインスイッチング、マルチツールコラボレーションにおいて依然として課題を抱えていることを示しています。
よくある質問
Q: VitaBench はどのような機能とシナリオをカバーしていますか?
A: 食品の配達、ケータリング、オンライン旅行をカバーし、66 個のツールと 400 個のタスクを含む推論、ツールの呼び出し、適応型インタラクションを評価します。
Q: 主要指標をどのように解釈すればよいですか?
A: Avg@4 は 4 回の試行の平均成功率です。Pass@4 は 4 回の試行のうち少なくとも 1 回は成功したことを意味します。Pass⁴ は 4 回の試行すべてが成功したことを意味します。
Q: クロスシナリオの方が難しいのはなぜですか?
A: 長期的な計画と、より大きなツール セットとドメイン間ルールの切り替えが必要となり、エラーが蓄積されやすく、安定性が低下する可能性があります。
Q: オープンソースですか?
A: はい。プロジェクトページ、コードリポジトリ、Hugging Faceデータセットを提供しており、公開リーダーボードも維持しています。
Q: 実装に関してどのような洞察がありますか?
A: 実際のビジネスにおけるインテリジェント エージェントの現在の可用性と一貫性はまだ不十分であり、ツール依存性のモデリング、堅牢性、およびエラー修正戦略を強化する必要があります。