L'équipe Meituan LongCat a lancé VitaBench, une suite de benchmarks pour agents intelligents. Ce framework sélectionne trois scénarios de service de vie à haute fréquence : la livraison de repas, la restauration sur place et les voyages en ligne. Il extrait 66 outils composables et construit 100 tâches inter-scénarios et 300 tâches mono-scénarios. Le système mesure systématiquement le raisonnement, l'utilisation des outils et les capacités d'interaction adaptative. La page du projet et l'article publient simultanément le code, les données et les classements pour faciliter la réplication et la comparaison.
Les derniers résultats montrent une moyenne de 30,0 % pour tous les scénarios et de 48,3 % pour un seul scénario. Le taux de réussite de 4 scénarios est d'environ 60 %, et le taux de réussite (4/4) est proche de 0 %. Ces données indiquent que, si les modèles « pensant/non-pensant » de haut niveau présentent un potentiel dans certains domaines, ils manquent de stabilité et de fiabilité en production dans des environnements réels complexes, et restent confrontés à des défis en matière de planification à long terme, de commutation inter-domaines et de collaboration multi-outils.
Questions fréquemment posées
Q : Quelles capacités et quels scénarios VitaBench couvre-t-il ?
A : Couvre la livraison de nourriture, la restauration et les voyages en ligne, et évalue le raisonnement, l'appel d'outils et l'interaction adaptative, y compris 66 outils et 400 tâches.
Q : Comment interpréter les indicateurs clés ?
A : Avg@4 est le taux de réussite moyen de quatre tentatives ; Pass@4 signifie au moins une réussite sur quatre tentatives ; Pass⁴ signifie que les quatre tentatives ont été réussies.
Q : Pourquoi le scénario croisé est-il plus difficile ?
R : Cela nécessite une planification à long terme et des basculements entre un ensemble d’outils plus vaste et des règles inter-domaines, ce qui peut facilement conduire à une accumulation d’erreurs et à une diminution de la stabilité.
Q : Est-ce open source ?
R : Oui. Nous fournissons une page de projet, un référentiel de code et l'ensemble de données Hugging Face, et maintenons un classement public.
Q : Quelles sont les perspectives de mise en œuvre ?
R : La disponibilité et la cohérence actuelles des agents intelligents dans les entreprises réelles sont encore insuffisantes, et la modélisation de la dépendance des outils, la robustesse et les stratégies de correction des erreurs doivent être renforcées.