Zurück zu KI-Informationen
Das LongCat-Team von Meituan veröffentlicht VitaBench: eine praxisnahe, intelligente Bewertungsplattform mit Schwerpunkt auf Essenslieferung, Catering und Reisen.

Das LongCat-Team von Meituan veröffentlicht VitaBench: eine praxisnahe, intelligente Bewertungsplattform mit Schwerpunkt auf Essenslieferung, Catering und Reisen.

KI-Informationen Admin 102 Aufrufe

Das Meituan LongCat-Team hat VitaBench, eine Benchmark-Suite für intelligente Agenten, eingeführt. Dieses Framework wählt drei häufige Szenarien aus dem Alltag: Essenslieferung, Restaurantbesuch und Online-Reisen. Es abstrahiert 66 zusammensetzbare Tools und erstellt 100 szenarioübergreifende und 300 szenariospezifische Aufgaben. Das System misst systematisch Denkvermögen, Tool-Nutzung und adaptive Interaktionsfähigkeiten. Die Projektseite und das Dokument veröffentlichen gleichzeitig Code, Daten und Bestenlisten für eine einfache Replikation und Vergleichbarkeit.

Die neuesten Ergebnisse zeigen einen szenarioübergreifenden Durchschnitt von 30,0 % und einen szenarioübergreifenden Durchschnitt von 48,3 %. Die szenarioübergreifende Pass@4-Rate liegt bei etwa 60 %, und die Pass⁴-Rate (4/4 vollständiger Erfolg) liegt nahe bei 0 %. Diese Daten zeigen, dass erstklassige „Denk-/Nicht-Denk-Modelle“ zwar in bestimmten Bereichen Potenzial haben, ihnen jedoch in komplexen realen Umgebungen die Stabilität und Zuverlässigkeit auf Produktionsniveau fehlt und sie weiterhin mit Herausforderungen bei der langfristigen Planung, dem domänenübergreifenden Wechsel und der Zusammenarbeit mit mehreren Tools konfrontiert sind.

Häufig gestellte Fragen

F: Welche Funktionen und Szenarien deckt VitaBench ab?

A: Deckt Essenslieferung, Catering und Online-Reisen ab und bewertet Argumentation, Tool-Calling und adaptive Interaktion, einschließlich 66 Tools und 400 Aufgaben.

F: Wie sind Schlüsselindikatoren zu interpretieren?

A: Avg@4 ist die durchschnittliche Erfolgsrate von vier Versuchen; Pass@4 bedeutet, dass mindestens ein Versuch von vier erfolgreich war; Pass⁴ bedeutet, dass alle vier Versuche erfolgreich waren.

F: Warum ist szenarioübergreifendes Arbeiten schwieriger?

A: Es erfordert eine langfristige Planung und den Wechsel zwischen einem größeren Toolset und domänenübergreifenden Regeln, was leicht zu einer Fehlerhäufung und verringerter Stabilität führen kann.

F: Ist es Open Source?

A: Ja. Wir stellen eine Projektseite, ein Code-Repository und einen Hugging Face-Datensatz zur Verfügung und pflegen eine öffentliche Bestenliste.

F: Welche Erkenntnisse gibt es für die Umsetzung?

A: Die aktuelle Verfügbarkeit und Konsistenz intelligenter Agenten im realen Geschäft sind noch unzureichend, und die Modellierung der Toolabhängigkeit, die Robustheit und die Strategien zur Fehlerkorrektur müssen verbessert werden.

Empfohlene Tools

Mehr