ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Multi-Agenten-Teams im Test: Kosten bis zu 5,1-mal höher, Qualität kaum besser

Multi-Agenten-Teams im Test: Kosten bis zu 5,1-mal höher, Qualität kaum besser

KI-Informationen • Admin • • 10 Aufrufe

Multi-Agenten-Teams lieferten keinen Qualitätsgewinn, der ihre Kosten rechtfertigt. Am 11. Oktober 2026 veröffentlichte das Evaluierungsunternehmen Vals AI auf seinem Programmier-Benchmark Vibe Code Bench einen direkten Vergleich von Einzel- und Teammodus: GPT-6 Sol und Claude Opus 5.5 erledigten dieselben Aufgaben zunächst allein und dann im Team. Die Teams kosteten das 1,8- bis 5,1-Fache eines einzelnen Agenten, und von vier Vergleichen ergab nur einer eine statistisch signifikante Qualitätsverbesserung.

Was genau verglichen wurde

Bei Vibe Code Bench bauen Modelle aus einer Vorgabe lauffähige Anwendungen, die nach Vollständigkeit bewertet werden. Vals AI ließ beide Modelle mit zwei Reasoning-Stufen laufen, mittel und maximal, und verglich auf jeder Stufe einen Agenten mit einem Team. Das einzige signifikante Ergebnis lieferte GPT-6 Sol bei mittlerer Reasoning-Stufe, wo das Team 7,3 Punkte besser abschnitt. Bei maximaler Reasoning-Stufe zeigte der Teammodus bei keinem der beiden Modelle einen messbaren Vorteil. Auf der höchsten Stufe überschneiden sich die Effekte von längerem Nachdenken eines einzelnen Modells und zusätzlichen Helfern weitgehend, während sich die Rechnungen um ein Vielfaches unterscheiden.

Von 1 auf 100 Agenten: Die Kurve flacht schnell ab

Anthropic führte für den Systembericht zu Claude Opus 5.5 ein ähnliches Skalierungsexperiment durch und erhöhte die Zahl der Agenten pro Aufgabe von 1 auf 100. Die Kurve stieg steil an und flachte dann ab:

Aufgabe1 Agent1030100
Wissensdatenbank0,530,700,710,74
Lean-Theorembeweise0,390,660,660,68

Der Schritt von 1 auf 10 Agenten half sichtbar. Von 10 auf 100 bewegten sich beide Werte nur um wenige Hundertstel. Claude Fable 5.1 profitierte bei den Theorembeweisen stärker von der Skalierung, blieb insgesamt aber hinter Opus 5.5 zurück, und sein Wert bei der Wissensdatenbank sank zwischen 30 und 100 Agenten sogar leicht. Der verlässlichere Vorteil eines großen Teams war, dasselbe Niveau schneller zu erreichen, nicht ein höheres. Auch in Anthropics ProgramBench-Tests ging dieses Tempo mit höherem Token-Verbrauch einher.

Was Teams wirklich kaufen, ist Zeit

Der OpenAI-Forscher Noam Brown lieferte in einem Podcast eine Erklärung, die zu beiden Datensätzen passt: Multi-Agenten-Setups kaufen vor allem Geschwindigkeit, nicht Antwortqualität. Vier Agenten erledigten Aufgaben etwa doppelt so schnell bei etwa doppelten Kosten. Aufgaben, die sich in parallele Teile zerlegen lassen, etwa Webrecherche und Mathematik, profitieren am meisten; Aufgaben ohne Parallelisierung, etwa das Schreiben eines Romans, gewinnen durch eine Menschenmenge nichts. Der OpenAI-Codex-Entwickler Eric Provencher bezeichnet die Mehrausgaben als Koordinationssteuer: Agenten vertrauen den Ergebnissen der anderen nicht vollständig, prüfen also nach und wiederholen Tool-Aufrufe, und schon die Prüfung selbst verbrennt Tokens.

Wer für Agenten bezahlt, sollte zuerst selbst rechnen

Für Teams, die Agenten einkaufen und einsetzen, folgen daraus drei Punkte. Teamarbeit lohnt sich, wenn sich eine Aufgabe in unabhängige parallele Blöcke zerlegen lässt und Lieferzeit selbst Geld wert ist. Handelt es sich um eine einzige Schlussfolgerungskette oder läuft das Modell bereits mit maximaler Reasoning-Stufe, zahlt sich ein höheres Reasoning-Budget meist eher aus als mehr Personal. Und vor dem Rollout gehört ein Vergleich von Einzel- und Teammodus an den eigenen echten Aufgaben dazu, mit Kosten pro Ergebnis statt nur Gesamt-Tokens im Blick. Die Branche macht Orchestrierung im großen Maßstab zum Verkaufsargument, etwa mit Claude Managed Agents, die in einem Lauf bis zu 1000 Agenten koordinieren. Doch Orchestrierung beantwortet nur, ob Agenten gleichzeitig laufen können. Ob sie es sollten, hängt weiterhin davon ab, wie parallel die Aufgabe wirklich ist.

Empfohlene Tools

Mehr