ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
GPT-6 Sol (Max) startet in der Agent Arena: +7,7 % auf Platz 6, nur 0,76 $ pro Aufgabe

GPT-6 Sol (Max) startet in der Agent Arena: +7,7 % auf Platz 6, nur 0,76 $ pro Aufgabe

KI-Informationen • Admin • • 12 Aufrufe

Am 25. September hat Arena (ehemals LMArena) sein Leaderboard aktualisiert: GPT-6 Sol (Max) ist offiziell in die Agent Arena eingezogen – mit +7,7 % Netto-Verbesserung auf Platz 6 von 44 Modellen, auf Basis von über 4.000 echten agentischen Sessions. Zwei Tage nach dem Release von GPT-6 Sol ist das die erste vollwertige Drittparteien-Bewertung aus der Community.

Das Zeugnis: stärker als der Vorgänger – und günstiger

Arenas offizielle Einordnung nannte mehrere Schlüsselzahlen. GPT-6 Sol (Max) erreicht +7,7 % Netto-Verbesserung, 1,5 Prozentpunkte mehr als GPT-5.6 Sol (xHigh) mit +6,2 %, und klettert von Platz 8 auf Platz 6 – bei halbiertem Tokenpreis gegenüber dem Vorgänger.

Beim Sub-Signal „Confirmed Success" (bestätigter Erfolg) kommt Sol (Max) auf +11,4 % und Platz 4; 5.6 Sol schaffte hier nur +2,9 % auf Platz 20. Das neue Modell ist also nicht nur insgesamt stärker – die größten Fortschritte gab es genau bei der wichtigsten Agenten-Kennzahl: Aufgaben tatsächlich zu Ende zu bringen.

Die eigentliche Nachricht: Die Kosten-Frontier wurde neu gezeichnet

Die Pareto-Frontier der Agent Arena sieht nun so aus: Claude Fable 5.1 (Max) +13,8 % bei 4,06 $ pro Aufgabe; GPT-6 Astra (Max) +10,85 % bei 2,90 $; Claude Opus 5 (High) +9,8 % bei 2,16 $; Claude Fable 5 (High) +8,3 % bei 1,71 $; GPT-6 Sol (Max) +7,68 % bei 0,76 $ pro Aufgabe.

Sol (Max) liegt nur 0,6 Prozentpunkte hinter Fable 5 (High), kostet pro Aufgabe aber 56 % weniger. Für Teams, die täglich Tausende Agenten-Aufgaben laufen lassen, ist diese Kombination attraktiver als eine einzelne Spitzenplatzierung – Arena selbst merkte an, das Update habe „die Pareto-Frontier der Agent Arena neu gezeichnet" und die Median-Kosten auf das 0,76-$-Niveau gedrückt.

Hintergrund: Release erst vor zwei Tagen

Am 23. September hatte OpenAI GPT-6 Sol und Luna vorgestellt: das Trainingsrezept des Flaggschiffs Astra, heruntergebrochen auf schnellere, günstigere Stufen, mit API-Preisen 50 % unter den GPT-5.6-Aktionspreisen. Sol ist die Flaggschiff-Stufe der GPT-6-Familie, gedacht für Coding, lange Aufgaben und die härtesten Jobs. Dieses Arena-Debüt untermauert weitgehend die offizielle Behauptung „smarter pro Token" – zumindest bei agentischen Aufgaben bewegen sich Leistung und Kosten beide in die richtige Richtung.

Die Einschätzung für Entwickler

Wer ein Modell für Agenten auswählt, bekommt eine klare Antwort: Für absolute Spitzenleistung führen weiter Fable 5.1 (Max) und Astra (Max); gemessen an „erfolgreichen Aufgaben pro Dollar" ist Sol (Max) derzeit die preiswerteste Flaggschiff-Option an der Frontier. Ein Hinweis: Arena ist ein Crowdsourcing-Signal aus Community-Blindtests, das Siege und Niederlagen bei echten Nutzeraufgaben abbildet – kein Labor-Benchmark. Mit weiteren Stimmen kann sich das Ranking noch verschieben.

Claude Opus 5.5 ist da: 40 % günstiger, optimiert für ultralange Coding-Sessions war Anthropics Antwort in derselben Woche – der Kampf um die Agenten-Rangliste hat gerade erst begonnen.

Empfohlene Tools

Mehr