Claude Opus 5.5 erobert Platz 1 der Text Arena – 1509 Punkte, neuer Rekord für Textmodelle Erst vier Tage auf dem Markt, und schon thront Claude Opus 5.5 über der Textmodell-Arena. Am 26. September veröffentlichte der offizielle LMArena-Account auf X die neueste Rangliste: Claude Opus 5.5 (High) steigt mit 1509 Punkten auf Platz 1 der Text Arena ein – die höchste Punktzahl, die dort je vergeben wurde.
Die Text Arena ist LMArenas Textmodell-Rangliste. Sie entsteht aus anonymen Duell-Abstimmungen von Nutzern weltweit und deckt Mathe, Coding, kreatives Schreiben und mehr ab. Anders als statische Einmal-Benchmarks misst sie eher, „welches Modell sich in der echten Nutzung stärker anfühlt". Die 1509 Punkte (Fehlerspanne ca. ±12) übertreffen den bisherigen Spitzenreiter – nur vier Tage nach dem offiziellen Launch am 22. September.
Das günstigere Modell sitzt auf dem Thron
Das Bemerkenswerte an diesem ersten Platz ist der Preis. Opus 5.5 kostet per API 4 US-Dollar pro Million Input-Token und 20 US-Dollar pro Million Output-Token, liegt leistungsmäßig nahe am Flaggschiff Fable 5.1 und bietet ein Kontextfenster von einer Million Token sowie bis zu 128.000 Token Ausgabe am Stück. Zum Vergleich: OpenAIs Flaggschiff GPT-6 Astra kostet 10 / 50 US-Dollar. Das Ranglisten-erste Modell gehört also gleichzeitig zu den günstigsten an der Frontier – „stärkstes" und „günstigstes" fallen selten zusammen, diesmal ist es die Ausnahme. (Alle Launch-Preise und Specs stehen in unserer früheren Claude-Opus-5.5-Launch-Analyse.)
Was die Rangliste aussagt – und was nicht
Trotzdem ist dieser erste Platz mit Vorsicht zu genießen. Die Text Arena ist im Kern eine Abstimmung menschlicher Präferenzen: Sie spiegelt das gefühlte Gesamterlebnis wider, ist aber keine harte Kennzahl für eine einzelne Fähigkeit, und die Punktzahlen werden mit weiteren Stimmen schwanken. Für normale Nutzer liegt der praktische Nutzen in der Modellauswahl: Wer ein Modell für lange Coding-Sessions oder Agenten-Workloads sucht, bekommt mit Opus 5.5 gerade das „Crowd-votete Nr. 1"- und das „günstigste Flaggschiff"-Etikett zugleich – die Kosten eines Versuchs waren nie niedriger. Das heißt nicht „in allem das Beste": Bei Terminal-Agenten- und Mathe-Reasoning-Benchmarks bleiben die Konkurrenten dicht dran. Ranglisten ändern sich; der Preiskampf wird wohl nicht aufhören.