Claude Opus 5.5 (High) ist am 28. September offiziell in die Agent Arena eingestiegen und hat auf Anhieb Platz 2 belegt — mit einem Netto-Verbesserungswert von +12,15 %, nur hinter dem Stallgefährten Fable 5.1 (Max). Damit hält Anthropic nun die ersten beiden Plätze dieser Agenten-Rangliste — sein größter Rivale ist es selbst.
Was die Agent Arena misst
Anders als Text-Ranglisten, die Einzelgespräche testen, bewertet die Agent Arena reale Agentenaufgaben: Modelle dürfen Websuche, Dateisystem und Terminal-Tools nutzen, um komplexe mehrstufige Workflows zu bewältigen. Die Rangliste basiert auf Millionen realer Langzeitaufgaben von Nutzern weltweit und misst per Causal Tracing die Leistung jedes Modells gegenüber einem „Durchschnittsmodell"; zu den Kennzahlen gehören die Netto-Verbesserungsrate und die Aufgabenbestätigungs-Erfolgsquote. Die +12,15 % von Opus 5.5 sind sein Vorsprung vor dem Durchschnitt in diesen „Arbeit erledigen"-Szenarien.
Bemerkenswert: Erst zwei Tage zuvor, am 26. September, hatte Opus 5.5 mit 1.509 Punkten die Text-Rangliste (Text Arena) angeführt. Zwei verschiedene Dimensionen in zwei Tagen zu gewinnen, deutet darauf hin, dass diese Iteration keine Ein-Punkt-Optimierung ist. Weiterführend
Für Anthropic ist es zudem das erste Mal, dass es auf beiden heimischen Ranglistendimensionen zugleich validiert wurde — Textfähigkeit und reale Agentenleistung, beide Beine stehen.
Die eigentliche Geschichte: Die „günstigere Flaggschiff"-Strategie ist validiert
Eingestuft wurde die High-Reasoning-Stufe, nicht die Vollgas-Max-Stufe. Die offiziellen Preise von Opus 5.5 liegen bei 4 US-Dollar pro Million Input-Token und 20 US-Dollar pro Million Output-Token — rund 20 % günstiger als der Vorgänger Opus 5 — während die Leistung laut Anthropic nahe an Fable 5.1 heranreicht. Dass eine „günstigere Flaggschiff-Stufe" auf einer praxisnahen Agenten-Rangliste Platz 2 belegt, ist eine crowdsourcte Validierung von Anthropics Produktstrategie durch Dritte: keine Punkte durch gestapelte Inferenzkosten jagen, sondern die Effizienz ins Modell selbst einbauen.
Das ist ein klares Marktsignal: Der Wettbewerb der Frontier-Modelle verlagert sich von „wer ist klüger" zu „wer ist bei gleicher Klugheit günstiger". Ranglisten wie die Agent Arena, die echte Aufgaben und echte Kosten messen, werden zunehmend zum Referenzrahmen für Einkäufer.
Was das für die Modellauswahl bedeutet
Wer ein Agentenmodell für sein Team auswählt, bekommt eine direkte Antwort: Wer Top-Agentenleistung braucht und auf die Kosten achtet, für den ist Opus 5.5 (High) eine der vom Ranking validierten Flaggschiff-Optionen mit dem besten Preis-Leistungs-Verhältnis; wer ohne Rücksicht auf Kosten die Spitze will, für den bleibt Fable 5.1 (Max) die Nummer eins. Aber nicht vergessen: Arena-Werte stammen aus Crowd-Abstimmungen und kausaler Inferenz und spiegeln die Leistung bei „durchschnittlichen Aufgaben" wider — für die eigenen Workloads ist eine selbst durchgeführte Evaluationsrunde vor der Entscheidung immer verlässlicher als eine Bestellung nach Rangliste.