ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Artificial Analysis testet GPT-6 Sol und Luna: Kosten halbiert, Ergebnisse gemischt

Artificial Analysis testet GPT-6 Sol und Luna: Kosten halbiert, Ergebnisse gemischt

KI-Informationen Admin 1 Aufrufe

Am 22. September 2026 hat die unabhängige KI-Benchmark-Organisation Artificial Analysis ihren Testbericht zu GPT-6 Sol und GPT-6 Luna veröffentlicht — die erste vollständige unabhängige Bewertung seit dem Start der beiden Modelle. Die Preise wurden tatsächlich halbiert, doch die Leistungsbilanz ist nicht einseitig: Manche Benchmarks verbessern sich, andere verschlechtern sich.

Die Kernmessung von Artificial Analysis: Ein kompletter Durchlauf des Intelligence Index kostet bei GPT-6 Sol (maximale Rechenleistung) etwa 1,06 US-Dollar pro Aufgabe — fast die Hälfte der 1,99 US-Dollar von GPT-5.6 Sol. Luna sinkt von 0,18 auf 0,07 US-Dollar pro Aufgabe, ein Rückgang von rund 60 Prozent. Die Gesamtpunktzahl des Intelligence Index liegt etwa auf dem Niveau der Vorgängergeneration, doch im Detail gehen die Wege auseinander: Bei Coding-Agenten legt Sol leicht zu, Luna leicht nach — und bei Wissensarbeits-Benchmarks geben beide nach.

Die Preissenkung ist echt: API-Preise halbiert

Sols Ein-/Ausgabepreise fallen von 4/20 auf 2/10 US-Dollar pro Million Token, Luna von 0,20/1,20 auf 0,10/0,50 US-Dollar. Der 90-Prozent-Rabatt auf Cache-Lesezugriffe und der 25-Prozent-Aufschlag auf Cache-Schreibzugriffe bleiben bestehen. Bemerkenswert: Beide Modelle verbrauchen pro Aufgabe sogar etwas mehr Output-Token (Sol: 31k statt 29k) — die Ersparnis stammt allein aus der Preissenkung. Getestet wurden die GPT-6-Modelle Sol und Luna, die OpenAI am 22. September vorgestellt hat (in unserem früheren Launch-Bericht bereits behandelt).

Zugelegt: Coding und Halluzinationskontrolle

Im Coding Agent Index von Artificial Analysis (gemessen in OpenAIs eigener Codex-Umgebung) erreicht Sol 57 Punkte — 2 mehr als GPT-5.6 Sol; Terminal-Bench 4.0 steigt von 37 auf 43 Prozent. Auch die Halluzinationskontrolle verbessert sich deutlich: Im Wissens-Benchmark AA-Omniscience sinkt Sols Halluzinationsrate von 92 auf 60 Prozent, Lunas von 93 auf 77 Prozent. Sols Rezept ist Vorsicht: Die Beantwortungsquote fällt von 99 auf 83 Prozent, falsche Antworten gehen um etwa ein Viertel zurück — doch die Genauigkeit sinkt ebenfalls, von 59 auf 54 Prozent.

Nachgegeben: Wissensarbeits-Benchmarks bei beiden rückläufig

Bei GDPval-AA v2.1 (wirtschaftlich wertvolle Aufgaben aus 44 Berufen) verliert Sol rund 100 Elo-Punkte, Luna etwa 75; Luna büßt zudem rund 45 Elo-Punkte bei AA-Briefcase v1.1 ein, einer mehrwöchigen Wissensarbeits-Evaluation (Sol bleibt stabil). Nach manueller Prüfung Hunderter Ausgaben führt das Testteam die Rückgänge vor allem auf kürzere Arbeitsergebnisse zurück, die geforderte Rubrik-Elemente auslassen — die Modelle schreiben zu knapp, um Token zu sparen.

Wählen nach Arbeitslast, nicht nur nach Preisschild

Für Code-Aufgaben in Coding-Agenten wie Codex ist Sol die bessere Wahl: höhere Punktzahl bei 2,99 US-Dollar pro Aufgabe — halb so teuer wie der Vorgänger — und genau auf der Pareto-Front von Leistung und Kosten. Für hochvolumige Routinearbeit wie Extraktion und Zusammenfassung bleibt Lunas Kostenvorteil überzeugend; bei Wissensarbeit mit langen Dokumenten und vollständigen Liefergegenständen sollte man die Vollständigkeit der Ausgaben erst mit kleinem Traffic prüfen, bevor man vollständig umstellt.

Die Senkung erfolgte am selben Tag, an dem Anthropic Claude Opus 5.5 mit 20 Prozent Preisnachlass vorstellte — beide Frontier-Labore zückten innerhalb von 24 Stunden die Preiskarte. Das Fazit von Artificial Analysis fällt nüchtern aus: OpenAI hat sich ein großes Stück der Kosteneffizienz-Front gesichert, doch billiger heißt nicht überall stärker. Entscheidend bei der Modellauswahl ist, ob die eigene Arbeitslast auf der Gewinnerseite oder auf der Verliererseite liegt.

Empfohlene Tools

Mehr