ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
DeepSeek V4.1 Flash verbessert ARC-AGI-Werte: Abstraktes Schlussfolgern steigt, Kosten pro Aufgabe auch

DeepSeek V4.1 Flash verbessert ARC-AGI-Werte: Abstraktes Schlussfolgern steigt, Kosten pro Aufgabe auch

KI-Informationen • Admin • • 4 Aufrufe

Die neuesten Ergebnisse von DeepSeek V4.1 Flash wurden am 6. Oktober 2026 von ARC Prize veröffentlicht: In der ARC-AGI-(Verified)-Auswertung vergab die unabhängige Bewertungsorganisation 94,5 % auf ARC-AGI-1 und 72,9 % auf ARC-AGI-2. Das abstrakte Schlussfolgern ist einen weiteren Schritt vorangekommen, doch die Kosten pro gelöster Aufgabe sind ebenfalls spürbar gestiegen.

Die Zuwächse im Detail

Gegenüber den besten Ergebnissen des Vorgängers V4 Flash in derselben Auswertung stieg ARC-AGI-1 um 5,5 Prozentpunkte und ARC-AGI-2 um 11,5 Prozentpunkte. ARC-AGI belohnt kein Auswendiglernen: Jede Aufgabe zeigt nur wenige Eingabe-Ausgabe-Beispiele und verlangt vom Modell, die Transformationsregel selbst zu erschließen und auf ein neues, nie gesehenes Raster anzuwenden; ARC-AGI-2 verlangt zusätzlich, mehrere miteinander verwobene Regeln gleichzeitig zu handhaben, weshalb der Zuwachs in der zweiten Generation mehr aussagt. Die Kostenseite erzählt die andere Hälfte: rund 0,07 Dollar pro Aufgabe auf ARC-AGI-1 und rund 0,13 Dollar auf ARC-AGI-2, ein Mehrfaches der Kosten, die zu den Bestwerten der vorigen Generation gehörten. Anders gesagt: Dieser Fortschritt wurde mit großzügigerem Einsatz von Reasoning-Rechenleistung erkauft; er ist kein Gratisessen.

Warum die Kostenzahlen so wichtig sind wie die Werte

Dass ARC Prize Kosten neben Genauigkeit veröffentlicht, ist selbst eine Haltung: Ein Benchmark, der Werte ohne Rechnung meldet, hat für Praktiker, die Modelle tatsächlich betreiben, begrenzten Nutzen. Für Entwickler bedeutet ein ARC-AGI-2-Wert von 72,9 % eine weitere Option für unbekannte regelbasierte Aufgaben, bei Kosten pro Aufgabe von weiterhin nur einem guten Dutzend Cent — eine andere Liga als die Reasoning-Rechnungen von mehreren Dollar bei führenden geschlossenen Modellen. Sobald das Aufgabenvolumen jedoch riesig wird, muss ein vervielfachter Preis in die Gesamtrechnung, besonders bei Agenten-Workflows, die Genauigkeit durch wiederholtes Probieren stapeln und deren Rechnung am schnellsten wächst.

Zwei Vorsichtshinweise zu diesen Zahlen

Erstens stammen die Ergebnisse aus dem eigenen verifizierten Satz der Bewertungsorganisation unter festen Einstellungen; wer Prompting oder Reasoning-Stufe ändert, bewegt Wert und Kosten zugleich, sie lassen sich also nicht als Versprechen für ein Geschäftsszenario lesen. Zweitens bedeutet Stärke im abstrakten Schlussfolgern keine Führung bei Alltagsarbeit wie Code oder langen Dokumenten; die Modellauswahl braucht weiterhin Tests mit dem eigenen Aufgabensatz. Das eigentliche Signal: Chinas Open-Model-Lager rückt in der härtesten allgemeinen Reasoning-Auswertung weiter an die Spitzengruppe heran, und der Wettbewerb verlagert sich vom reinen Punktejagen hin zur Frage, wie viel Schlussfolgern ein Dollar kauft.

Empfohlene Tools

Mehr