ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
ARC-AGI-2-Bestenliste aktualisiert: Tufa Labs führt mit 88,06 % und überspringt die 85-%-Bonuslinie

ARC-AGI-2-Bestenliste aktualisiert: Tufa Labs führt mit 88,06 % und überspringt die 85-%-Bonuslinie

KI-Informationen • Admin • • 5 Aufrufe

Die ARC-AGI-2-Bestenliste wurde am 9. Oktober 2026 aktualisiert: ARC Prize gab offiziell bekannt, dass Tufa Labs 88,06 % erreicht hat und damit Platz eins der ARC-AGI-2-Bestenliste der Saison ARC Prize 2026 belegt. Der Wert überspringt die 85-%-Linie – der eigens eingerichtete Bonuspool von 150.000 US-Dollar wird unter allen Teams aufgeteilt, die über 85 % kommen, und bislang ist nur das Spitzenteam über dieser Linie.

Wie groß ist der Abstand dahinter

Auf derselben Liste folgen Rabbithole mit 80,56 %, Yi-Chia Chen mit 77,22 %, Nubanana mit 77,08 % und _hans mit 67,64 % auf den Plätzen zwei bis fünf. Der Abstand zwischen Platz eins und zwei beträgt 7,5 Prozentpunkte – ungewöhnlich viel für eine Rangliste, auf der sonst um Zehntelpunkte gekämpft wird. ARC-Prize-Mitgründer François Chollet verwies am selben Tag ebenfalls darauf, dass der ARC-AGI-2-Wert auf Kaggle 88,06 % erreicht habe.

Wie dieser Wert einzuordnen ist

Zuerst zählt die Methodik: Die Kaggle-Rangliste wird mit rund der Hälfte der Testdaten berechnet, die endgültige Platzierung entscheidet die andere Hälfte – die Reihenfolge kann sich also noch ändern. 88,06 % ist ein Zwischenhoch, kein Endergebnis. Zweitens prüft ARC-AGI-2, ob ein System in unbekannten Aufgaben vor Ort das Muster findet, statt ein Aufgabenarchiv auswendig zu lernen; auch die Effizienz der Lösung zählt, sodass bloßes Hochskalieren von Rechenleistung sich nicht lohnt. Dass ein Wettbewerbssystem unter diesen Regeln 88 % erreicht, deutet darauf hin, dass Verbesserungen auf Methodenebene – wie Aufgaben zerlegt, Versuche durchgespielt und revidiert und Schlussfolgerungen terminiert werden – schneller in Punkte umgesetzt werden als schlicht größere Modelle.

Für allgemeine Leser ist nicht der Wert eines Teams entscheidend, sondern dass eine Referenzlinie verschoben wurde: Sobald Wettbewerbssysteme bei abstrakten Denkaufgaben 85 % überschreiten, lautet die nächste Frage, ob sich dieselbe Fähigkeit auf reale Aufgaben übertragen lässt – und ob dieser Wert Bestand hat, wenn die zweite Datenhälfte ausgewertet wird.

Empfohlene Tools

Mehr