ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Mercor-Studie zur Buchhaltung: Frontier-Modelle lösen alle Aufgaben, lizenzierte Buchhalter im Schnitt 37 Prozent

Mercor-Studie zur Buchhaltung: Frontier-Modelle lösen alle Aufgaben, lizenzierte Buchhalter im Schnitt 37 Prozent

KI-Informationen • Admin • • 5 Aufrufe

Mercors Vergleichsstudie zur Buchhaltung wurde am 2. Oktober 2026 von Mercor im offiziellen Blog veröffentlicht: Zwölf Nachwuchs-Buchhalter, alle lizenzierte Wirtschaftsprüfer mit im Schnitt fünfeinhalb Jahren Erfahrung, traten gegen Frontier-Modelle an denselben Monatsabschluss-Aufgaben an. Das Ergebnis ist deutlich: Die Buchhalter erreichten im Schnitt etwa 37 Prozent, während Frontier-Modelle wie Claude Opus 5 in allen 20 Versuchen die volle Punktzahl holten und jede Aufgabe in unter zehn Minuten lösten, gegenüber 30 bis 180 Minuten bei den Menschen.

Kein Quiz, sondern Aktenarbeit auf Zahlensuche

Die Aufgaben stammen aus Mercors früherem Benchmark APEX-Accounting: vier realistische Monatsabschluss-Szenarien. Die Teilnehmenden mussten sich durch Arbeitsdateien einer Firma graben, die richtigen Zahlen finden, rechnen und eine Ergebnistabelle liefern. In den Szenarien steckten leicht zu übersehende, aber praxisnahe Anforderungen, die sich gegenseitig verstärkten, sodass eine übersehene Zahl die Wertung stark drücken konnte. Eigentlich sollte die Studie messen, wie viel KI die menschliche Leistung hebt, doch die Modelle schafften allein die volle Punktzahl, sodass Mercor stattdessen den direkten Vergleich Mensch gegen Modell veröffentlichte.

Die Kostendifferenz ist größer als die Zeitdifferenz

Pro erfülltem Bewertungskriterium kostete Claude Opus 5 etwa 0,21 US-Dollar, die Buchhalter nach US-Medianlohn etwa 10,35 US-Dollar, ein Faktor von rund 49. Vor 18 Monaten erreichten selbst die besten Modelle den Buchhalter-Schnitt von 37 Prozent nicht; OpenAI o3 überschritt diese Linie im Frühjahr 2025, GPT-5 kam auf etwa 69 Prozent, und heute erreichen Frontier-Modelle volle Punktzahlen. Ausnahmen bleiben: Manche günstigen und offenen Modelle wie Qwen3.5-122B liegen weiter unter der Buchhalter-Linie.

Volle Punktzahl heißt nicht, dass Buchhalter ersetzbar sind

Mercor zieht die Grenzen selbst klar. Die Aufgaben prüften genau das, was Modelle am besten können: Details in Dateien finden und Anweisungen exakt befolgen. Kundenkommunikation, die richtigen Fragen stellen und gewachsener Geschäftskontext, ein großer Teil des Berufs, kamen nicht vor. Auch die Bedingungen benachteiligten die Menschen: keine Kollegen zum Fragen, kein aufgebauter Kontext, und Aufgaben, bei denen die Designer selbst nur rund 30 Prozent für Nachwuchskräfte erwarteten, weil der Benchmark gebaut wurde, um Modelle scheitern zu lassen. Die Studie zeigt vor allem, dass strukturierte, detailreiche Abschlussarbeit an Modelle übergeht, während Urteil, Kommunikation und Prüfung an Wert gewinnen. Für Finanzteams heißt das praktisch: Abgleich, Recherche und erste Entwürfe an Modelle geben und menschliche Zeit für Kontrolle und Erklärung einsetzen.

Empfohlene Tools

Mehr