DatenKI-ModelleBuchhaltungBenchmark

KI-Modelle schlagen lizenzierte Buchhalter bei strukturierten Aufgaben

Eine Mercor-Studie zeigt: Aktuelle KI-Modelle sind schneller und genauer als Wirtschaftsprüfer bei Buchhaltungsaufgaben – doch ohne Aufsicht können sie die Bücher noch nicht selbstständig abschließen.

KI-Modelle übertreffen Buchhalter bei strukturierten Aufgaben – lösen aber noch nicht alle Aufgaben eigenständig

KI-Modelle schlagen lizenzierte Buchhalter bei strukturierten Aufgaben

KI-Modelle haben lizenzierte Wirtschaftsprüfer bei strukturierten Buchhaltungsaufgaben überholt. Das belegt eine aktuelle Studie von Mercor, die 12 lizenzierte Wirtschaftsprüfer mit durchschnittlich fünfeinhalb Jahren Berufserfahrung gegen führende KI-Systeme antreten ließ. Das Ergebnis ist deutlich: Während die besten Modelle vor 18 Monaten noch bei rund 37 Prozent Genauigkeit lagen – dem Durchschnittswert der Buchhalter – lösen sie heute dieselben vereinfachten Aufgaben nahezu fehlerfrei. Gleichzeitig sind KI-Systeme um ein Vielfaches günstiger.

Kurz & knapp

  • Claude Opus 5.5 führt den vollständigen APEX-Accounting-Benchmark mit 61,8 Prozent erfüllten Bewertungskriterien an, gefolgt von weiteren Modellen wie GPT-6 Astra (57,9 %)
  • Bei vereinfachten Aufgaben übertreffen KI-Modelle Buchhalter in Geschwindigkeit und Genauigkeit – ein Fortschritt von 18 Monaten
  • Im komplexen APEX-Benchmark mit 160 Aufgaben in 10 simulierten Unternehmen löst kein Modell alle Aufgaben vollständig
  • Fast 60 Prozent der Aufgaben werden von keinem Modell komplett gelöst – KI braucht weiterhin menschliche Aufsicht

Der Benchmark: Vereinfacht vs. Realität

Mercor testete zwei Szenarien. Bei den vereinfachten Aufgaben aus dem APEX-Accounting-Benchmark zeigt sich die KI-Überlegenheit deutlich. Der vollständige Benchmark ist aber ein anderes Kaliber: 160 Aufgaben verteilt auf 10 simulierte Unternehmen, entwickelt von über 40 Fachleuten mit durchschnittlich 11 Jahren Erfahrung. Hier wird es eng für die Modelle.

Die Spitzenreiter Claude Opus 5.5 und GPT-6 Astra knacken jeweils knapp über 60 Prozent der Bewertungskriterien. Das klingt respektabel – ist aber nicht das ganze Bild. Fast 60 Prozent der Aufgaben werden von keinem einzigen Modell komplett gelöst. Das bedeutet: Ohne menschliche Aufsicht können KI-Systeme ein Geschäftsjahr nicht eigenständig abschließen.

Was KI kann – und was nicht

Mercor gibt selbst zu, dass die getesteten Aufgaben genau das abbilden, was KI am besten beherrscht: detailgenaues Suchen und präzises Befolgen von Anweisungen. Der reale Berufsalltag von Buchhaltern ist breiter. Ausgeklammert wurden etwa:

  • Kundenkommunikation
  • Rückfragen an Kollegen
  • Gewachsenes Kontextwissen über spezifische Geschäftsmodelle

Das ist nicht Haarspalterei – das sind die Aufgaben, die Buchhalter tatsächlich unersetzbar machen. Gleichzeitig räumt die Studie ein: Erhebliche Produktivitätsgewinne in der Branche sind absehbar.

Was das für dich bedeutet

Für deutsche Mittelständler und Agenturen ist das Signal klar: KI wird die Buchhaltung nicht ersetzen, sondern radikal beschleunigen. Routineaufgaben – Belege erfassen, Konten zuordnen, Konsistenzprüfungen – werden schneller und günstiger. Das schafft Raum für die Aufgaben, die noch Menschenverstand brauchen: strategische Finanzplanung, Anomalienerkennung, Beratung.

Wer jetzt in KI-gestützte Buchhaltungsprozesse investiert, gewinnt Wettbewerbsvorteil. Wer wartet, riskiert, dass Konkurrenten die Kostenersparnisse bereits realisiert haben. Die Studie zeigt: Die Zeit der "KI ist noch nicht reif" ist vorbei – zumindest für strukturierte Finanzprozesse.

Quellen

Redaktionell verantwortet von Ideal Syka. Quellen und Arbeitsweise: Redaktion & Methode. Hinweise und Korrekturen: ai@i6eal.de.

Teilen
← Alle Beiträge

Alle Analysen basieren auf eigenen Messungen von i6eal oder auf klar gekennzeichneten Quellen. Zahlen sind Momentaufnahmen und können sich ändern; Korrekturen weisen wir transparent aus.