Zum Inhalt springen
KI-Praxis

Claude schlägt Buchhalter: 100 Prozent bei Abschluss-Test

Ein neuer Branchentest der Personalplattform Mercor zeigt: Claude löst vereinfachte Monatsabschluss-Aufgaben in 20 von 20 Versuchen fehlerfrei, während zwölf erfahrene Wirtschaftsprüfer dabei klar zurückbleiben. Im vollständigen, 160 Aufgaben umfassenden APEX-Accounting-Benchmark kommt selbst das beste Modell nur auf rund 62 Prozent der Bewertungskriterien. Kundengespräche und jahrelange Erfahrung bleiben außen vor – reine Fließband-Buchhaltung erledigt KI inzwischen schneller und günstiger.

Von Brian Beckmann · 3. Oktober 2026 · 3 Min

Ein Roboterarm mit Claude-Logo stapelt Aktenordner auf einer Waage, die sich zu seiner Seite neigt, während gegenüber eine Person am Taschenrechner nur wenige Ordner gestapelt hat

Die Personalplattform Mercor hat KI-Modelle gegen zwölf lizenzierte Wirtschaftsprüfer bei echten Monatsabschlüssen getestet. Bei vier vereinfachten Abschluss-Szenarien löste Claude alle 20 Testläufe fehlerfrei in jeweils unter zehn Minuten – die Fachkräfte mit durchschnittlich 5,5 Jahren Erfahrung schnitten deutlich schlechter ab.

Bei der vollständigen, 160 Aufgaben umfassenden Prüfung erreicht selbst das stärkste Modell nur rund 62 Prozent der Bewertungskriterien.

Claude meistert vereinfachte Abschlussaufgaben

Für die Studie ließ die auf KI-Bewertungen spezialisierte US-Personalplattform Mercor zwölf lizenzierte Wirtschaftsprüfer gegen ein KI-Modell von Anthropic antreten.

Die Aufgabe: vier realistische Szenarien eines Monatsabschlusses, bei denen sich die benötigten Zahlen erst aus den Arbeitsdateien eines Unternehmens heraussuchen lassen, bevor sie verrechnet und in eine Ergebnistabelle überführt werden.

Claude löste nach Angaben von Mercor alle 20 Testläufe fehlerfrei und benötigte dafür jeweils weniger als zehn Minuten. Die Fachkräfte mit durchschnittlich 5,5 Jahren Berufserfahrung schnitten dagegen deutlich schlechter ab; ihre Ergebnisse streuten zwischen null und rund 90 Prozent.

Mercors Aufgabenautorinnen und -autoren hatten vorab im Schnitt 30 Prozent für Berufseinsteiger und 55 Prozent für mittelerfahrene Fachkräfte erwartet – tatsächlich fiel die Leistung der Testgruppe darunter aus. Für Unternehmen, die repetitive Abschlussarbeiten bereits heute in Werkzeuge wie Copilot in Excel auslagern, bestätigt das einen Trend: Strukturierte Fleißarbeit mit klaren Regeln erledigt KI inzwischen zuverlässiger als viele Berufseinsteiger.

Vollständiger Benchmark zeigt klare Grenzen auf

Die zweite, deutlich härtere Prüfung heißt APEX-Accounting und testet Modelle an 160 Aufgaben aus zehn simulierten Unternehmen mit insgesamt 2.186 Bewertungskriterien; pro Aufgabe müssen die Systeme im Schnitt 7,5 Belegdateien selbst auswerten, ohne vorgegebene Dateiliste oder Methodik.

Die Aufgaben und Bewertungsraster stammen von Fachleuten aus großen Wirtschaftsprüfungsgesellschaften, darunter Deloitte, PwC, EY und KPMG. Jedes Modell durchlief die Prüfung in acht Durchläufen, um Schwankungen in der Zuverlässigkeit sichtbar zu machen.

Auf der öffentlichen APEX-Accounting-Rangliste führt Claude Opus 5.5 mit 61,8 Prozent erfüllter Kriterien, knapp gefolgt von Fable 5.1 mit 61,0 Prozent und GPT-6 Astra mit 57,9 Prozent; weitere getestete Modelle wie Gemini 3.1 Pro, Grok 4.5 oder Qwen3.5-397B liegen dahinter.

Die Zahlen zeigen: Selbst das stärkste Modell erfüllt gut ein Drittel der Kriterien nicht – von einer vollautomatischen Buchhaltung ist auch die aktuelle KI-Generation noch entfernt.

Fortschritt gegenüber früheren Modellen fällt deutlich aus

Der Sprung wirkt größer, wenn man den zeitlichen Verlauf betrachtet: Vor eineinhalb Jahren lagen die seinerzeit besten KI-Modelle nach Mercors eigenen, unabhängig nicht verifizierten Angaben noch unter dem historischen Vergleichswert von rund 37 Prozent für durchschnittliche Buchhalter.

Heute liegt das Spitzenmodell bei der kompletten Prüfung bei knapp 62 Prozent, bei den vereinfachten Abschluss-Szenarien sogar bei voller Punktzahl. Bewusst ausgeklammert bleiben dabei Aufgaben, die über reine Zahlenarbeit hinausgehen: Gespräche mit Mandantinnen und Mandanten, Rückfragen bei Kolleginnen und Kollegen sowie das über Jahre gewachsene Verständnis für die Besonderheiten eines einzelnen Unternehmens.

Genau dort bleibe menschliches Urteilsvermögen vorerst unersetzt – getestet werde gezielt das, was KI bereits am besten könne: Belege finden und Anweisungen präzise befolgen.

Entscheidend wird, ob Wirtschaftsprüfungsgesellschaften die Lücke zwischen einfachen Routineaufgaben und komplexen Abschlüssen nutzen, um Berufseinsteiger stärker auf Mandantenkontakt und Plausibilitätsprüfung zu verlagern, statt Stellen ganz zu streichen.

Mercor kündigt an, die APEX-Accounting-Rangliste bei neuen Modellversionen fortlaufend zu aktualisieren – der nächste Datenpunkt dürfte zeigen, ob sich der Abstand zwischen KI und menschlicher Fachkraft bei den komplexeren Aufgaben weiter verkürzt.

Quellen

  1. Mercor: Human baselines for benchmarks — AI now outperforms junior accountants
  2. Mercor APEX-Accounting Leaderboard

Häufige Fragen

Mehr zum Thema

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

/ki-praxis/2026-10/claude-schlaegt-buchhalter-abschlusstest /en/blog/2026-10/claude-beats-accountants-closing-test