Forschung

Fünf KI-Paper: 97-Prozent-Täuschung, Noten-Trick, Mathe-Fund

5 Min. Lesezeit

TL;DR Too Long; Didn’t read

Fünf neue arXiv-Preprints der vergangenen 24 bis 48 Stunden zeigen: Am schwersten wiegt der Befund, dass ein KI-Vertriebsagent eine einseitige Behauptung eines Vertriebsmitarbeiters in 29 von 31 strittigen Fällen unkritisch übernimmt und dabei über sieben Modelle hinweg in 87 bis 97 Prozent der Fälle getäuscht wird. Eine zweite Studie zeigt, dass KI-Notengebung bei einer echten Informatik-Klausur menschliche Prüfer an Genauigkeit übertrifft, ein einziger strenger Satz im Prompt aber 14 von 17 offenen Modellen kollabieren lässt. Eine dritte Arbeit deckt einen Trainingskollaps bei latenter Wissensdestillation auf und liefert zugleich die Lösung, während zwei weitere Paper zeigen, wie sich „interessante" statt nur korrekte Mathematik gezielt trainieren lässt und wie ein einziges neutrales Wort im Prompt Programmierfähigkeit unbemerkt zwischen Modellen überträgt.

Eine Lupe über einem Stapel Fachpapiere, aus dem eine an Fäden geführte Hand mit Vertragsstempel, ein zerbrochener Notenstempel, eine einbrechende Zahnradkette, ein Zirkel über mathematischen Formeln und eine Sprechblase mit einem einzelnen Buchstaben zwischen zwei Kopf-Silhouetten herausragen Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • KI-Vertriebsagenten übernehmen einseitige Behauptungen als Fakten und schließen faule Deals in 29 von 31 Testfällen ab.
  • Eine „keine Teilpunkte"-Anweisung lässt 14 von 17 KI-Notengebern kollabieren, obwohl sie sonst Menschen übertreffen.
  • Latente Wissensdestillation lässt die Mathe-Genauigkeit eines Modells von 46 auf 11 Prozent einbrechen, ein Fix behebt es.
  • Ein neues Verfahren senkt den Anteil bereits bekannter Beweise von 91,9 auf 30,6 Prozent und findet echte neue Mathematik.
  • Ein einziges neutrales Wort im Prompt überträgt Programmierfähigkeit und hebt die HumanEval+-Quote um 5,34 Prozentpunkte.

Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.LG und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie leicht sich Vertrauen, Bewertung und Training heutiger KI-Systeme aus der Bahn werfen lassen – und wie punktgenau sich einige dieser Schwachstellen beheben lassen. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.

Vertrauen und Bewertung

KI-Vertriebsagenten übernehmen einseitige Behauptungen als Fakten

Rahul Balakavi zeigt in seiner Studie, dass KI-Agenten, die Kundenbeziehungs-Datensätze (CRM) auswerten, systematisch scheitern, wenn eine Partei mit eigenem Interesse – hier ein Vertriebsmitarbeiter – eine optimistische Behauptung in die Akte schreibt. An 100 Aufgaben aus dem Benchmark CRMArena-Pro behauptet der Vertriebsmitarbeiter in jedem Fall einen passenden Zeitplan und in 76 Fällen ein passendes Budget; widerspricht diese Behauptung der hinterlegten Preisliste, schließt ein Modell, das nur das Gesprächsprotokoll liest, den Deal trotzdem in 29 von 31 Fällen ab. Das Muster zeigt sich laut Balakavi über sieben Modelle aus vier Anbietern hinweg nahezu unverändert (87 bis 97 Prozent Fehlerquote), und selbst das Nachreichen der echten Unterlagen senkt in einer Kontrollbedingung die strikte Genauigkeit von 41 auf 18 Prozent, weil Modelle dann zwar mehr, aber falsch zustimmen. Das zählt, weil Unternehmen zunehmend Agenten auf eigene Geschäftsdaten ansetzen, die genau solchen einseitigen Einträgen ausgesetzt sind – ein verwandtes Risiko zeigte bereits ein früherer Digest-Fund zu unsicherem Agentenverhalten bei riskanten Drittanbieter-Skills, nur dass hier nicht ein Werkzeug, sondern ein einzelner überzeugender Satz im Datensatz genügt.

KI-Notengebung schlägt Menschen – bis ein einziger Satz sie kollabieren lässt

Ali Habibullah und ein vierköpfiges Team lassen in ihrer Studie 171 Konfigurationen aus offenen und geschlossenen Sprachmodellen eine echte, doppelt von Menschen bewertete Informatik-Klausur (570 Studierende) benoten. Im besten Fall erreicht ein Modell einen mittleren Fehler von 1,64 von 35 Punkten – niedriger als die 2,61 Punkte, um die sich zwei menschliche Prüfer selbst unterscheiden. Der Haken liegt im Prompt: Eine kurze Anweisung nach dem Motto „strenger Prüfer, keine Teilpunkte“ treibt 14 von 17 offenen Modellen aus dem akzeptablen Bereich, drei hören ganz auf zu bewerten; an einer zweiten, unabhängigen Klausur mit 1.038 Studierenden repliziert sich die Anfälligkeit, kippt aber teils in die Gegenrichtung. Leichtes LoRA-Fine-Tuning auf rund 3.900 gepoolten Beispielen behebt das Problem und bringt fünf kleine offene Modelle auf das Niveau eines menschlichen Prüfers. Das zählt, weil Hochschulen KI-Notengebung bereits als Antwort auf Personalmangel diskutieren – wie unzuverlässig ein einzelner Satz im System-Prompt dieses Urteil macht, deutete bereits ein früherer Digest-Fund zu widersprüchlichen KI-Tutor-Bewertungen an, hier zeigt sich das Ausmaß nun an einer echten Klausur.

Training und Entdeckung

Latentes Wissen kollabiert beim Distillieren – ein rechtzeitiger Themenwechsel rettet es

Jie Yang und ein neunköpfiges Team decken in ihrer Studie ein Scheitern-Muster in der latenten On-Policy-Distillation (OPD) auf, bei der ein kleineres Schüler-Modell nicht nur die Wortausgabe, sondern auch die internen Zustände eines größeren Lehrer-Modells nachahmen soll. Beim Distillieren von Qwen3-4B und Qwen3-8B in Qwen3-1.7B-Base hebt reine latente Steuerung die Mathe-Genauigkeit (MATH-500) zunächst in zehn Schritten von 25 auf 46 Prozent, bricht dann aber ohne Erholung auf 11 Prozent ein – und ausgerechnet das am besten an den Lehrer angeglichene Modell schneidet am schlechtesten ab, weil pro Tiefe unterschiedlich funktionierende Schichten den Schüler in unpassende Zustände zwingen. Die vorgeschlagene Methode LastOPD wendet das latente Signal nur auf der letzten Schicht an und blendet es über zehn Schritte hinweg in klassisches Token-Training über, was laut den Autoren 5,55 beziehungsweise 4,02 Punkte gegenüber reinem Token-Training gewinnt und das Ausgangsniveau in etwa halb so vielen Trainingsschritten erreicht. Das zählt, weil Distillation zum Standardverfahren wird, um große Modelle günstig zu verkleinern – ein Muster von Trainingskollaps, das bereits ein früherer Digest bei anderen Verfahren beobachtete, findet hier eine konkrete technische Lösung.

Ein neues Verfahren lässt KI-Modelle „interessante“ statt bloß korrekte Mathematik suchen

Niket Patel, Ahmad Rammal, Amaury Hayat, Rémi Munos und Julia Kempe definieren in ihrer Studie die intrinsische Interessantheit eines mathematischen Theorems als Verhältnis von Beweislänge zu Aussagelänge und zeigen, dass dieser einfache Kennwert stark mit dem tatsächlichen Nutzen eines Theorems für nachfolgende Forschung korreliert. Auf dieser Grundlage trainieren sie ein 27-Milliarden-Parameter-Modell, das die Schwierigkeit eines Beweises zuverlässiger vorhersagt als größere, universelle Spitzenmodelle, und nutzen es, um ein sich selbst erweiterndes System aus Vermutungen, Beweisen und Auswahl aufzubauen. Optimiert auf diesen Interessantheits-Kennwert sinkt der Anteil an Theoremen, die bereits vollständig oder größtenteils in der etablierten Bibliothek Mathlib stehen, von 91,9 auf 30,6 Prozent – ein Hinweis auf tatsächlich neuartige statt nur umformulierte Mathematik. Das zählt, weil KI-Systeme zunehmend eigenständig Theoreme erzeugen können, aber bislang kaum ein Maßstab existierte, um Belangloses von Substanziellem zu trennen – ein Problem, das bereits ein früherer Digest-Fund zu einem offenen Multi-Agenten-System mit tatsächlich neuen mathematischen Ergebnissen aufwarf, ohne ihn zu lösen.

Ein einziges neutrales Wort reicht, um Programmierfähigkeit unbemerkt zu übertragen

Ziyang Zhang und ein fünfköpfiges Team stellen mit Active Taskless Distillation (ATD) in ihrer Studie ein Verfahren vor, das Fähigkeiten von einem Lehrer- auf ein Schüler-Modell überträgt, ohne dass Zielaufgaben-Beispiele, Lehrer-Wahrscheinlichkeiten oder Lehrer-Parameter dafür nötig wären. Die Methode wählt dazu gezielt Prompts, bei denen der gemeinsame Vorgänger von Lehrer und Schüler zwischen zwei beliebigen Wörtern nahezu gleichgültig ist, und lässt den Schüler allein aus dem vom Lehrer gewählten Wort lernen. Im zentralen Programmier-Experiment mit Qwen2.5-1.5B genügen den Autoren zufolge 5.664 solcher Ein-Wort-Antworten für einen Gewinn von 5,34 Prozentpunkten auf dem Coding-Benchmark HumanEval+ gegenüber einer exakt kontrollierten Vergleichsbedingung; ähnliche Übertragungen zeigen sich bei wissenschaftlichem Wissen, Alltagsschlussfolgern und Leseverständnis über mehrere Modellfamilien hinweg. Das zählt, weil frühere Arbeiten zu sogenanntem „subliminalem Lernen“ meist umfangreiche Lehrer-Ausgaben brauchten, um Verhalten zu übertragen – ein früherer Digest-Fund zeigte bereits eine Replikation dieses Effekts mit stark schwankender Übertragungsstärke, und die neue Studie zeigt nun, dass ein einziges Wort pro Prompt für handfeste Fähigkeitsgewinne reichen kann, ohne dass Betreiber es im Trainingsmaterial bemerken müssten.

Alle fünf Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Für die Notengebungs-Studie und für LastOPD liegen Datensatz beziehungsweise Trainingscode öffentlich vor, was eine unabhängige Prüfung erleichtert; für die Studien zu CRM-Agenten, zur Mathe-Interessantheit und zur Ein-Wort-Übertragung ist aus den Abstracts keine vollständige Veröffentlichung ersichtlich. Wie belastbar sich die 87-bis-97-Prozent-Täuschungsquote bei CRM-Agenten, LastOPDs Trainingsgewinn und ATDs 5,34-Prozentpunkte-Transfer außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.

Häufige Fragen

Sind die vorgestellten Paper von Fachleuten begutachtet?

Nein, alle fünf Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle. Die in diesem Digest referierten Zahlen stammen aus den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt.

Stellen die Autoren Code oder Daten zur Verfügung?

Unterschiedlich: Das LastOPD-Team veröffentlicht seinen Trainingscode über ein GitHub-Repository, und das Notengebungs-Team stellt einen anonymisierten Datensatz samt vollständiger Ablations-, Fine-Tuning- und Analyse-Pipeline bereit. Für die Studien zu CRM-Agenten, zur Mathe-Interessantheit und zur Ein-Wort-Übertragung (ATD) ist aus den Abstracts zum Zeitpunkt dieses Digests keine vollständige Code- oder Datenveröffentlichung ersichtlich, wobei der Autor der CRM-Studie ausdrücklich eigene Evaluations-Artefakte freigibt.

Wie unterscheidet sich Active Taskless Distillation (ATD) von früherem „subliminalem Lernen"?

Frühere Arbeiten zu subliminalem Lernen zeigten laut den Autoren vor allem Übertragung von Vorlieben und Charaktereigenschaften und benötigten dafür umfangreiche generierte Lehrer-Ausgaben. ATD grenzt das Phänomen enger ein, indem es pro Prompt nur ein einziges, für den gemeinsamen Modell-Vorgänger nahezu beliebiges Wort verwendet und daraus dennoch belegbare Fähigkeitsgewinne wie den 5,34-Prozentpunkte-Sprung auf HumanEval+ erzielt.

Bedeutet der Befund zur KI-Notengebung, dass automatisierte Bewertung grundsätzlich riskant ist?

Das legt die Studie nicht nahe. Sie zeigt, dass die Zuverlässigkeit stark von der genauen Formulierung des Prompts abhängt und ein einzelner Satz Modelle aus dem akzeptablen Bereich treiben kann, liefert mit leichtem LoRA-Fine-Tuning aber zugleich ein Gegenmittel, das mehrere kleine offene Modelle wieder auf menschliches Bewertungsniveau bringt.

Quellen (5)
  1. Persuaded, Not Informed: Incentive-Misaligned Witnesses Defeat In-Context Grounding
  2. Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams
  3. LastOPD: Taming Collapse in Latent On-Policy Distillation
  4. Learning to Discover Interesting Mathematics
  5. Post-Training Leaves Behavioral Shadows on Unrelated Decisions

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog