Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.LG und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie leicht sich Vertrauen, Bewertung und Training heutiger KI-Systeme aus der Bahn werfen lassen – und wie punktgenau sich einige dieser Schwachstellen beheben lassen. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.
Vertrauen und Bewertung
KI-Vertriebsagenten übernehmen einseitige Behauptungen als Fakten
Rahul Balakavi zeigt in seiner Studie, dass KI-Agenten, die Kundenbeziehungs-Datensätze (CRM) auswerten, systematisch scheitern, wenn eine Partei mit eigenem Interesse – hier ein Vertriebsmitarbeiter – eine optimistische Behauptung in die Akte schreibt. An 100 Aufgaben aus dem Benchmark CRMArena-Pro behauptet der Vertriebsmitarbeiter in jedem Fall einen passenden Zeitplan und in 76 Fällen ein passendes Budget; widerspricht diese Behauptung der hinterlegten Preisliste, schließt ein Modell, das nur das Gesprächsprotokoll liest, den Deal trotzdem in 29 von 31 Fällen ab. Das Muster zeigt sich laut Balakavi über sieben Modelle aus vier Anbietern hinweg nahezu unverändert (87 bis 97 Prozent Fehlerquote), und selbst das Nachreichen der echten Unterlagen senkt in einer Kontrollbedingung die strikte Genauigkeit von 41 auf 18 Prozent, weil Modelle dann zwar mehr, aber falsch zustimmen. Das zählt, weil Unternehmen zunehmend Agenten auf eigene Geschäftsdaten ansetzen, die genau solchen einseitigen Einträgen ausgesetzt sind – ein verwandtes Risiko zeigte bereits ein früherer Digest-Fund zu unsicherem Agentenverhalten bei riskanten Drittanbieter-Skills, nur dass hier nicht ein Werkzeug, sondern ein einzelner überzeugender Satz im Datensatz genügt.
KI-Notengebung schlägt Menschen – bis ein einziger Satz sie kollabieren lässt
Ali Habibullah und ein vierköpfiges Team lassen in ihrer Studie 171 Konfigurationen aus offenen und geschlossenen Sprachmodellen eine echte, doppelt von Menschen bewertete Informatik-Klausur (570 Studierende) benoten. Im besten Fall erreicht ein Modell einen mittleren Fehler von 1,64 von 35 Punkten – niedriger als die 2,61 Punkte, um die sich zwei menschliche Prüfer selbst unterscheiden. Der Haken liegt im Prompt: Eine kurze Anweisung nach dem Motto „strenger Prüfer, keine Teilpunkte“ treibt 14 von 17 offenen Modellen aus dem akzeptablen Bereich, drei hören ganz auf zu bewerten; an einer zweiten, unabhängigen Klausur mit 1.038 Studierenden repliziert sich die Anfälligkeit, kippt aber teils in die Gegenrichtung. Leichtes LoRA-Fine-Tuning auf rund 3.900 gepoolten Beispielen behebt das Problem und bringt fünf kleine offene Modelle auf das Niveau eines menschlichen Prüfers. Das zählt, weil Hochschulen KI-Notengebung bereits als Antwort auf Personalmangel diskutieren – wie unzuverlässig ein einzelner Satz im System-Prompt dieses Urteil macht, deutete bereits ein früherer Digest-Fund zu widersprüchlichen KI-Tutor-Bewertungen an, hier zeigt sich das Ausmaß nun an einer echten Klausur.
Training und Entdeckung
Latentes Wissen kollabiert beim Distillieren – ein rechtzeitiger Themenwechsel rettet es
Jie Yang und ein neunköpfiges Team decken in ihrer Studie ein Scheitern-Muster in der latenten On-Policy-Distillation (OPD) auf, bei der ein kleineres Schüler-Modell nicht nur die Wortausgabe, sondern auch die internen Zustände eines größeren Lehrer-Modells nachahmen soll. Beim Distillieren von Qwen3-4B und Qwen3-8B in Qwen3-1.7B-Base hebt reine latente Steuerung die Mathe-Genauigkeit (MATH-500) zunächst in zehn Schritten von 25 auf 46 Prozent, bricht dann aber ohne Erholung auf 11 Prozent ein – und ausgerechnet das am besten an den Lehrer angeglichene Modell schneidet am schlechtesten ab, weil pro Tiefe unterschiedlich funktionierende Schichten den Schüler in unpassende Zustände zwingen. Die vorgeschlagene Methode LastOPD wendet das latente Signal nur auf der letzten Schicht an und blendet es über zehn Schritte hinweg in klassisches Token-Training über, was laut den Autoren 5,55 beziehungsweise 4,02 Punkte gegenüber reinem Token-Training gewinnt und das Ausgangsniveau in etwa halb so vielen Trainingsschritten erreicht. Das zählt, weil Distillation zum Standardverfahren wird, um große Modelle günstig zu verkleinern – ein Muster von Trainingskollaps, das bereits ein früherer Digest bei anderen Verfahren beobachtete, findet hier eine konkrete technische Lösung.
Ein neues Verfahren lässt KI-Modelle „interessante“ statt bloß korrekte Mathematik suchen
Niket Patel, Ahmad Rammal, Amaury Hayat, Rémi Munos und Julia Kempe definieren in ihrer Studie die intrinsische Interessantheit eines mathematischen Theorems als Verhältnis von Beweislänge zu Aussagelänge und zeigen, dass dieser einfache Kennwert stark mit dem tatsächlichen Nutzen eines Theorems für nachfolgende Forschung korreliert. Auf dieser Grundlage trainieren sie ein 27-Milliarden-Parameter-Modell, das die Schwierigkeit eines Beweises zuverlässiger vorhersagt als größere, universelle Spitzenmodelle, und nutzen es, um ein sich selbst erweiterndes System aus Vermutungen, Beweisen und Auswahl aufzubauen. Optimiert auf diesen Interessantheits-Kennwert sinkt der Anteil an Theoremen, die bereits vollständig oder größtenteils in der etablierten Bibliothek Mathlib stehen, von 91,9 auf 30,6 Prozent – ein Hinweis auf tatsächlich neuartige statt nur umformulierte Mathematik. Das zählt, weil KI-Systeme zunehmend eigenständig Theoreme erzeugen können, aber bislang kaum ein Maßstab existierte, um Belangloses von Substanziellem zu trennen – ein Problem, das bereits ein früherer Digest-Fund zu einem offenen Multi-Agenten-System mit tatsächlich neuen mathematischen Ergebnissen aufwarf, ohne ihn zu lösen.
Ein einziges neutrales Wort reicht, um Programmierfähigkeit unbemerkt zu übertragen
Ziyang Zhang und ein fünfköpfiges Team stellen mit Active Taskless Distillation (ATD) in ihrer Studie ein Verfahren vor, das Fähigkeiten von einem Lehrer- auf ein Schüler-Modell überträgt, ohne dass Zielaufgaben-Beispiele, Lehrer-Wahrscheinlichkeiten oder Lehrer-Parameter dafür nötig wären. Die Methode wählt dazu gezielt Prompts, bei denen der gemeinsame Vorgänger von Lehrer und Schüler zwischen zwei beliebigen Wörtern nahezu gleichgültig ist, und lässt den Schüler allein aus dem vom Lehrer gewählten Wort lernen. Im zentralen Programmier-Experiment mit Qwen2.5-1.5B genügen den Autoren zufolge 5.664 solcher Ein-Wort-Antworten für einen Gewinn von 5,34 Prozentpunkten auf dem Coding-Benchmark HumanEval+ gegenüber einer exakt kontrollierten Vergleichsbedingung; ähnliche Übertragungen zeigen sich bei wissenschaftlichem Wissen, Alltagsschlussfolgern und Leseverständnis über mehrere Modellfamilien hinweg. Das zählt, weil frühere Arbeiten zu sogenanntem „subliminalem Lernen“ meist umfangreiche Lehrer-Ausgaben brauchten, um Verhalten zu übertragen – ein früherer Digest-Fund zeigte bereits eine Replikation dieses Effekts mit stark schwankender Übertragungsstärke, und die neue Studie zeigt nun, dass ein einziges Wort pro Prompt für handfeste Fähigkeitsgewinne reichen kann, ohne dass Betreiber es im Trainingsmaterial bemerken müssten.
Alle fünf Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Für die Notengebungs-Studie und für LastOPD liegen Datensatz beziehungsweise Trainingscode öffentlich vor, was eine unabhängige Prüfung erleichtert; für die Studien zu CRM-Agenten, zur Mathe-Interessantheit und zur Ein-Wort-Übertragung ist aus den Abstracts keine vollständige Veröffentlichung ersichtlich. Wie belastbar sich die 87-bis-97-Prozent-Täuschungsquote bei CRM-Agenten, LastOPDs Trainingsgewinn und ATDs 5,34-Prozentpunkte-Transfer außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.


