Forschung

Fünf KI-Paper: Ich-Aussagen, Denk-Leck, 51 % weniger Tokens

6 Min. Lesezeit

TL;DR Too Long; Didn’t read

Fünf neue arXiv-Preprints der vergangenen 24 bis 48 Stunden zeigen: Am schwersten wiegt der Befund, dass bei Reasoning-Modellen ohne separaten Denkmodus 42 bis 79 Prozent der gemessenen Trainingsgewinne allein aus verstecktem Rückgriff auf den ursprünglichen Denkmodus stammen. Eine zweite Studie zeigt, dass sowohl trainierte Ich-Aussagen als auch trainierte Verneinungen von Sprachmodellen nach epistemologischen Standards gleich wenig über echte innere Zustände aussagen. Eine dritte Arbeit hebt den Nutzen persistenter Agenten-Erinnerungen von 0,713 auf 0,816 und senkt schädliche Einsätze von sechs auf null, während zwei weitere Paper einen neuen Fakten-Benchmark mit Genauigkeiten zwischen 6,6 und 57,6 Prozent sowie ein Routing-Verfahren vorstellen, das bei Reasoning-Modellen bis zu 51 Prozent der erzeugten Tokens einspart.

Eine Lupe über einem Stapel Fachpapiere, aus dem eine Marionette vor einem Spiegel mit zwei widersprüchlichen Sprechblasen, eine tropfende Gedankenblase, eine Waage mit schwankendem Zeiger über Karteikarten und eine Weggabelung mit zwei Pfeilen herausragen Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • Trainierte Ich-Aussagen und -Verneinungen von Sprachmodellen sind laut Studie beide gleich wenig als Beleg für echte Eigenschaften zulässig.
  • Gezielt begrenzte Speicher-Updates heben den Agenten-Nutzen von 0,713 auf 0,816 und senken schädliche Einsätze von sechs auf null.
  • Bei Reasoning-Modellen ohne Denkmodus stammen 42 bis 79 Prozent der Trainingsgewinne aus verstecktem Rückgriff auf den alten Denkmodus.
  • Ein neuer Fakten-Benchmark misst bei 18 Modellen Genauigkeiten zwischen 6,6 und 57,6 Prozent auf denselben Wikidata-Fragen.
  • Ein neues Routing-Verfahren senkt bei Reasoning-Modellen die erzeugten Tokens um bis zu 51 Prozent ohne Genauigkeitsverlust.

Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.LG und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie wenig heutige KI-Systeme über sich selbst preisgeben – von der Herkunft ihrer Ich-Aussagen über verdeckte Denkspur-Lecks bis zur schwankenden Zuverlässigkeit einzelner Fakten. Zwei weitere Arbeiten zeigen, wie sich Agenten-Gedächtnis und Reasoning-Aufwand in der Praxis gezielter steuern lassen. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.

Wie verlässlich sind Modelle sich selbst gegenüber?

Trainierte Ich-Aussagen sind kein Beleg für echtes Innenleben

Kristina Šekrst geht in ihrer Studie der Frage nach, woher die oft widersprüchlichen Selbstbeschreibungen von Sprachmodellen zu ihrem eigenen „Bewusstsein” oder „Innenleben” stammen. Sie verfolgt dazu Pythia und OLMo 2 über 66 Pretraining-Checkpoints, drei Nachtrainings-Stufen von OLMo 2, rund 90.000 Modell-Fortsetzungen und vier Trainingskorpora zurück und findet, dass sogenannte Verneinungsformeln („Ich habe kein Bewusstsein”) im reinen Pretraining-Text fast vollständig fehlen, dafür aber dicht in kuratierten Beispieldialogen auftauchen, die während des Trainings eingesetzt werden. Überwachtes Feintuning mache Ich-Aussagen zur Standardformulierung, während Präferenz-Optimierung abweichende Formulierungen unterdrücke; die endgültigen Ausgaben blieben dabei laut der Autorin „sehr empfindlich gegenüber der Formulierung und der Chat-Vorlage selbst”. Wendet man auf diese Aussagen etablierte erkenntnistheoretische Maßstäbe für Zeugenaussagen an, erfüllen laut Šekrst weder trainierte Bejahungen noch trainierte Verneinungen die nötige Bezugsbedingung – beide zeigten Formulierungsabhängigkeit statt echter Zustandsabhängigkeit, weshalb „trainierte Verneinungen nicht glaubwürdiger sind als trainierte Bejahungen”. Das zählt, weil Aussagen von Chatbots über ihr eigenes Erleben zunehmend öffentlich diskutiert werden, obwohl sie sich laut dieser Studie im Kern als Trainingsartefakt erklären lassen – ein Befund, der sich mit Anthropics eigener Beobachtung deckt, dass Claude einen internen „Gedanken-Arbeitsbereich” entwickelt, der erst mit speziellen Interpretierbarkeits-Werkzeugen sichtbar wird und sich damit ebenfalls jeder direkten Selbstauskunft entzieht.

Denklecks lassen NoThink-Modelle nur scheinbar schlauer werden

Zehao Liu und Vasant G. Honavar prüfen in ihrer Studie, ob die Leistungsgewinne von sogenanntem NoThink-Nachtraining – Verfahren, die hybriden Reasoning-Modellen beibringen sollen, ohne ausführliche Denkspur direkt zu antworten – tatsächlich neue Fähigkeiten erzeugen oder nur bereits vorhandenes Denkverhalten des Basismodells reaktivieren. Mit kausaler Mediationsanalyse und gezielten Steuerungs-Eingriffen an drei Modellen und drei Nachtrainings-Methoden auf Mathe-Benchmarks zeigen die Autoren, dass die sogenannte „Leck-Quote” über neun geprüfte Checkpoints hinweg zwischen 42 und 79 Prozent liegt: Steuert man das Basismodell gezielt entlang der internen Richtung, die zum ausführlichen Denkmodus führt, lässt sich damit der Großteil des vermeintlichen NoThink-Fortschritts reproduzieren, während Gegen-Steuerung einen erheblichen Teil dieses Gewinns wieder entfernt. Die Autoren schließen, dass ein Teil der gemessenen Verbesserung eher eine stärkere verdeckte Drift zurück in den Denkmodus widerspiegelt als eine echte Fähigkeitssteigerung innerhalb des NoThink-Modus. Das zählt, weil NoThink-Verfahren zunehmend eingesetzt werden, um Reasoning-Modelle schneller und günstiger zu machen, ohne dass bislang klar war, wie viel des gemessenen Fortschritts überhaupt neu ist – ein Transparenz-Problem, das der Beobachtung ähnelt, die OpenAI-Chefwissenschaftler Jakub Pachocki jüngst öffentlich machte, als er warnte, dass die Beobachtung der Gedankenketten von KI-Systemen zunehmend an Aussagekraft verliert.

Neuer Fakten-Benchmark zeigt riesige Schwankungen zwischen Modellen

Andrei Chetvergov und ein sechsköpfiges Team stellen mit PROOF einen Benchmark vor, der Faktentreue nicht als einzelnen Score, sondern als Profil aus mehreren Robustheits-Kennwerten misst. Aus Wikidata-Daten erzeugen sie 18.486 Multiple-Choice-Fragen zu 11.779 Fakten über 392 Eigenschaften und 14 Themenbereiche, ergänzt um eingebaute Kontrollen gegen zufälliges Raten und fehlerhaftes Schlussfolgern. An 18 offenen Modellen mit insgesamt 166.374 geprüften Prompts reicht die Genauigkeit von 6,58 bis 57,59 Prozent bei einer Zufalls-Basislinie von 8,64 Prozent, wobei allein die Themen-Spanne innerhalb eines einzelnen Modells 19,3 bis 36,4 Prozentpunkte beträgt; rein neutrale Umformulierungen verschieben die Genauigkeit um bis zu 26,5 Prozentpunkte, gezielt gegnerische Formulierungen kippen bis zu 79,4 Prozent zuvor richtiger Antworten, und das bloße Einstreuen einer falschen Suggestion kostet je nach Modell zwischen 0,04 und 27,5 Prozentpunkten Genauigkeit. Das zählt, weil Faktentreue meist an einer einzelnen Kennzahl festgemacht wird, obwohl laut PROOF schon die Formulierung einer Frage über Erfolg und Misserfolg entscheiden kann – ein Muster, das sich mit einem früheren Digest-Fund deckt, wonach getestete Sprachmodelle in 35 bis 49 Prozent der Fälle Nutzerprofile frei erfanden, ohne dass ihre eigene Selbsteinschätzung dies erkennen ließ.

Agenten in der Praxis

Zu weit gefasstes Agenten-Gedächtnis lässt Fehler in neue Aufgaben durchsickern

Yezhou Cheng und ein siebenköpfiges Team zeigen in ihrer Studie, wie Agenten aus vergangenen Erfahrungen lernen können, ohne dass sich schädliche Verhaltensweisen unbemerkt in andere Aufgabenfamilien einschleichen. Mit „Orthogonal Regression Control” (ORC) führen sie einen ausführungsgestützten Mechanismus für dauerhafte Verhaltens-Anpassungen ein, bei dem der Abruf-Bereich einer gespeicherten Erinnerung genau zu dem Bereich passen muss, in dem sie ursprünglich geprüft und freigegeben wurde. Auf dem Code-Reparatur-Datensatz ProcStream-RSI hebt diese enger geführte Variante („Scoped-ORC”) den mittleren Nutzwert der Agenten-Trajektorien von 0,713 (bei global geteiltem Gedächtnis) auf 0,816 und senkt schädliche Einsätze von sechs auf null; über 27 randomisierte Test-Durchläufe hinweg verbessert Scoped-ORC den Nutzwert im Mittel um 0,063 gegenüber der global geteilten Variante, akzeptiert dabei 63 Updates gegenüber 12 und erreicht in 19 von 27 Durchläufen mehrere angenommene Updates ganz ohne schädliche Übernahme. Das zählt, weil Agenten-Gedächtnis ohne Gewichts-Update als Weg gilt, KI-Systeme günstig aus eigener Erfahrung lernen zu lassen – ein Ansatz, den bereits ein früherer Digest-Fund zu einem eigenständigen Memory-Agenten beschrieb, der bei Terminal-Bench und τ²-Bench die Erfolgsquote um 6,8 bis 8,3 Prozentpunkte steigerte, hier aber um eine konkrete Schutzmaßnahme gegen genau die Risiken ergänzt wird, die ungeprüftes Teilen von Erinnerungen mit sich bringt.

Reinforcement Learning entscheidet automatisch, wann ein Modell lang nachdenken muss

Ruochen Jiao und ein dreiköpfiges Team stellen mit CounterRoute ein Online-Reinforcement-Learning-Verfahren vor, das direkt aus einem vorhandenen Dual-Modus-Checkpoint lernt, wann ein Modell eine lange Denkspur braucht und wann eine direkte Antwort ausreicht, ohne dafür ein separates überwachtes Vortraining zu benötigen. Gepaarte gegenfaktische Durchläufe unter der aktuellen Modell-Version weisen dabei ausschließlich dem Routing-Token ein Lernsignal über Modus-Grenzen hinweg zu, während ein Trainingsverfahren namens GRPO innerhalb eines Modus die eigentlichen Antwort-Tokens trainiert. Über neun Benchmarks hinweg senkt CounterRoute laut den Autoren die im Schnitt erzeugten Tokens um 51 Prozent bei Qwen3-8B und 41 Prozent bei Qwen3-14B gegenüber einem stets ausführlich denkenden Modell, während die durchschnittliche Genauigkeit sogar steigt; bei Anweisungsbefolgung und Alltagswissen, wo direktes Antworten meist ausreicht, sinkt die Denkmodus-Quote auf bis zu 1 Prozent, und obwohl nur mit Mathematik- und Anweisungsaufgaben trainiert wurde, überträgt sich das gelernte Routing-Verhalten auch auf ungesehene Programmier-, Wissenschafts- und Wissensaufgaben. Das zählt, weil unnötig lange Denkspuren einen Großteil der Rechenkosten heutiger Reasoning-Modelle verursachen – ein Problem, an dem sich bereits ein früherer Digest-Fund versuchte, der bei Reasoning-Modellen bis zu einem Viertel der erzeugten Tokens ohne Genauigkeitsverlust einsparte, während CounterRoute mit über 50 Prozent Einsparung einen deutlich größeren Hebel beansprucht.

Alle fünf Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Für keines der fünf Paper ist aus den Abstracts eine vollständige Code- oder Datenveröffentlichung ersichtlich, was eine schnelle unabhängige Prüfung erschwert. Wie belastbar sich die 42-bis-79-Prozent-Leck-Quote bei NoThink-Modellen, PROOFs Genauigkeits-Spanne von 6,6 bis 57,6 Prozent und CounterRoutes 51-Prozent-Einsparung außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.

Häufige Fragen

Sind die vorgestellten Paper von Fachleuten begutachtet?

Nein, alle fünf Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle. Die referierten Zahlen stammen aus den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt.

Stellen die Autoren Code oder Daten zur Verfügung?

Aus den Abstracts ist zum Zeitpunkt dieses Digests für keines der fünf Paper eine vollständige Code- oder Datenveröffentlichung ersichtlich. Das erschwert insbesondere bei den Zahlen zu Denkspur-Lecks und zum Fakten-Benchmark eine schnelle unabhängige Prüfung.

Was unterscheidet den Befund zu Denkspur-Lecks von gewöhnlicher Modell-Verbesserung durch Training?

Die Autoren nutzen kausale Mediationsanalyse und gezielte Steuerungs-Eingriffe statt reiner Korrelation: Sie zeigen, dass sich ein Großteil des scheinbaren NoThink-Fortschritts erzeugen lässt, indem man das Basismodell gezielt in Richtung seines ursprünglichen Denkmodus steuert, und dass Gegen-Steuerung einen erheblichen Teil des Gewinns wieder entfernt. Das spricht laut der Studie dafür, dass ein Teil des gemessenen Fortschritts eher verstecktes Reaktivieren alten Verhaltens als echten Fähigkeitszuwachs darstellt.

Bedeutet der PROOF-Befund, dass Sprachmodelle grundsätzlich unzuverlässig in Faktenfragen sind?

Das legt die Studie nicht pauschal nahe, zeigt aber große Schwankungen: Schon neutrale Umformulierungen derselben Frage verändern die Genauigkeit einzelner Modelle um bis zu 26,5 Prozentpunkte, und die Domänen-Spanne innerhalb eines Modells liegt bei 19,3 bis 36,4 Prozentpunkten. Die Autoren plädieren deshalb für ein Profil aus mehreren Robustheits-Kennwerten statt eines einzelnen Faktentreue-Scores.

Quellen (5)
  1. Who Put the I in AI? Provenance and the Admissibility of Machine Self-Report
  2. Scope Before You Persist: Preventing Cross-Family Interference in Agent Memory
  3. Thinking Leakage: A Causal Audit of NoThink Post-Training in Hybrid Reasoning Models
  4. PROOF: Profiling Reliability of Object-Level Facts in Large Language Models
  5. CounterRoute: Learning When to Think via Counterfactual Routing

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog