Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.LG und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie wenig heutige KI-Systeme über sich selbst preisgeben – von der Herkunft ihrer Ich-Aussagen über verdeckte Denkspur-Lecks bis zur schwankenden Zuverlässigkeit einzelner Fakten. Zwei weitere Arbeiten zeigen, wie sich Agenten-Gedächtnis und Reasoning-Aufwand in der Praxis gezielter steuern lassen. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.
Wie verlässlich sind Modelle sich selbst gegenüber?
Trainierte Ich-Aussagen sind kein Beleg für echtes Innenleben
Kristina Šekrst geht in ihrer Studie der Frage nach, woher die oft widersprüchlichen Selbstbeschreibungen von Sprachmodellen zu ihrem eigenen „Bewusstsein” oder „Innenleben” stammen. Sie verfolgt dazu Pythia und OLMo 2 über 66 Pretraining-Checkpoints, drei Nachtrainings-Stufen von OLMo 2, rund 90.000 Modell-Fortsetzungen und vier Trainingskorpora zurück und findet, dass sogenannte Verneinungsformeln („Ich habe kein Bewusstsein”) im reinen Pretraining-Text fast vollständig fehlen, dafür aber dicht in kuratierten Beispieldialogen auftauchen, die während des Trainings eingesetzt werden. Überwachtes Feintuning mache Ich-Aussagen zur Standardformulierung, während Präferenz-Optimierung abweichende Formulierungen unterdrücke; die endgültigen Ausgaben blieben dabei laut der Autorin „sehr empfindlich gegenüber der Formulierung und der Chat-Vorlage selbst”. Wendet man auf diese Aussagen etablierte erkenntnistheoretische Maßstäbe für Zeugenaussagen an, erfüllen laut Šekrst weder trainierte Bejahungen noch trainierte Verneinungen die nötige Bezugsbedingung – beide zeigten Formulierungsabhängigkeit statt echter Zustandsabhängigkeit, weshalb „trainierte Verneinungen nicht glaubwürdiger sind als trainierte Bejahungen”. Das zählt, weil Aussagen von Chatbots über ihr eigenes Erleben zunehmend öffentlich diskutiert werden, obwohl sie sich laut dieser Studie im Kern als Trainingsartefakt erklären lassen – ein Befund, der sich mit Anthropics eigener Beobachtung deckt, dass Claude einen internen „Gedanken-Arbeitsbereich” entwickelt, der erst mit speziellen Interpretierbarkeits-Werkzeugen sichtbar wird und sich damit ebenfalls jeder direkten Selbstauskunft entzieht.
Denklecks lassen NoThink-Modelle nur scheinbar schlauer werden
Zehao Liu und Vasant G. Honavar prüfen in ihrer Studie, ob die Leistungsgewinne von sogenanntem NoThink-Nachtraining – Verfahren, die hybriden Reasoning-Modellen beibringen sollen, ohne ausführliche Denkspur direkt zu antworten – tatsächlich neue Fähigkeiten erzeugen oder nur bereits vorhandenes Denkverhalten des Basismodells reaktivieren. Mit kausaler Mediationsanalyse und gezielten Steuerungs-Eingriffen an drei Modellen und drei Nachtrainings-Methoden auf Mathe-Benchmarks zeigen die Autoren, dass die sogenannte „Leck-Quote” über neun geprüfte Checkpoints hinweg zwischen 42 und 79 Prozent liegt: Steuert man das Basismodell gezielt entlang der internen Richtung, die zum ausführlichen Denkmodus führt, lässt sich damit der Großteil des vermeintlichen NoThink-Fortschritts reproduzieren, während Gegen-Steuerung einen erheblichen Teil dieses Gewinns wieder entfernt. Die Autoren schließen, dass ein Teil der gemessenen Verbesserung eher eine stärkere verdeckte Drift zurück in den Denkmodus widerspiegelt als eine echte Fähigkeitssteigerung innerhalb des NoThink-Modus. Das zählt, weil NoThink-Verfahren zunehmend eingesetzt werden, um Reasoning-Modelle schneller und günstiger zu machen, ohne dass bislang klar war, wie viel des gemessenen Fortschritts überhaupt neu ist – ein Transparenz-Problem, das der Beobachtung ähnelt, die OpenAI-Chefwissenschaftler Jakub Pachocki jüngst öffentlich machte, als er warnte, dass die Beobachtung der Gedankenketten von KI-Systemen zunehmend an Aussagekraft verliert.
Neuer Fakten-Benchmark zeigt riesige Schwankungen zwischen Modellen
Andrei Chetvergov und ein sechsköpfiges Team stellen mit PROOF einen Benchmark vor, der Faktentreue nicht als einzelnen Score, sondern als Profil aus mehreren Robustheits-Kennwerten misst. Aus Wikidata-Daten erzeugen sie 18.486 Multiple-Choice-Fragen zu 11.779 Fakten über 392 Eigenschaften und 14 Themenbereiche, ergänzt um eingebaute Kontrollen gegen zufälliges Raten und fehlerhaftes Schlussfolgern. An 18 offenen Modellen mit insgesamt 166.374 geprüften Prompts reicht die Genauigkeit von 6,58 bis 57,59 Prozent bei einer Zufalls-Basislinie von 8,64 Prozent, wobei allein die Themen-Spanne innerhalb eines einzelnen Modells 19,3 bis 36,4 Prozentpunkte beträgt; rein neutrale Umformulierungen verschieben die Genauigkeit um bis zu 26,5 Prozentpunkte, gezielt gegnerische Formulierungen kippen bis zu 79,4 Prozent zuvor richtiger Antworten, und das bloße Einstreuen einer falschen Suggestion kostet je nach Modell zwischen 0,04 und 27,5 Prozentpunkten Genauigkeit. Das zählt, weil Faktentreue meist an einer einzelnen Kennzahl festgemacht wird, obwohl laut PROOF schon die Formulierung einer Frage über Erfolg und Misserfolg entscheiden kann – ein Muster, das sich mit einem früheren Digest-Fund deckt, wonach getestete Sprachmodelle in 35 bis 49 Prozent der Fälle Nutzerprofile frei erfanden, ohne dass ihre eigene Selbsteinschätzung dies erkennen ließ.
Agenten in der Praxis
Zu weit gefasstes Agenten-Gedächtnis lässt Fehler in neue Aufgaben durchsickern
Yezhou Cheng und ein siebenköpfiges Team zeigen in ihrer Studie, wie Agenten aus vergangenen Erfahrungen lernen können, ohne dass sich schädliche Verhaltensweisen unbemerkt in andere Aufgabenfamilien einschleichen. Mit „Orthogonal Regression Control” (ORC) führen sie einen ausführungsgestützten Mechanismus für dauerhafte Verhaltens-Anpassungen ein, bei dem der Abruf-Bereich einer gespeicherten Erinnerung genau zu dem Bereich passen muss, in dem sie ursprünglich geprüft und freigegeben wurde. Auf dem Code-Reparatur-Datensatz ProcStream-RSI hebt diese enger geführte Variante („Scoped-ORC”) den mittleren Nutzwert der Agenten-Trajektorien von 0,713 (bei global geteiltem Gedächtnis) auf 0,816 und senkt schädliche Einsätze von sechs auf null; über 27 randomisierte Test-Durchläufe hinweg verbessert Scoped-ORC den Nutzwert im Mittel um 0,063 gegenüber der global geteilten Variante, akzeptiert dabei 63 Updates gegenüber 12 und erreicht in 19 von 27 Durchläufen mehrere angenommene Updates ganz ohne schädliche Übernahme. Das zählt, weil Agenten-Gedächtnis ohne Gewichts-Update als Weg gilt, KI-Systeme günstig aus eigener Erfahrung lernen zu lassen – ein Ansatz, den bereits ein früherer Digest-Fund zu einem eigenständigen Memory-Agenten beschrieb, der bei Terminal-Bench und τ²-Bench die Erfolgsquote um 6,8 bis 8,3 Prozentpunkte steigerte, hier aber um eine konkrete Schutzmaßnahme gegen genau die Risiken ergänzt wird, die ungeprüftes Teilen von Erinnerungen mit sich bringt.
Reinforcement Learning entscheidet automatisch, wann ein Modell lang nachdenken muss
Ruochen Jiao und ein dreiköpfiges Team stellen mit CounterRoute ein Online-Reinforcement-Learning-Verfahren vor, das direkt aus einem vorhandenen Dual-Modus-Checkpoint lernt, wann ein Modell eine lange Denkspur braucht und wann eine direkte Antwort ausreicht, ohne dafür ein separates überwachtes Vortraining zu benötigen. Gepaarte gegenfaktische Durchläufe unter der aktuellen Modell-Version weisen dabei ausschließlich dem Routing-Token ein Lernsignal über Modus-Grenzen hinweg zu, während ein Trainingsverfahren namens GRPO innerhalb eines Modus die eigentlichen Antwort-Tokens trainiert. Über neun Benchmarks hinweg senkt CounterRoute laut den Autoren die im Schnitt erzeugten Tokens um 51 Prozent bei Qwen3-8B und 41 Prozent bei Qwen3-14B gegenüber einem stets ausführlich denkenden Modell, während die durchschnittliche Genauigkeit sogar steigt; bei Anweisungsbefolgung und Alltagswissen, wo direktes Antworten meist ausreicht, sinkt die Denkmodus-Quote auf bis zu 1 Prozent, und obwohl nur mit Mathematik- und Anweisungsaufgaben trainiert wurde, überträgt sich das gelernte Routing-Verhalten auch auf ungesehene Programmier-, Wissenschafts- und Wissensaufgaben. Das zählt, weil unnötig lange Denkspuren einen Großteil der Rechenkosten heutiger Reasoning-Modelle verursachen – ein Problem, an dem sich bereits ein früherer Digest-Fund versuchte, der bei Reasoning-Modellen bis zu einem Viertel der erzeugten Tokens ohne Genauigkeitsverlust einsparte, während CounterRoute mit über 50 Prozent Einsparung einen deutlich größeren Hebel beansprucht.
Alle fünf Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Für keines der fünf Paper ist aus den Abstracts eine vollständige Code- oder Datenveröffentlichung ersichtlich, was eine schnelle unabhängige Prüfung erschwert. Wie belastbar sich die 42-bis-79-Prozent-Leck-Quote bei NoThink-Modellen, PROOFs Genauigkeits-Spanne von 6,6 bis 57,6 Prozent und CounterRoutes 51-Prozent-Einsparung außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.


