Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.LG und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie schnell scheinbar solide Sicherheitsprüfungen, faire Entscheidungen und wirtschaftliche Nutzenversprechen heutiger KI-Systeme bei genauerem Hinsehen bröckeln. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.
Sicherheit und Verlässlichkeit
Warum Jailbreaks bei Diffusions-Sprachmodellen gelingen
Thong Bach, Dung Nguyen, Thao Minh Le und Truyen Tran erklären in ihrer Studie, warum sich Jailbreaks bei sogenannten Diffusions-Sprachmodellen (dLLMs) – Modellen, die Text nicht Wort für Wort, sondern schrittweise aus verrauschtem Text „entrauschen” – überhaupt durchsetzen. Sie deuten Sicherheits-Ausrichtung als eine Energielandschaft: Ein gut abgesichertes Modell lenkt schädliche Anfragen über eine Energiebarriere in Richtung sicherer Antworten, und jeder bekannte Jailbreak-Angriff lasse sich auf zwei Strategien zurückführen – entweder die schädliche Absicht beim Start zu verschleiern oder mitten im Entrauschungs-Pfad gezielt über die Barriere zu drücken. Aus dieser Sichtweise leiten die Autoren drei trainingsfreie Erkennungssignale ab, die zusammen beide Angriffswege abdecken, und bestätigen deren Zusammenspiel an drei dichten dLLMs (LLaDA-8B, LLaDA-1.5, Dream-7B) sowie einem spärlich besetzten Mixture-of-Experts-dLLM (LLaDA-MoE-7B). In Stresstests bekannter Angriffe erzeuge laut den Autoren jede Konfiguration, die der Erkennung entgeht, zugleich keinen schädlichen Inhalt mehr – ein Hinweis darauf, dass sich Erkennungs- und Erfolgsschwelle eines Jailbreaks kaum trennen lassen. Das zählt, weil Diffusions-Sprachmodelle als schnellere Alternative zu klassischen autoregressiven Modellen an Verbreitung gewinnen, ihre Sicherheitsmechanismen aber bislang kaum eigenständig untersucht wurden – ein Kontrast zu einem früheren Digest-Fund, wonach sich mit gezieltem Fuzzing über interne Sicherheits-Neuronen bei fünf autoregressiven Modellen 76 bis 100 Prozent aller versuchten Jailbreaks auslösen ließen, während hier erstmals ein systematischer Erklärungsrahmen für die neuere Modellklasse vorgelegt wird.
Bio-Sicherheitscheck kippt bei bloßer Options-Umsortierung
Kimon Antonios Provatas und Ilias Georgakopoulos-Soares prüfen in ihrer Studie ein kommerzielles „System-1”-Modell – ein nicht-generatives Modell, das strukturierte Wahrscheinlichkeits-Entscheidungen in einem einzigen Vorwärtsdurchlauf statt per Token-für-Token-Generierung liefert und dadurch deutlich günstiger läuft als ein vollständiges Sprachmodell. An 6.020 Multiple-Choice-Fragen aus dem Weapons-of-Mass-Destruction-Proxy-Datensatz (WMDP), einer umformulierungsrobusten WMDP-Bio-Variante und sechs LAB-Bench-Teilaufgaben messen sie Genauigkeit, Kalibrierung und Empfindlichkeit gegenüber der Reihenfolge der Antwortoptionen. Zwar sei das Modell nach korrekter Auslegung des Hersteller-Unsicherheitsfeldes insgesamt brauchbar kalibriert (gepoolter Kalibrierungsfehler 0,034, AUROC 0,820) – unter vier zyklischen Rotationen der Antwortoptionen erhalten jedoch 37,4 Prozent der WMDP-Cyber-Fragen eine andere Antwort, wobei eine Kontrolle mit byte-identischen Wiederholungsaufrufen dies überwiegend der Options-Reihenfolge statt bloßem Zufallsrauschen zuschreibt. Mittelung der Wahrscheinlichkeiten über alle Rotationen hebt die WMDP-Cyber-Genauigkeit um 3,8 Prozentpunkte, und wendet man das nur bei unsicheren Antworten an, lässt sich der Großteil dieses Gewinns zu einem Bruchteil der Rechenkosten erzielen. Das zählt, weil solche günstigen System-1-Modelle zunehmend als kostengünstige Vorprüfung in größeren Sicherheits-Pipelines gehandelt werden, ihre Verlässlichkeit gegenüber trivialen Formatierungs-Änderungen aber laut dieser Studie noch kaum systematisch geprüft wurde.
Agenten und Entscheidungen
Wenn KI-Agenten nach getaner Arbeit einfach weiterarbeiten
Dongsheng Xiao, Zeyuan Wang, Xuzhe Xia, Bo Zhao und Yankai Cao beschreiben in ihrer Studie ein Muster, das sie als „LLM Parkinsonism” bezeichnen: KI-Agenten arbeiten trotz bereits erfüllter Zielvorgabe einfach weiter, produzieren wenig hilfreiche Verfeinerungen, wiederholte Prüfungen und Reparaturen an selbst geschaffener Komplexität. Als Ursache identifizieren die Autoren, dass Vorschlagserzeugung, Umfangs-Interpretation, Fortschrittsbewertung und die Entscheidung zum Aufhören in ein und derselben, sich selbst bedingenden Schleife zusammenlaufen, und schlagen mit „Global Executive Control” (GEC) eine unsicherheitsbewusste Steuerungs-Architektur vor, die Handlungserzeugung von projektweiter Kontrolle trennt. In einem 24.000-Episoden-Benchmark mit fester 40.000-Token-Obergrenze erreicht eine einfache Basislinie 67,42 Prozent Erfolg bei harten Zielvorgaben, eine Kontrollvariante mit Zugriff auf mehrere Kandidaten-Aktionen bereits 96,53 Prozent, und GEC erreicht mit 96,57 Prozent einen vergleichbaren Erfolg – senkt gegenüber dieser Kandidaten-Kontrolle aber den mittleren Tokenverbrauch von 19.782 auf 12.574 (36,4 Prozent) und beseitigt messbares Abdriften vor Aufgabenabschluss nach eigenen Angaben vollständig. Das zählt, weil autonome Agenten-Workflows zunehmend allein nach Erfolgsquote bewertet werden, obwohl laut den Autoren der größte Fähigkeitsgewinn hier schon aus dem bloßen Zugriff auf mehrere Kandidaten-Aktionen stammt und nicht aus der eigentlichen Steuerungs-Architektur – ein nüchterner Befund, den die Autoren selbst als mechanistische Simulation einordnen, deren Übertragung auf reale, live laufende Modelle noch aussteht.
Nachdenken macht KI-Entscheidungen fairer – und gleichzeitig unfairer
Deng Pan, Joe Germino, Yihong Ma, Elizabeth Daly, Nuno Moniz, Ting Hua und Nitesh Chawla zeigen in ihrer Studie, dass ausführliches Nachdenken bei Reasoning-Modellen einen doppelten, gegenläufigen Effekt auf kontrafaktische Fairness hat – also darauf, ob sich eine Entscheidung bereits ändert, sobald ausschließlich ein geschütztes Merkmal wie Geschlecht oder Herkunft in der Eingabe verändert wird. In einem Vergleich von Denkmodus gegen Nicht-Denkmodus an QwQ-32B, DeepSeek-R1-Distill-Qwen-32B und Qwen3-32B auf drei folgenreichen Entscheidungsaufgaben (Einkommens-, Rückfall- und Kreditrisiko-Einschätzung) behebt Nachdenken zwar einen Teil der diskriminierenden Positionswechsel der Nicht-Denk-Basislinie, erzeuge dabei aber laut den Autoren in allen neun geprüften Modell-Datensatz-Kombinationen etwa fünfmal so viele neue Positionswechsel – und das bei nahezu maximaler Modell-Konfidenz. Mit zwei neuen Messverfahren, die die Denkspur selbst als Ort der Fairness-Veränderung behandeln, zeigen die Autoren, dass sich Verzerrungen mit zunehmender Denktiefe eher verstärken als auflösen und dass der gegenläufige Effekt aus den gemeinsamen Zustandsübergängen kontrafaktischer Antwortpaare entsteht. Das zählt, weil längeres Nachdenken oft pauschal als Weg zu durchdachteren, faireren Entscheidungen gilt – ein Befund, der sich mit einem früheren Digest-Fund deckt, wonach Post-Training bei Bewerbungsentscheidungen zu einheitlicheren, aber diskriminierenderen KI-Urteilen führte und die systemische Ausschlussquote von 5,6 auf 17,3 Prozent hob, und zeigt, dass auch reines Test-Zeit-Nachdenken ohne zusätzliches Training keine verlässliche Abhilfe ist.
Mehr Testzeit-Nachdenken zahlt sich beim KI-Aktienhandel nicht verlässlich aus
Jiayi Chen und Guiling Wang untersuchen in ihrer Studie, ob zusätzliches Testzeit-Nachdenken bei Sprachmodellen tatsächlich zu besseren wirtschaftlichen Ergebnissen führt, statt nur höhere Rechenkosten zu verursachen. In einer kontrollierten Studie über ein volles Jahr US-amerikanischer Aktien mit Modellen aus den Familien DeepSeek, GPT und Gemini, drei Eingabebedingungen (numerische Daten, identifizierbare Nachrichten, maskierte Nachrichten) und mehr als 800.000 geprüften Einzelprognosen variieren sie ausschließlich den Reasoning-Aufwand bei sonst identischen Prompts, Ausgabeformaten und Portfolio-Konstruktionen. Über alle drei Modellfamilien hinweg verbessere zusätzliches Nachdenken laut den Autoren die Netto-Portfoliorendite nach Handelskosten nicht zuverlässig; bei DeepSeek, wo die komplette Bandbreite von keinem bis maximalem Reasoning geprüft wurde, verlaufe der Effekt sogar nicht-monoton, und wiederholte Modell-Generationen erzeugten instabile Handelsentscheidungen, selbst wenn die Gesamt-Bewertungen ähnlich ausfielen. Das zählt, weil Testzeit-Reasoning in vielen Anwendungen unhinterfragt als Qualitätsgewinn verkauft wird, obwohl es laut dieser Studie selten als eigenständige wirtschaftliche Intervention geprüft wird – ein Befund, der zur Vorsicht mahnt, bevor teurere Reasoning-Modelle allein wegen höherer Benchmark-Werte in kostenrelevante Entscheidungsprozesse eingebaut werden.
Alle fünf Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Für keines der fünf Paper ist aus den Abstracts eine vollständige Code- oder Datenveröffentlichung ersichtlich, was eine schnelle unabhängige Prüfung erschwert. Wie belastbar sich die 37,4-Prozent-Instabilität des Biosicherheits-Checks, das etwa Fünffache an neuen Bias-Kippungen durch Reasoning und GECs 36,4-Prozent-Tokenersparnis außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.


