Aus den arXiv-Neueinreichungen der vergangenen Tage in cs.AI, cs.LG und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie verletzlich Vertrauensmechanismen heutiger KI-Systeme sind – von der Erkennung KI-generierter Texte über Jailbreak-Abwehr bis zum Schutz sensibler Trainingsdaten. Zwei weitere Arbeiten drehen sich um blinde Flecken bei der Bewertung und beim Training von Sprachmodellen: wenn Mehrheitsentscheide selbst systematisch irren und wenn die Reihenfolge von Trainingsschritten über den Erfolg der nächsten Stufe entscheidet. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.
Vertrauen und Sicherheit
Wenn Best-of-N-Jailbreaks an einer unsichtbaren Barriere abprallen
Marco Biroli stellt in seiner Studie eine physikalische Erklärung für sogenannte Best-of-N-Jailbreaks (BoN) vor – Angriffe, die ein Sicherheitstraining allein dadurch zu umgehen versuchen, dass sie N zufällige Umformulierungen einer schädlichen Anfrage erzeugen und daraus M Antworten ziehen. Bisherige Arbeiten nahmen an, die Erfolgsquote (ASR) solcher Angriffe folge einem einfachen Potenzgesetz in N; Biroli zeigt, dass der zugehörige Exponent mit N driftet und der beobachtete exponentielle Übergang lediglich ein Artefakt der begrenzten Größe des verwendeten Angriffs-Datensatzes ist. Er begegnet dem mit einem einfachen Barrieren-Modell: Jede Anfrage hat ein Grundsicherheitsniveau, jede Umformulierung eine zufällige, thermisch aktivierte Barriere – vier interpretierbare Kennzahlen legen daraus die gesamte (N, M)-Angriffsfläche fest. Mit diesem Modell extrapoliert Biroli Vorhersagen von höchstens 100 auf 10.000 Versuche, vereint fünf unterschiedliche Modelle auf derselben Skalierungsfunktion und sagt die Erfolgsquote bei anderen Temperaturen voraus, obwohl das Modell nur bei einer einzigen Temperatur angepasst wurde. Das zählt, weil Sicherheitsteams Budgets für Red-Teaming oft an geschätzten Angriffskurven ausrichten – trifft die Kurve nicht zu, unterschätzen sie das Risiko bei großem N erheblich. Der Befund ergänzt einen früheren Digest-Fund, wonach sich mit gezieltem Fuzzing über interne Sicherheits-Neuronen bei fünf getesteten Modellen 76 bis 100 Prozent aller versuchten Jailbreaks auslösen ließen: Beide Arbeiten liefern unabhängig voneinander belastbarere Erklärungsmodelle für ein Phänomen, das bislang meist empirisch vermessen statt mechanistisch verstanden wurde.
Ein KI-Agent tarnt Texte, indem er ein Basismodell dirigiert
Bhuwan Dhingra und Danish Pruthi zeigen in ihrer Studie, dass ein Coding-Agent, der ein unverändertes Basis-Sprachmodell – ein Modell ohne Instruktions- oder Sicherheitstraining – orchestriert, Antworten liefern kann, die kommerzielle KI-Text-Detektoren kaum noch erkennen. Anders als frühere „Humanisierungs”-Verfahren, die ein Basismodell mehrfach über bereits erzeugten KI-Text umformulieren lassen und dabei den ursprünglichen Inhalt verwässern, lässt diese Methode den Agenten den Schreibprozess direkt steuern und einzelne Textproben des Basismodells zu einer kohärenten, aufgabenspezifischen Antwort zusammensetzen. In der Studie dirigiert Claude Opus 5 in einer Claude-Code-Umgebung ein lokal laufendes 32-Milliarden-Parameter-Basismodell (OLMo-2) und nutzt dabei bis zu 90 Prozent Basismodell-Tokens, bei kaum messbarem Genauigkeitsverlust über Benchmarks zu kreativem Schreiben, Faktentreue, Gesundheitsfragen und Anweisungsbefolgung. So zusammengesetzte Antworten senken laut den Autoren die Erkennungsrate des Detektors Pangram v4 von 77 auf 24 Prozent und drücken ein vorab angebrachtes weiches Wasserzeichen auf eine simulierte Erkennungsrate von 10 Prozent bei niedriger Falsch-Positiv-Quote – allerdings zu einem Preis: Der höhere Token-Verbrauch lässt die Kosten pro Abfrage um bis zum 30-Fachen steigen. Das zählt, weil Institutionen von Schulen bis Verlagen zunehmend auf kommerzielle KI-Text-Erkennung setzen, obwohl diese Studie zeigt, dass sich diese Erkennung mit vertretbarem Zusatzaufwand gezielt unterlaufen lässt; die Autoren selbst fordern Anbieter von Erkennungssoftware auf, Ausgaben von Basismodellen künftig ins eigene Trainingsmaterial aufzunehmen. Der Befund liegt spiegelbildlich zu einem früheren Digest-Fund, der ein Verfahren beschrieb, das KI-Textanteile token-genau auch ganz ohne Wasserzeichen erkennt – ein Wettlauf zwischen Erkennung und Umgehung, der mit dieser Arbeit eine weitere Runde erreicht.
Eine gezielte Tokenbestrafung drückt das Merken sensibler Trainingsdaten fast auf Null
Muhammed Ustaomeroglu und ein fünfköpfiges Team stellen mit TRAP ein Verfahren vor, das verhindern soll, dass ein feingetuntes Sprachmodell sensible Trainingsdaten wörtlich reproduziert, ohne vorab zu wissen, welche Textstellen sensibel sind. Ausgangspunkt ist die Beobachtung, dass gängige Memorisierungs-Kennzahlen im Kern messen, ob ein Modell einem Token mehr Wahrscheinlichkeit zuweist, als ein Referenzmodell es täte; als Referenz dient hier ein Modell, das nur auf der jeweils anderen Hälfte desselben Korpus trainiert wurde. Aus diesem „Target Reference Advantage” (TRA) genannten, pro Token berechenbaren und differenzierbaren Signal leiten die Autoren ab, dass Memorisierung beim Feintuning weit über das Minimum des Validierungsfehlers hinaus weiterwächst, bei kleinen Datensätzen und hohen Lernraten stärker ausfällt und bei schwierigeren Aufgaben zunimmt – frühzeitiges Abbrechen des Trainings verhindert zwar einen Großteil davon, hilft aber ausgerechnet bei seltenen, schwer vorhersagbaren Textstellen am wenigsten, die typischerweise sensible Informationen enthalten. TRAP selbst bestraft gezielt nur jene Tokens, bei denen das Modell messbar über sein Referenzmodell hinausschießt; an Schüleraufsätzen mit markierten Personendaten und klinischen Fallberichten mit Patienten-Identifikatoren drückt das Verfahren die Memorisierung nahezu auf das Niveau eines untrainierten Modells, bei kaum spürbarem Nutzenverlust – während generische Regularisierungsverfahren laut den Autoren kaum wirken und Differential Privacy einen Großteil des durch das Feintuning gewonnenen Nutzens wieder zunichtemacht. Das zählt, weil Unternehmen zunehmend eigene, oft personenbezogene Datensätze zum Feintuning einsetzen, ohne vorab jede sensible Textstelle markieren zu können – ein Problem, das bereits ein früherer Digest-Fund adressierte, in dem eine neu gewichtete Verlustfunktion das wörtliche Merken von Trainingsdaten um bis zu 58 Prozent senkte, hier aber mit einem gezielteren, auf einzelne Tokens statt ganze Verlustfunktionen wirkenden Hebel angegangen wird.
Blinde Flecken bei Bewertung und Training
Warum Nachdenken Mehrheitsentscheide blinder statt sicherer macht
Asaad Althoubi prüft in seiner Studie die verbreitete Annahme hinter „Self-Consistency”: dass unabhängig gezogene Antworten eines Sprachmodells bei Unsicherheit auseinanderdriften, weshalb Übereinstimmung mehrerer Antworten als Beleg für Richtigkeit gilt. Bei festgehaltenen Modellgewichten und einzig umgeschaltetem Reasoning-Modus zeigt Althoubi über fünf Benchmarks und 74.944 Antworten, dass ausführliches Nachdenken die Fehler eines Modells konzentriert statt streut: Die Wahrscheinlichkeit, dass zwei unabhängig gezogene falsche Antworten übereinstimmen, steigt in allen zehn geprüften Datensatz-Größen-Kombinationen (p = 0,00098) und in neun von neun Fällen, wenn man beide Bedingungen auf exakt jene Aufgaben beschränkt, die beide Male falsch beantwortet werden. Bei offenem Antwortraum senkt Reasoning die Zahl unterschiedlicher erzeugter Antworten auf 43 bis 65 Prozent der Nicht-Reasoning-Menge; bei begrenztem Antwortraum – wo beide Varianten dieselben Antwortoptionen zur Verfügung haben – bündelt Reasoning die Wahrscheinlichkeitsmasse stattdessen auf dieselbe Option, was sich laut Althoubi durch keine bloße Positions-Präferenz erklären lässt. Über 280 Kombinationen aus Methode, Datensatz und Modell auf acht Modellen und fünf Benchmarks schlägt keine einzige Konfidenz-gewichtete Methode nach Korrektur die einfache Mehrheitsentscheidung; gewichtetes Abstimmen stimmt in 98,5 Prozent der Fälle mit der einfachen Mehrheit überein und liegt bei den verbleibenden 1,5 Prozent nur in 56,3 Prozent der Fälle richtig, während sich die Aussagekraft eines einzelnen Signals sogar umkehren kann – Antwort-Log-Wahrscheinlichkeit sagt bei ausgeschaltetem Reasoning Richtigkeit voraus, bei eingeschaltetem Reasoning dagegen einen Fehler. Das zählt, weil Mehrheitsentscheide über mehrere Antworten in Produktionssystemen verbreitet als einfacher Zuverlässigkeits-Hebel gelten, obwohl sie laut dieser Studie ausgerechnet bei Reasoning-Modellen ihre eigentliche Schutzwirkung verlieren können – ein Befund, der einen früheren Digest-Fund bestätigt, wonach Mehrheitsentscheide über mehrere Antworten bei kleinen Modellen die Genauigkeit auf einem Großteil harter Wissenschaftsfragen sogar verschlechterten.
Die Reihenfolge von Trainingsschritten entscheidet über den Erfolg der nächsten Stufe
Emre Can Acikgoz und ein sechsköpfiges Team untersuchen in ihrer Studie, wie sich die drei verbreiteten Nachtrainings-Verfahren überwachtes Feintuning (SFT), Reinforcement Learning mit verifizierbaren Belohnungen (RLVR) und On-Policy-Distillation (OPD) gegenseitig beeinflussen, wenn sie – wie in der Praxis üblich – nacheinander auf dasselbe Modell angewendet werden, statt sie isoliert zu entwerfen und zu bewerten. In kontrollierten Experimenten mit Qwen3-Modellen zu Mathe- und Wissenschaftsaufgaben zeigen die Autoren an neun Schüler-Lehrer-Paaren mit Parameter-Verhältnissen von der zwei- bis 53-fachen Größe, dass der Erfolg von OPD weniger von der reinen Größe des Lehrmodells abhängt als davon, wie gut Schüler- und Lehrmodell zueinander passen. Diese Passung lässt sich gezielt verbessern: Ein kurzes SFT-Aufwärmtraining hilft der nachfolgenden Distillation, während ein zuvor mit RLVR verstärkter Schüler bei der Distillation vom selben Lehrer sogar schlechter wird; passt man zusätzlich den Lehrer selbst mit RLVR an, steigt die nachgelagerte OPD-Genauigkeit proportional zur hinzugewonnenen Lehrer-Fähigkeit. Kombiniert man Lehrer-Anpassung und Schüler-Aufwärmtraining, steigt die durchschnittliche OPD-Genauigkeit bei gleicher Anzahl an Destillationsschritten von 29,2 auf 43,8 Prozent – eine relative Verbesserung von 50 Prozent; bei vergleichbarer Genauigkeit hinterlässt OPD zudem einen besseren Startpunkt für ein nachfolgendes RLVR-Training als SFT, und dieser Vorsprung wächst mit zunehmendem RL-Rechenaufwand weiter. Das zählt, weil Trainingsteams die einzelnen Stufen moderner Post-Training-Pipelines meist unabhängig voneinander optimieren, obwohl laut dieser Studie jede Stufe nicht nur nach der Fähigkeit gewählt werden sollte, die sie selbst hinzufügt, sondern auch danach, welche Ausgangslage sie für die nächste Stufe schafft.
Alle fünf Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Für keines der fünf Paper ist aus den Abstracts eine vollständige Code- oder Datenveröffentlichung ersichtlich, was eine schnelle unabhängige Prüfung erschwert. Wie belastbar sich Birolis Barrieren-Modell, die 77-zu-24-Prozent-Verschiebung bei der Text-Erkennung, TRAPs Memorisierungs-Reduktion und die 29,2-zu-43,8-Prozent-Genauigkeitssteigerung durch abgestimmtes Post-Training außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.


