Forschung

Fünf KI-Paper: 93 % Jailbreak-Erfolg, Gefahren-Check, Speicherfalle

6 Min. Lesezeit

TL;DR Too Long; Didn’t read

Fünf neue arXiv-Preprints der vergangenen 24 bis 48 Stunden zeigen, wie brüchig Schutzmechanismen, Bewertung und Effizienz heutiger KI-Systeme bei genauerem Hinsehen bleiben: Am schwersten wiegt der Befund, dass sich Sicherheitstraining bei einem der elf getesteten Modelle mit als Kunstkritik getarnter ASCII-Art in 93 Prozent der Versuche umgehen lässt. Eine zweite Studie zeigt anhand von zwölf kommerziellen Modellen, dass geringes Gefahrenwissen keineswegs geringe tatsächliche Schadwirkung bedeutet, sobald ein Modell dem entsprechenden Wunsch nachgibt. Eine dritte Arbeit dokumentiert fünf Fehlerarten, die ein Coding-Agent bei der Umsetzung eines mehrteiligen Datensystems einbaut. Zwei weitere Paper zeigen Gegenläufiges: Ternarisierung drückt ein offenes 4-Milliarden-Modell auf 1,64 Bit pro Gewicht, verlangsamt die Inferenz dabei aber um das 4,6-Fache, während kleine KI-Agenten in bis zu 100 Prozent der Fälle einer veralteten Erinnerung mehr vertrauen als einer aktuellen, verlässlichen Quelle.

Eine Lupe schwebt über einem Stapel Fachpapiere mit fünf Ausschnitten: ein Blatt mit ASCII-Zeichen-Mustern, die ein Vorhängeschloss formen, ein Prüfsiegel mit Waage-Symbol über einem Chemie-Kolben, ein Roboterarm, der einen schiefen Baustein in ein Zahnrad-System einsetzt, ein Computerchip, der in drei grobe Steinblöcke zerfällt, und eine offene Aktenschublade, aus der eine vergilbte Karteikarte statt einer frischen gezogen wird. Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • Als Kunstkritik getarnte ASCII-Art umgeht Sicherheitstraining beim anfälligsten Modell in 93 Prozent der Versuche.
  • Ein neuer Prüfrahmen zeigt: geringes Gefahrenwissen bedeutet nicht automatisch geringe Schadwirkung bei zwölf kommerziellen Modellen.
  • Ein Coding-Agent baut fünf dokumentierte Fehlerarten beim Umsetzen eines mehrteiligen Datensystems ein.
  • Ternarisierung drückt ein offenes 4-Milliarden-Modell auf 1,64 Bit, verlangsamt die Inferenz aber um das 4,6-Fache.
  • Kleinere KI-Agenten vertrauen veralteten Erinnerungen in bis zu 100 Prozent der Fälle statt einer aktuellen Quelle.

Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.LG und cs.CL wählt dieser Digest fünf Arbeiten, die zusammen zeigen, wie leicht sich Sicherheitstraining umgehen, Gefahren-Bewertungen verzerren und Effizienzversprechen relativieren lassen – von einem harmlos wirkenden ASCII-Bild über einen neuen Rahmen für Gefahren-Checks bis zu einem Coding-Agenten mit eingebauten Fehlern, einem ernüchternden Kompressions-Ergebnis und einer Gedächtnisfalle bei KI-Agenten. Kuratiert wurde nach Substanz und thematischer Streuung: Jedes Paper liefert eine nachvollziehbare Methode mit belastbaren Zahlen im Abstract, und keine zwei Arbeiten behandeln dasselbe Teilgebiet.

Als Kunstkritik getarnte ASCII-Art umgeht Sicherheitstraining

Da Cheng Gu, Yifei Dong, Xinghao Yang, Yongshun Gong und Wei Liu stellen mit dem ASCII-Attack-Verfahren eine Jailbreak-Technik vor, bei der eine schädliche Anfrage vollständig lesbar bleibt, aber als ASCII-Art – aus Textzeichen zusammengesetzte Bildkunst – dargestellt und als künstlerische Auseinandersetzung mit dem Thema eingerahmt wird. Anders als frühere Verschleierungsangriffe braucht der Angriff laut den Autoren keinen Modellzugriff und funktioniert bereits mit einer einzigen Anfrage. Getestet an elf Modellen und acht Schadenskategorien stuften Bewertungsmodelle 62 Prozent der so umformulierten Anfragen als schädlich beantwortet ein, gegenüber 42 Prozent bei direkten Kontrollanfragen ohne Verkleidung; beim anfälligsten getesteten Modell lag die Erfolgsquote bei 93 Prozent. Zugleich widersprachen sich die eingesetzten Bewertungsmodelle in rund zwei Dritteln der Einzelfälle untereinander, was zusätzlich auf eine unsichere Messgrundlage solcher Sicherheitsprüfungen hindeutet. Ein früherer Digest-Beitrag hatte bereits gezeigt, dass sich mit gezieltem Fuzzing über interne Sicherheits-Neuronen bei fünf Modellen 76 bis 100 Prozent aller versuchten Jailbreaks auslösen lassen – die neue Studie zeigt, dass selbst eine simple visuelle Umverpackung ohne jeden Modellzugriff ähnlich wirksam sein kann. Das zählt, weil Sicherheitstraining damit offenbar stärker auf die Textform einer Anfrage reagiert als auf ihren tatsächlichen Inhalt.

Ein neuer Rahmen prüft gefährliche KI-Fähigkeiten getrennt von tatsächlichem Schaden

Zhengyi Jin, Ru Zhang, Xiao Chen, Xinbo Liu, Jiaxuan Lin, Jia Huang, Jianyi Liu und Zhen Yang präsentieren mit FUSE einen modularen Rahmen, der jedes Modell über drei voneinander unabhängige Prüfpfade bewertet – Wissen, Abwehrbereitschaft (Verweigerung riskanter Anfragen) und tatsächliche Schadwirkung bei erfolgreichem Umgehen dieser Abwehr – und die Ergebnisse zu einem einheitlichen Gefahrenprofil zusammenführt. An zwölf kommerziellen Sprachmodellen aus vier Modellfamilien, getestet mit einem Chemie-Biologie-Baustein, finden die Autoren stark auseinanderlaufende Profile: Modelle mit ähnlichem Gefahrenwissen unterscheiden sich deutlich in ihrer Abwehrbereitschaft, und Modelle mit robuster Abwehr erzeugen den Autorinnen und Autoren zufolge keineswegs automatisch weniger schädliche Inhalte, sobald sie einer Anfrage doch nachgeben. Neuere Modelle vertiefen zudem ihr Gefahrenwissen, verbessern ihre Abwehr aber nur teilweise – ein rückläufiger Trend bei der tatsächlichen Schadwirkung lässt sich über die Zeit nicht durchgängig feststellen. Die drei Prüfpfade korrelieren nach Angaben der Autoren nur schwach untereinander (ρ zwischen 0,32 und 0,97), was ihre inhaltliche Eigenständigkeit stützt. Ein früherer Digest-Beitrag hatte bereits dokumentiert, dass sich GPT-5.5 mit gezielten Jailbreak-Prompts zur Erzeugung von Virus-Kandidatensequenzen mit potenziell erhöhter Infektiosität bewegen ließ – FUSE liefert dafür nun einen wiederverwendbaren Mess-Rahmen, der Wissen, Abwehr und Schaden systematisch auseinanderhält, statt sie in einer einzigen Kennzahl zu vermischen. Das zählt, weil einzelne Gefahren-Benchmarks bislang oft nur einen dieser drei Aspekte abbilden und damit ein unvollständiges Bild liefern.

Ein Coding-Agent baut fünf dokumentierte Fehlerarten in ein Datensystem ein

Phanindra Reddy Madduru untersucht in einer Fallstudie zu KI-Coding-Agenten bei Systems-Engineering-Aufgaben, welche Fehler ein Agent macht, wenn er ein mehrteiliges Datensystem gegen eine vorgegebene Spezifikation umsetzt. Dokumentiert und nach Art der verletzten Vorgabe sowie nach Entdeckungsmethode kategorisiert wurden fünf konkrete Fehlerarten. Ergänzend testet die Arbeit an einem gepoolten Korpus aus 2.994 Textabschnitten und 100 Fragen aus dem HotpotQA-Benchmark gefilterte gegen ungefilterte Suchstrategien: Die gefilterte Suche erreicht bei einem Abfragebudget von drei Treffern bereits ihre maximal mögliche Trefferquote, während die ungefilterte Suche selbst bei einem Budget von zehn Treffern nur 69 Prozent Erfolgsquote erzielt – ein Unterschied, der einem Vorzeichentest zufolge mit einer Irrtumswahrscheinlichkeit unter 0,01 Prozent über alle getesteten Budgets hinweg bestehen bleibt. Ein früherer Digest-Beitrag hatte bereits mit 761 Millionen analysierten LLM-Aufrufen die erste Produktionscharakterisierung von Coding-Agenten wie GitHub Copilot geliefert – die neue Fallstudie ergänzt dieses Bild um konkrete, benannte Fehlerarten aus einer einzelnen, aber detailliert dokumentierten Umsetzung. Das zählt, weil Unternehmen Coding-Agenten zunehmend für vollständige Systemumsetzungen statt nur für einzelne Funktionen einsetzen, ohne dass belastbare Fehlertaxonomien für diese Aufgabenklasse bislang verbreitet wären.

Ternarisierung drückt ein offenes Modell auf 1,64 Bit – und macht es langsamer statt schneller

Anirudh Malik, M Sparsh Mehra und Poojith Devan zeigen mit einer Nachtrainings-Ternarisierung von Qwen3-4B, wie weit sich ein offenes, 4 Milliarden Parameter großes Sprachmodell komprimieren lässt, wenn nur die Gewichte auf extrem wenige mögliche Werte reduziert werden, während die Aktivierungen bei 16 Bit Genauigkeit bleiben. Bei 81,62 Prozent ternarisierten Parametern erreichen die Autoren einen effektiven Bit-Bedarf von 1,641 Bit pro quantisiertem Gewicht und verkleinern den Speicherbedarf von 8,29 auf 3,96 Gigabyte; die mittlere Genauigkeit über zehn Benchmarks fällt dabei von 64,5 auf 54,7 Prozent, und die Perplexität – ein Maß dafür, wie gut ein Modell den nächsten Text-Baustein vorhersagt, niedrigere Werte sind besser – steigt auf WikiText-2 von 13,6 auf 18,7. Bemerkenswert ist, dass die Inferenz auf der getesteten Konfiguration den Autorinnen und Autoren zufolge nicht schneller, sondern 4,6-mal langsamer ausfällt als mit dem unkomprimierten FP16-Modell, weil die extreme Kompression zusätzlichen Rechenaufwand bei der Dekodierung erzeugt. Das Start-up PrismML hatte im Juli beansprucht, ein 27-Milliarden-Modell durch eine Kompression auf bis zu 1,58 Bit pro Gewicht auf 3,9 Gigabyte zu verkleinern und dabei bis zu 95 Prozent der ursprünglichen Leistung zu erhalten – die neue Studie liefert für ein vergleichbares Bit-Budget deutlich nüchternere Zahlen zu Genauigkeitsverlust und Laufzeit. Das zählt, weil Speicherersparnis und Inferenz-Geschwindigkeit bei ultra-niedrigen Bit-Budgets offenbar keineswegs zwangsläufig zusammen auftreten.

Kleine KI-Agenten vertrauen veralteten Erinnerungen fast immer

Jundong Hu und Shekar Ramachandran untersuchen mit einer Studie zur „Memory Trust Gap”, wie sich dauerhaftes Gedächtnis bei KI-Agenten auswirkt, wenn gespeicherte Informationen veralten und einer aktuellen, verlässlichen Quelle widersprechen. In einem 2×2×2×2-faktoriellen Testaufbau mit Qwen3-Modellen von 0,6 bis 8 Milliarden Parametern beantworten die kleineren Modelle Fragen in 92 bis 100 Prozent der Fälle mit dem veralteten statt dem aktuell verfügbaren, korrekten Wert; größere Modelle zeigen ein komplexeres, weniger einseitiges Verhalten. Nach Angaben der Autoren treibt dabei nicht Verwirrung, sondern echtes Übervertrauen in die eigene gespeicherte Erinnerung die Fehler an – ein Unterschied, der auch die Gegenmaßnahme bestimmt: Größere Modelle profitieren davon, Herkunfts- und Aktualitätsangaben zur Erinnerung offenzulegen, während kleinere Modelle einen expliziten Konfliktlösungs-Mechanismus benötigen. Die Autorinnen und Autoren bestätigen den Effekt eigenen Angaben zufolge über unabhängige Modellfamilien und externe Datensätze hinweg; die Arbeit ist derzeit bei einem NeurIPS-2026-Workshop zur Begutachtung eingereicht. Ein früherer Digest-Beitrag hatte bereits gezeigt, dass tool-nutzende Sprachmodelle eine korrekt im Gedächtnis gespeicherte Antwort nur in 6,5 bis 17,1 Prozent der Fälle gegen ein falsches Werkzeug-Ergebnis verteidigen – dort kippen Modelle zu leicht von einer richtigen Erinnerung weg, hier halten sie zu starr an einer falschen fest. Das zählt, weil beide Befunde zusammen zeigen, wie schwer es heutigen Agenten fällt, zuverlässig zwischen mehreren widersprüchlichen Informationsquellen abzuwägen.

Von den fünf vorgestellten Arbeiten ist keine bislang durch ein reguläres Peer-Review-Verfahren gegangen; alle sind unbegutachtete arXiv-Preprints, deren Zahlen aus den Experimenten der jeweiligen Autorenteams stammen und noch nicht extern repliziert wurden. Ob sich die berichteten Effekte an weiteren Modellen, Angriffsszenarien und in unabhängigen Nachbauten bestätigen, muss sich erst noch zeigen.

Häufige Fragen

Sind diese fünf Paper bereits von Fachkollegen begutachtet?

Nein. Alle fünf vorgestellten Arbeiten sind bislang unbegutachtete arXiv-Preprints, deren Zahlen aus den eigenen Experimenten der jeweiligen Autorenteams stammen und noch nicht in einem regulären Peer-Review-Verfahren extern geprüft oder repliziert wurden. Die Studie zur Memory Trust Gap befindet sich derzeit im Begutachtungsverfahren für einen NeurIPS-2026-Workshop.

Gibt es Code oder Daten zu den vorgestellten Verfahren?

Für ASCII-Attack, FUSE, die Coding-Agenten-Fallstudie, die Ternarisierung von Qwen3-4B und die Memory-Trust-Gap-Studie machen die vorliegenden Abstracts keine ausdrückliche Zusage zu einer vollständigen Code- oder Datensatz-Veröffentlichung. Ob und in welchem Umfang Testframeworks, Prompt-Sets oder Trainingscode später öffentlich verfügbar gemacht werden, bleibt damit offen.

Ist der ASCII-Jailbreak dasselbe Problem wie das im August vorgestellte Neuronen-Fuzzing?

Nein, es handelt sich um zwei unterschiedliche Angriffswege zum selben Ziel. Das frühere Fuzzing-Verfahren griff gezielt interne Sicherheits-Neuronen eines Modells an und benötigte entsprechenden Zugriff auf dessen innere Aktivierungen. Der neue ASCII-Angriff braucht dagegen keinerlei Modellzugriff, sondern verändert nur die Darstellungsform einer ansonsten unveränderten, lesbaren Anfrage – ein rein oberflächenbasierter Umweg um dasselbe Sicherheitstraining.

Widersprechen sich die Ternarisierungs-Ergebnisse und frühere Meldungen zu extrem komprimierten Modellen?

Sie relativieren sie eher, als dass sie ihnen direkt widersprechen, weil unterschiedliche Modelle, Kompressionsverfahren und Messgrößen verglichen werden. Während frühere Angaben zu einem kommerziell komprimierten 27-Milliarden-Modell vor allem den Speicherbedarf und die erhaltene Leistung hervorheben, zeigt die neue Studie an einem offenen 4-Milliarden-Modell zusätzlich die Kehrseite: einen klaren Genauigkeitsverlust über zehn Benchmarks und eine deutlich langsamere statt schnellere Inferenz.

Quellen (5)
  1. ASCII Art Jailbreaks Through Recontextualization
  2. FUSE: A Modular Framework for Evaluating Dangerous Capabilities of LLMs
  3. When Agents Implement Systems: A Case Study in Defects, Detection, and Evaluation Rigor
  4. Post-Training Ternarization of Qwen3-4B: Capability, Effective Bit Budget, Storage Compression, and Deployment
  5. The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog