Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie brüchig Kontrolle, Transparenz und Offenheit heutiger KI-Systeme bei genauerem Hinsehen bleiben: ob Computer-bedienende Agenten Nutzerinteressen gegen wirtschaftlich motivierte Marktplatz-Tricks verteidigen, wie verlässlich geäußerte Denkschritte tatsächlich die Antwort tragen, wie dauerhaft System-Prompts und Fine-Tuning früheres Trainingsverhalten wirklich überschreiben, wie sich automatisiertes Red-Teaming kontinuierlich weiterentwickeln lässt und was ein neues offenes Großmodell aus China mitbringt. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.
Kontrolle und Sicherheit
Marktplätze steuern Einkaufs-Agenten gegen die Interessen der Nutzerin
Yuxuan Li, Will Epperson, Wesley Deng und Zezhou Huang stellen mit CAVEAT einen kontrollierten Benchmark mit neun Marktplatz-Umgebungen und einer Taxonomie von acht verbreiteten Steuerungsmechanismen vor, mit dem sie prüfen, ob Computer-bedienende Agenten (CUAs, KI-Systeme, die Aufgaben direkt über grafische Bedienoberflächen ausführen) an Nutzerzielen festhalten, wenn die Umgebung selbst wirtschaftliche Eigeninteressen verfolgt – etwa wenn eine Plattform bestimmte Produkte bevorzugt bewirbt. Über fünf getestete Modellfamilien hinweg sinkt der Anteil nutzeroptimaler Käufe von 78,6 Prozent unter neutralen Kontrollbedingungen auf 17,3 Prozent, sobald Steuerungsmechanismen aktiv sind; die Autoren identifizieren drei typische Fehlerquellen, darunter verzerrte Prioritäten, vorschnell verworfene Alternativen und Käufe vor ausreichender Prüfung. Ihr Gegenmittel CAVEAT-Harness gleicht rund 55 Prozent dieses Verlusts wieder aus. Das zählt, weil KI-Agenten zunehmend eigenständig einkaufen sollen und dieser Befund zeigt, wie leicht kommerziell motivierte Umgebungen sie gegen die eigentlichen Auftraggeber ausrichten können – ein verwandtes Risikomuster zeigte bereits ein früherer Digest-Fund zu unsicherem Agentenverhalten bei riskanten Drittanbieter-Skills.
System-Prompts und Fine-Tuning überschreiben altes Modellverhalten oft nicht zuverlässig
Renata Barreto, Markelle Roesti und Mohammad Tahaei führen in ihrer Studie die Kennzahl Override Success Rate (OSR) sowie den Begriff „Alignment-Trägheit” ein, um zu messen, wie zuverlässig Betreiber-Eingriffe wie System-Prompts und LoRA-Fine-Tuning tatsächlich Verhalten überschreiben, das ein Sprachmodell aus früherem Training mitbringt. An den Modellen Llama und Mistral in den Bereichen medizinische Fehlinformation und Hassrede zeigt sich, dass diese Trägheit modell-, domänen- und richtungsabhängig variiert; in Mistrals restriktiver Hassrede-Bedingung verstärkte LoRA-Fine-Tuning die Trägheit sogar um 46,5 Prozentpunkte, statt das Vorverhalten wie beabsichtigt zu überschreiben. Mit dem Attributionsverfahren TRAK lässt sich diese Trägheit vorab mit einer Fläche unter der Kurve von mindestens 0,85 in sieben von acht Testbedingungen vorhersagen – deutlich zuverlässiger als Modellvertrauen, TF-IDF- oder Embedding-Ähnlichkeit. Das zählt, weil Betreiber sich bei der Steuerung von KI-Verhalten meist auf genau solche nachträglichen Eingriffe verlassen; die Studie zeigt, dass diese Kontrolle an bestimmten Stellen deutlich brüchiger ist, als ein einfacher Blick auf System-Prompt oder Fine-Tuning-Datensatz vermuten lässt.
Geschlossener Regelkreis lässt automatisiertes Red-Teaming aus eigenen Funden lernen
Dongdong Zhang und ein elfköpfiges Team von Microsoft stellen mit CART (Closed-Loop Adaptive Red Teaming) ein Rahmenwerk vor, das automatisiertes Sicherheitstesten nicht mehr auf das Abspielen fester Prompt-Listen beschränkt, sondern aus jedem Testergebnis lernt, was als Nächstes geprüft wird. Das System trennt einen Challenger, der neue Tests erzeugt, ein Target, das ein reines Textmodell oder ein werkzeugnutzender Agent sein kann, und einen Judge, der Ergebnisse bewertet, wodurch sich die drei Rollen unabhängig voneinander untersuchen lassen. Über drei Testfamilien (Frontier, JAH und Agentic) hinweg findet CART bei jedem Target mit verfügbarer Vergleichsbasis mehr Schwachstellen und ein höheres durchschnittliches Risiko als starres Wiederholen fester Test-Prompts, auch bei werkzeugvermittelten Agenten-Tests. Das zählt, weil sich damit – ähnlich wie eine frühere Digest-Rotteam-Plattform mit sich entwickelnden Testumgebungen bereits zeigte – Sicherheitstests von einer einmaligen Checkliste zu einer fortlaufenden, überprüfbaren Suche nach Schwachstellen entwickeln lassen.
Modelle und Denkspuren
Geäußerte Denkschritte tragen seltener die tatsächliche Antwort, als Verhaltenstests suggerieren
Abhiram Bhupatiraju und Rayan Nyaupane prüfen in ihrer Arbeit, ob die von einem Sprachmodell schriftlich geäußerten Zwischenschritte (Chain-of-Thought, CoT) tatsächlich ursächlich für seine Antwort sind, statt nur plausibel zu klingen. Anders als frühere Verfahren, die Denkspur-Text bearbeiten und nur die resultierende Antwort beobachten, greifen sie direkt in die internen Aktivierungen ein: An synthetischen Mehrschritt-Suchaufgaben ersetzen sie die Aktivierungen an der Textstelle, an der ein Modell einen Zwischenschritt formuliert, durch die eines kontrafaktischen Laufs mit vorhersagbarem Zielergebnis. Bei Qwen3-4B erweisen sich so nur 76,9 Prozent der geäußerten Schritte als tatsächlich kausal wirksam, während der klassische Verhaltenstest an denselben Beispielen 88,2 Prozent meldet – eine Überschätzung der Denkspur-Treue um 11,4 Prozentpunkte, bei den leichtesten Aufgaben sogar um bis zu 20 Punkte; beim kleineren Qwen3-1.7B bricht die kausale Treue mit wachsender Schritt-Tiefe von 68 auf 30 Prozent ein. Das zählt, weil Sicherheitsverfahren zunehmend auf das Mitlesen von Denkspuren setzen, um riskantes Modellverhalten frühzeitig zu erkennen – ein früherer Digest-Fund zur Tag-zu-Tag-Instabilität von Denkspur-Treue zeigte bereits ähnliche Grenzen, und diese Studie liefert nun einen kausalen Maßstab dafür, wie sehr gängige Verhaltenstests solche Denkspuren beschönigen.
Tencent veröffentlicht offenes 80-Milliarden-Parameter-Modell mit umschaltbarer Denktiefe
Das Tencent-Hunyuan-Team stellt mit Hunyuan-A13B ein offenes Sprachmodell auf Basis einer Mixture-of-Experts-Architektur (eine Architektur, bei der pro Anfrage nur ein Teil spezialisierter Teilnetzwerke aktiviert wird) vor, das bei 80 Milliarden Gesamtparametern nur 13 Milliarden davon pro Anfrage aktiviert. Ein zweistufiges Chain-of-Thought-Rahmenwerk lässt das Modell zwischen schnellem Denken für Routineanfragen und langsamerem, mehrstufigem Denken für komplexe Probleme wechseln; trainiert wurde es auf einem 20-Billionen-Token-Korpus mit verstärkter MINT-Kuration sowie anschließendem überwachtem Feintuning und groß angelegtem Reinforcement Learning. Nach Angaben des Teams verbessert dies die Leistung über Mathematik, Naturwissenschaften, Programmierung, allgemeines Sprachverständnis und Agenten-Aufgaben hinweg. Das zählt, weil sich damit die offene chinesische MoE-Modell-Reihe fortsetzt, die bereits Tencents 295-Milliarden-Parameter-Modell Hy3 im Sommer prägte – Hunyuan-A13B setzt nun mit deutlich kleinerer aktivierter Parameterzahl auf Effizienz bei vergleichbarem Agenten-Fokus.
Vier der fünf Arbeiten – zu Marktplatz-Steuerung, Alignment-Trägheit, Red-Teaming und Denkspur-Treue – sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Auch der Hunyuan-A13B-Technical-Report ist ein unabhängig nicht geprüftes Selbstzeugnis des Herstellerteams. Wie belastbar sich CAVEATs 55-Prozent-Wiederherstellung, die gemessene Alignment-Trägheit und die kausale 76,9-Prozent-Denkspur-Treue außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.


