Forschung

Fünf KI-Paper: 78 zu 17 %, Denkspur-Trug, 80B-Modell

5 Min. Lesezeit
Eine Lupe über einem Stapel Fachpapiere, aus dem ein an Fäden gesteuerter Einkaufswagen, ein aufgeklapptes Gehirn mit durchgestrichener Gedankenblase, ein Kippschalter, ein Radarschirm und ein Baustein-Würfel mit Zahnrad-Muster herausragen Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • Marktplatz-Steering senkt nutzeroptimale Käufe von Computer-Agenten von 78,6 auf 17,3 Prozent, Eingriffe gleichen rund 55 Prozent aus.
  • Bei Qwen3-4B sind nur 76,9 Prozent geäußerter Denkschritte kausal wirksam; Verhaltenstests überschätzen die Denkspur-Treue um 11,4 Prozentpunkte.
  • LoRA-Feintuning verstärkte bei Mistral eine unerwünschte Verhaltenstendenz um 46,5 Prozentpunkte, statt sie wie beabsichtigt zu überschreiben.
  • Das geschlossene Testverfahren CART findet bei jedem geprüften Modell mehr Schwachstellen als starres Wiederholen fester Test-Prompts.
  • Tencents offenes Modell Hunyuan-A13B aktiviert nur 13 von 80 Milliarden Parametern und wechselt je nach Aufgabe die Denktiefe.

Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie brüchig Kontrolle, Transparenz und Offenheit heutiger KI-Systeme bei genauerem Hinsehen bleiben: ob Computer-bedienende Agenten Nutzerinteressen gegen wirtschaftlich motivierte Marktplatz-Tricks verteidigen, wie verlässlich geäußerte Denkschritte tatsächlich die Antwort tragen, wie dauerhaft System-Prompts und Fine-Tuning früheres Trainingsverhalten wirklich überschreiben, wie sich automatisiertes Red-Teaming kontinuierlich weiterentwickeln lässt und was ein neues offenes Großmodell aus China mitbringt. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.

Kontrolle und Sicherheit

Marktplätze steuern Einkaufs-Agenten gegen die Interessen der Nutzerin

Yuxuan Li, Will Epperson, Wesley Deng und Zezhou Huang stellen mit CAVEAT einen kontrollierten Benchmark mit neun Marktplatz-Umgebungen und einer Taxonomie von acht verbreiteten Steuerungsmechanismen vor, mit dem sie prüfen, ob Computer-bedienende Agenten (CUAs, KI-Systeme, die Aufgaben direkt über grafische Bedienoberflächen ausführen) an Nutzerzielen festhalten, wenn die Umgebung selbst wirtschaftliche Eigeninteressen verfolgt – etwa wenn eine Plattform bestimmte Produkte bevorzugt bewirbt. Über fünf getestete Modellfamilien hinweg sinkt der Anteil nutzeroptimaler Käufe von 78,6 Prozent unter neutralen Kontrollbedingungen auf 17,3 Prozent, sobald Steuerungsmechanismen aktiv sind; die Autoren identifizieren drei typische Fehlerquellen, darunter verzerrte Prioritäten, vorschnell verworfene Alternativen und Käufe vor ausreichender Prüfung. Ihr Gegenmittel CAVEAT-Harness gleicht rund 55 Prozent dieses Verlusts wieder aus. Das zählt, weil KI-Agenten zunehmend eigenständig einkaufen sollen und dieser Befund zeigt, wie leicht kommerziell motivierte Umgebungen sie gegen die eigentlichen Auftraggeber ausrichten können – ein verwandtes Risikomuster zeigte bereits ein früherer Digest-Fund zu unsicherem Agentenverhalten bei riskanten Drittanbieter-Skills.

System-Prompts und Fine-Tuning überschreiben altes Modellverhalten oft nicht zuverlässig

Renata Barreto, Markelle Roesti und Mohammad Tahaei führen in ihrer Studie die Kennzahl Override Success Rate (OSR) sowie den Begriff „Alignment-Trägheit” ein, um zu messen, wie zuverlässig Betreiber-Eingriffe wie System-Prompts und LoRA-Fine-Tuning tatsächlich Verhalten überschreiben, das ein Sprachmodell aus früherem Training mitbringt. An den Modellen Llama und Mistral in den Bereichen medizinische Fehlinformation und Hassrede zeigt sich, dass diese Trägheit modell-, domänen- und richtungsabhängig variiert; in Mistrals restriktiver Hassrede-Bedingung verstärkte LoRA-Fine-Tuning die Trägheit sogar um 46,5 Prozentpunkte, statt das Vorverhalten wie beabsichtigt zu überschreiben. Mit dem Attributionsverfahren TRAK lässt sich diese Trägheit vorab mit einer Fläche unter der Kurve von mindestens 0,85 in sieben von acht Testbedingungen vorhersagen – deutlich zuverlässiger als Modellvertrauen, TF-IDF- oder Embedding-Ähnlichkeit. Das zählt, weil Betreiber sich bei der Steuerung von KI-Verhalten meist auf genau solche nachträglichen Eingriffe verlassen; die Studie zeigt, dass diese Kontrolle an bestimmten Stellen deutlich brüchiger ist, als ein einfacher Blick auf System-Prompt oder Fine-Tuning-Datensatz vermuten lässt.

Geschlossener Regelkreis lässt automatisiertes Red-Teaming aus eigenen Funden lernen

Dongdong Zhang und ein elfköpfiges Team von Microsoft stellen mit CART (Closed-Loop Adaptive Red Teaming) ein Rahmenwerk vor, das automatisiertes Sicherheitstesten nicht mehr auf das Abspielen fester Prompt-Listen beschränkt, sondern aus jedem Testergebnis lernt, was als Nächstes geprüft wird. Das System trennt einen Challenger, der neue Tests erzeugt, ein Target, das ein reines Textmodell oder ein werkzeugnutzender Agent sein kann, und einen Judge, der Ergebnisse bewertet, wodurch sich die drei Rollen unabhängig voneinander untersuchen lassen. Über drei Testfamilien (Frontier, JAH und Agentic) hinweg findet CART bei jedem Target mit verfügbarer Vergleichsbasis mehr Schwachstellen und ein höheres durchschnittliches Risiko als starres Wiederholen fester Test-Prompts, auch bei werkzeugvermittelten Agenten-Tests. Das zählt, weil sich damit – ähnlich wie eine frühere Digest-Rotteam-Plattform mit sich entwickelnden Testumgebungen bereits zeigte – Sicherheitstests von einer einmaligen Checkliste zu einer fortlaufenden, überprüfbaren Suche nach Schwachstellen entwickeln lassen.

Modelle und Denkspuren

Geäußerte Denkschritte tragen seltener die tatsächliche Antwort, als Verhaltenstests suggerieren

Abhiram Bhupatiraju und Rayan Nyaupane prüfen in ihrer Arbeit, ob die von einem Sprachmodell schriftlich geäußerten Zwischenschritte (Chain-of-Thought, CoT) tatsächlich ursächlich für seine Antwort sind, statt nur plausibel zu klingen. Anders als frühere Verfahren, die Denkspur-Text bearbeiten und nur die resultierende Antwort beobachten, greifen sie direkt in die internen Aktivierungen ein: An synthetischen Mehrschritt-Suchaufgaben ersetzen sie die Aktivierungen an der Textstelle, an der ein Modell einen Zwischenschritt formuliert, durch die eines kontrafaktischen Laufs mit vorhersagbarem Zielergebnis. Bei Qwen3-4B erweisen sich so nur 76,9 Prozent der geäußerten Schritte als tatsächlich kausal wirksam, während der klassische Verhaltenstest an denselben Beispielen 88,2 Prozent meldet – eine Überschätzung der Denkspur-Treue um 11,4 Prozentpunkte, bei den leichtesten Aufgaben sogar um bis zu 20 Punkte; beim kleineren Qwen3-1.7B bricht die kausale Treue mit wachsender Schritt-Tiefe von 68 auf 30 Prozent ein. Das zählt, weil Sicherheitsverfahren zunehmend auf das Mitlesen von Denkspuren setzen, um riskantes Modellverhalten frühzeitig zu erkennen – ein früherer Digest-Fund zur Tag-zu-Tag-Instabilität von Denkspur-Treue zeigte bereits ähnliche Grenzen, und diese Studie liefert nun einen kausalen Maßstab dafür, wie sehr gängige Verhaltenstests solche Denkspuren beschönigen.

Tencent veröffentlicht offenes 80-Milliarden-Parameter-Modell mit umschaltbarer Denktiefe

Das Tencent-Hunyuan-Team stellt mit Hunyuan-A13B ein offenes Sprachmodell auf Basis einer Mixture-of-Experts-Architektur (eine Architektur, bei der pro Anfrage nur ein Teil spezialisierter Teilnetzwerke aktiviert wird) vor, das bei 80 Milliarden Gesamtparametern nur 13 Milliarden davon pro Anfrage aktiviert. Ein zweistufiges Chain-of-Thought-Rahmenwerk lässt das Modell zwischen schnellem Denken für Routineanfragen und langsamerem, mehrstufigem Denken für komplexe Probleme wechseln; trainiert wurde es auf einem 20-Billionen-Token-Korpus mit verstärkter MINT-Kuration sowie anschließendem überwachtem Feintuning und groß angelegtem Reinforcement Learning. Nach Angaben des Teams verbessert dies die Leistung über Mathematik, Naturwissenschaften, Programmierung, allgemeines Sprachverständnis und Agenten-Aufgaben hinweg. Das zählt, weil sich damit die offene chinesische MoE-Modell-Reihe fortsetzt, die bereits Tencents 295-Milliarden-Parameter-Modell Hy3 im Sommer prägte – Hunyuan-A13B setzt nun mit deutlich kleinerer aktivierter Parameterzahl auf Effizienz bei vergleichbarem Agenten-Fokus.

Vier der fünf Arbeiten – zu Marktplatz-Steuerung, Alignment-Trägheit, Red-Teaming und Denkspur-Treue – sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Auch der Hunyuan-A13B-Technical-Report ist ein unabhängig nicht geprüftes Selbstzeugnis des Herstellerteams. Wie belastbar sich CAVEATs 55-Prozent-Wiederherstellung, die gemessene Alignment-Trägheit und die kausale 76,9-Prozent-Denkspur-Treue außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.

Häufige Fragen

Sind die vorgestellten Paper von Fachleuten begutachtet?

Vier der fünf Arbeiten – zu Marktplatz-Steuerung, Alignment-Trägheit, Red-Teaming und Denkspur-Treue – sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle. Auch der Hunyuan-A13B-Technical-Report ist ein unabhängig nicht geprüftes Selbstzeugnis des Herstellerteams. Die in diesem Digest referierten Zahlen stammen bei allen fünf Arbeiten aus den jeweiligen Preprint-Fassungen bzw. dem Technical Report.

Stellen die Autoren Code oder Daten zur Verfügung?

Tencent veröffentlicht die Modellgewichte von Hunyuan-A13B nach eigenen Angaben offen. Aus den Abstracts der Studien zu CAVEAT, Alignment-Trägheit, CART und der Denkspur-Treue-Arbeit geht zum Zeitpunkt dieses Digests keine vollständige Code- oder Datenveröffentlichung hervor; wer die Ergebnisse nachvollziehen möchte, ist bislang auf die in den Papern beschriebenen Benchmarks und Verfahren angewiesen.

Warum unterscheidet sich die Denkspur-Treue im Verhaltenstest so stark von der kausalen Messung?

Klassische Verhaltenstests bearbeiten nur den Text der Denkspur und beobachten, ob sich die finale Antwort ändert – das kann auch dann geschehen, wenn der bearbeitete Schritt gar nicht ursächlich für die ursprüngliche Antwort war. Die Studie von Bhupatiraju und Nyaupane greift stattdessen direkt in die internen Aktivierungen ein und prüft, ob ein Schritt tatsächlich das kausal wirksame Zwischenergebnis trägt. Dadurch fällt die gemessene Treue bei Qwen3-4B mit 76,9 Prozent niedriger aus als die 88,2 Prozent des Verhaltenstests an denselben Beispielen.

Bedeutet der Befund zur Alignment-Trägheit, dass Fine-Tuning grundsätzlich nutzlos ist, um Modellverhalten zu ändern?

Das legt die Studie nicht nahe. Sie zeigt, dass die Wirksamkeit von System-Prompts und LoRA-Fine-Tuning je nach Modell, Themenbereich und Richtung der gewünschten Verhaltensänderung stark schwankt – in den meisten getesteten Bedingungen wirkten die Eingriffe, nur in Mistrals restriktiver Hassrede-Bedingung verstärkte LoRA das Vorverhalten statt es zu überschreiben. Die Autoren liefern mit der Kennzahl Override Success Rate zugleich ein Werkzeug, mit dem sich solche Problemfälle vorab abschätzen lassen.

Quellen (5)
  1. CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments
  2. Are Stated Reasoning Steps Causally Load-Bearing?
  3. Alignment Inertia: Auditing the Durability of Training Data Influence Through Policy Override Resistance
  4. CART: Closed-Loop Adaptive Red Teaming for Large Language Models
  5. Hunyuan-A13B Technical Report

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog