Aus den arXiv-Neueinreichungen der vergangenen Tage in cs.AI, cs.LG und cs.CL wählt dieser Digest vier Preprints aus, die zeigen, wie weit Agenten inzwischen in reale Produktionsumgebungen vorstoßen – und wie lückenhaft Kontrolle, Kostenbewusstsein und Selbsteinschätzung dabei noch bleiben.
Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt vierfacher Wiederholung desselben Teilgebiets.
Agenten in der Praxis
Agenten scheitern bei Produktionsstörungen in mehr als einem Drittel der Fälle
Andre Fu und ein siebenköpfiges Team stellen mit Incident-Arena einen Benchmark vor, der KI-Coding-Agenten nicht beim Schreiben neuer Funktionen testet, sondern beim Beheben echter Produktionsstörungen – einem Feld, das als agentisches Site Reliability Engineering (SRE, der Betrieb und die Absicherung laufender Systeme) bezeichnet wird.
Jede der 20 Testaufgaben läuft auf einem eigens hochgefahrenen Kubernetes-Cluster, in den die Autoren gezielt einen Fehler einschleusen, während eine realistische Lastkurve weiterläuft. Statt nur zu prüfen, ob Code kompiliert, hält ihr neues Verifikationsverfahren Systemkennzahlen stabil und bestätigt, dass eine Reparatur die Störung tatsächlich behebt, ohne neue Nebenwirkungen einzuführen.
Über 20 Aufgaben und drei Anwendungs-Substrate hinweg erreichen führende Modelle den Autoren zufolge weniger als 64,3 Prozent, mit Fehlern von Fehldiagnosen über unvollständige Reparaturen bis zu riskanten Rückschritten; ein einzelner Testlauf verbraucht dabei im Schnitt 2,81 Millionen Token über 41 Dialogrunden.
Das zählt, weil Unternehmen KI-Agenten zunehmend nicht nur zum Programmieren, sondern auch zum Betrieb kritischer Systeme einsetzen wollen; ein früherer Digest-Fund dokumentierte bereits anhand von 147 echten Produktionsvorfällen, warum klassische Verlässlichkeits-Bausteine aus Microservice-Architekturen bei KI-Agenten versagen: Beide Arbeiten deuten darauf hin, dass der Sprung von der Demo-Umgebung in den echten Produktionsbetrieb die größte verbleibende Hürde für Agenten bleibt.
Ein Ensemble kleiner Modelle schlägt GPT-5.4 bei Kosten und Genauigkeit zugleich
Alexei N. Skurikhin, Emily M.
Taylor und Nathan A. DeBardeleben zeigen in ihrer Studie, dass die reine Leaderboard-Genauigkeit bei agentisch eingesetzten Sprachmodellen zu kurz greift: Ebenso entscheidend seien Betriebskosten, Antwortzeit und Token-Effizienz.
Ihr Ensemble aus mehreren kleinen Sprachmodellen (SLMs, Modelle mit deutlich weniger Parametern als die größten verfügbaren Systeme) mit einem SLM als Rückmelde-Richter erreicht auf dem 541-Aufgaben-Benchmark IFEval 97,34 Prozent exakte Befolgung von Formatvorgaben und übertrifft damit die Basislinie des großen Modells GPT-5.4 um 5,81 Prozentpunkte – bei geringeren Kosten als das einzelne Vergleichsmodell.
Die Autoren werten dafür zusätzlich Token-Zusammensetzung, Kostenaufteilung je Beispiel und Leistung über verschiedene Anweisungskategorien hinweg aus. Das zählt, weil es zeigt, dass zusätzliche Testzeit-Rechenschritte mehrerer kleiner, günstigerer Modelle ein einzelnes großes Modell nicht nur einholen, sondern unterbieten können; ein früherer Digest-Fund zeigte bereits, dass ein großes Sprachmodell für Einbettungsaufgaben bis zu 1.431-mal teurer sein kann als ein spezialisiertes Modell bei nahezu gleicher Qualität: Beide Arbeiten deuten darauf hin, dass die Wahl des richtig dimensionierten Modells für den jeweiligen Schritt oft mehr bringt als pure Modellgröße.
Sicherheit und Selbsteinschätzung
Ein Käfig für Backdoors: Angriffserfolg von 100 auf 0 bis 10 Prozent gedrückt
Jianwei Li, Min-Seon Kim und Jung-Eun Kim schlagen mit Quarantined Expert Shutdown (QES) eine dritte Strategie gegen Backdoor-Angriffe auf Sprachmodelle vor – versteckte Verhaltensänderungen, die ein Modell nur bei einem geheimen Auslöser zeigt.
Bisherige Abwehrmethoden versuchen entweder, die Backdoor-Bildung beim Training von vornherein zu unterdrücken, oder ein bereits infiziertes Modell nachträglich zu reinigen. QES lässt die Backdoor stattdessen während des Trainings entstehen, lenkt das darauf ausgerichtete Verhalten aber gezielt in eine isolierte, auf LoRA-Modulen (kleinen, nachrüstbaren Gewichtsanpassungen) basierende Experten-Komponente in einer an Mixture-of-Experts angelehnten Struktur.
Beim Einsatz lässt sich diese Komponente mit einer einzigen, rechenzeitkonstanten Operation abschalten, indem ihr Routing-Gewicht auf null gesetzt wird – ganz ohne Trigger-Suche oder erneutes Training. In Tests über zwei Aufgaben, drei Angriffsarten und vier Modellfamilien senkt das Verfahren die Erfolgsquote der Angriffe den Autoren zufolge von 100 Prozent auf 0 bis 10 Prozent, während die reguläre Leistung des Modells überwiegend erhalten bleibt.
Das zählt, weil sich Backdoors in fertig trainierten Modellen bislang kaum rückstandsfrei entfernen ließen, ohne das gesamte Modell zu beschädigen; ein früherer Digest-Fund zeigte, wie verwundbar das Routing von Mixture-of-Experts-Modellen grundsätzlich ist – dort reichten im Schnitt weniger als vier gezielt gekippte Routing-Bits für eine Token-Ausgabe-Aufblähung von 5.912 Prozent: QES zeigt nun, wie sich genau diese Routing-Struktur auch gezielt zur Verteidigung nutzen lässt.
Verbalisierte Konfidenz verrät mehr über ein Modell, als gedacht
Sinead Williamson, Jiaxuan Li, Nick Foti, Russ Webb und Masha Fedzechkina untersuchen in ihrer Studie, ob die in Worten oder Zahlen ausgesprochene Konfidenz eines Sprachmodells mit seiner internen, aus der Sampling-Verteilung ablesbaren Unsicherheit übereinstimmt.
Durch gezielte Eingriffe in Trainings- und Kontextdaten trennen die Autoren zwei Unsicherheitsquellen: Häufigkeiten in den Trainingsdaten und explizit formulierte Wahrscheinlichkeitsaussagen. Beide Quellen beeinflussen den Autoren zufolge sowohl die interne als auch die verbalisierte Konfidenz – und beide Kennzahlen stimmen deutlich stärker überein, als es allein durch das gemeinsame Verfolgen derselben Unsicherheitsquellen zu erwarten wäre.
Das deute darauf hin, dass sich aus der ausgesprochenen Konfidenz eines Modells tatsächlich Rückschlüsse auf seine interne Verteilung ziehen lassen, statt dass es sich dabei nur um eine lose formulierte Floskel handelt. Das zählt, weil Nutzende ausgesprochene Sicherheits-Angaben von Sprachmodellen oft als reine Rhetorik abtun; ein früherer Digest-Fund relativierte Selbstauskünfte von Sprachmodellen deutlich schärfer – dort korrelierte die direkte Selbsteinschätzung eines Modells über sein eigenes Verhalten mit der Realität nur bei r = 0,04: Beide Arbeiten deuten darauf hin, dass Sprachmodelle über unterschiedliche Arten von Selbstwissen sehr unterschiedlich verlässlich Auskunft geben – über ihre eigene Konfidenz offenbar eher als über ihr tatsächliches Verhalten.
Von den vier vorgestellten Arbeiten hat bislang nur die Studie zu Quarantined Expert Shutdown mit der Annahme bei der Konferenz NeurIPS 2026 ein vollständiges Begutachtungsverfahren durchlaufen; die Tokenomics-Studie zum SLM-Ensemble wurde für ein Workshop-Programm der ACM CAIS 2026 akzeptiert.
Incident-Arena und die Studie zur verbalisierten Konfidenz liegen dagegen als unbegutachtete arXiv-Preprints vor. Die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind, wo noch keine vollständige Begutachtung stattfand, nicht unabhängig bestätigt.
Wie belastbar die 64,3-Prozent-Grenze bei Produktionsvorfällen, die Kosten- und Genauigkeitsvorteile des SLM-Ensembles, die Senkung der Backdoor-Erfolgsquote auf 0 bis 10 Prozent und die Kopplung von verbalisierter und interner Konfidenz außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.



