Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.CL und cs.LG wählt dieser Digest fünf Preprints aus, die zeigen, wie brüchig gängige Mess- und Trainingsverfahren heutiger KI-Systeme bei genauerem Hinsehen sind: wie verlässlich der Konsens mehrerer KI-Richter tatsächlich ist, wie einheitliches KI-Urteilen bei Bewerbungen Diskriminierung verschärfen kann, ob sich Computer-bedienende Agenten Sicherheit und Aufgaben-Erfolg gemeinsam beibringen lassen, wie sich sicherheitsschädliche Trainingsdaten über mehrere Sprachen hinweg herausfiltern lassen und ob geteilte Experten Transformer sparsamer machen können, ohne an Leistung zu verlieren. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.
Bewertung und Fairness
KI-Richter sind sich einiger, als ihre Fehler unabhängig wären
Elias Hossain, Niloofar Yousefi und Ser-Nam Lim untersuchen in ihrer Studie, wie verlässlich es ist, aus dem Konsens mehrerer KI-Richtermodelle (LLM-as-a-Judge, bei dem ein Sprachmodell die Ausgabe eines anderen Modells bewertet) auf die Korrektheit eines Urteils zu schließen. Diese Praxis setzt laut den Autoren voraus, dass die Richter ihre Fehler unabhängig voneinander machen – eine Annahme, die sie an einer Bank aus zehn offenen und Frontier-Richtermodellen prüfen. Die durchschnittliche paarweise Fehlerkorrelation liege bei 0,21, wodurch die zehn Richter zusammen nur etwa so viel statistische Information lieferten wie 3,5 tatsächlich unabhängige Richter; unter besonders leistungsstarken Frontier-Richtern sei die Abhängigkeit sogar noch ausgeprägter, auch über verschiedene Anbieter hinweg. Werden geteilte Fehler ignoriert, komme man in bis zu 28 Prozent der Modellvergleiche zu dem Schluss, ein System sei signifikant besser, während die Berücksichtigung der Fehlerabhängigkeit diesen Unterschied nicht mehr stütze. Das zählt, weil bereits ein früherer Digest-Fund zur Tag-zu-Tag-Instabilität von KI-Richtern zeigte, wie brüchig einzelne Richterurteile sein können – diese Studie liefert dazu den strukturellen Grund, warum auch das Zusammenschalten mehrerer Richter dieses Problem nicht automatisch löst.
KI-Einigkeit bei Bewerbungen verdreifacht die systemische Ausgrenzung
Matthew Bone, Fabian Stephany und Maria del Rio-Chanona zeigen in ihrer Untersuchung, was passiert, wenn viele Arbeitgeber ähnlich trainierte Sprachmodelle für die Bewerber-Vorauswahl einsetzen. An zehn Sprachmodellen verglichen sie Basisversionen mit ihren nachtrainierten (post-trainierten) Gegenstücken bei simulierten Einstellungsentscheidungen. Nachtrainierte Modelle laden laut den Autoren ältere Bewerber im Schnitt 3,6 Prozent seltener zum Gespräch ein als ihre Basisversionen – ein Effekt, der sich bei acht der zehn getesteten Modelle zeigte und vor allem auf verstärkte Altersdiskriminierung im Nachtraining zurückgehe. Weil nachtrainierte Modelle deutlich stärker übereinstimmende Entscheidungen träfen als Basismodelle, wahrscheinlich getrieben von Merkmalen wie Qualifikation oder Studienfach, steige die über alle Modelle hinweg gemeinsam ausgeschlossene Bewerbergruppe von 5,6 auf 17,3 Prozent; für Bewerber mit mehreren benachteiligten Merkmalen zugleich liege die Ausschlussquote sogar zwischen 12,2 und 21,7 Prozent. Das zählt, weil sich damit ein Diskriminierungs-Risiko zeigt, das über einzelne fehlerhafte Modelle hinausgeht: Setzen viele Arbeitgeber ähnlich trainierte Modelle ein, können sich individuelle Vorurteile laut den Autoren zu einem einheitlichen, marktweiten Ausschluss-Muster verdichten – ein Mechanismus, der über den Einzelfall der KI-gestützten Meta-Entlassungen, gegen die 26 Beschäftigte klagten, hinausweist.
Agenten, Sicherheit und Effizienz
Computer-Agenten lernen Aufgaben-Erfolg und Risiko-Abwägung gemeinsam
Zeyu Kang und ein siebenköpfiges Team stellen mit SCOPE (Safety and Capability Optimization for Policy Execution) ein Trainingsverfahren für Computer-bedienende Agenten (CUAs, KI-Systeme, die Aufgaben direkt über grafische Bedienoberflächen ausführen) vor, das Aufgaben-Erfolg und sicherheitsbewusstes Entscheiden gemeinsam statt getrennt trainiert. Für aligniertes Trainingsmaterial entwickelten die Autoren zusätzlich SCOPE-Gen, eine automatisierte Pipeline, die überprüfbare Aufgaben erzeugt und daraus gepaarte Varianten mit Umgebungsrisiko ableitet, sowie den daraus resultierenden Trajektorien-Datensatz SATraj-OS mit Fähigkeits-Demonstrationen, sicheren Fortsetzungen und expliziten Verweigerungen. Trainiert wurde zunächst per überwachtem Feintuning auf allen drei Trajektorien-Typen und anschließend per Online-Reinforcement-Learning weiter verbessert; das Modell Qwen3.5-9B erreichte damit 54,17 Prozent Aufgaben-Erfolg auf dem Benchmark OSWorld, 64,30 Prozent Angriffsvermeidung auf OS-BLIND und mit 58,80 Prozent den höchsten gemessenen kombinierten Fähigkeits-Sicherheits-Wert unter den verglichenen Agenten. Das zählt, weil frühere Digest-Funde zu Agenten-Risiken und Guardrails zeigten, dass reines Aufgabentraining Sicherheit nicht automatisch mitliefert – SCOPE liefert dazu einen konkreten Trainingsansatz, der beides gemeinsam adressiert, statt Sicherheit nachträglich aufzusetzen.
Sicherheitsschädliche Trainingsdaten verstecken sich in unterschiedlichen Sprach-Schichten
Jiakun Li und fünf weitere Autoren zeigen in ihrer Arbeit, dass sich vermeintlich harmlose Feintuning-Daten (Nachtrainings-Datensätze, die eigentlich nur neue Fähigkeiten vermitteln sollen) unbemerkt negativ auf die Sicherheitsausrichtung eines Sprachmodells auswirken können – und dass bisherige Erkennungsverfahren, die nur eine einzelne sicherheitsrelevante Modell-Schicht betrachten, bei mehrsprachigen Modellen zu kurz greifen. Ihre sprachübergreifende Analyse zeigt, dass sicherheitsrelevante Schichten zwischen Sprachen nur teilweise übereinstimmen und sich Sicherheitssignale oft über mehrere Schichten verteilen statt sich in einer einzigen zu bündeln. Mit MMSAFE stellen sie ein mehrschichtiges Rahmenwerk vor, das sowohl geteilte als auch sprachspezifische Sicherheitssignale erfasst, um sicherheitsschädliche Trainingsdaten zu identifizieren. In Experimenten über mehrere Modelle, Sprachen und Sicherheits-Benchmarks hinweg senke MMSAFE die durchschnittliche Rate schädlicher Antworten um 60 Prozent gegenüber zufälliger Datenfilterung und übertreffe dabei im Durchschnitt auch das stärkste Einzelschicht-Verfahren. Das zählt, weil Sicherheitsausrichtung bislang oft an überwiegend englischsprachigen Daten entwickelt und geprüft wird – diese Studie zeigt, dass sich Schutzmechanismen nicht ohne Weiteres von einer Sprache auf andere übertragen lassen.
Geteilte Experten machen Transformer sparsamer, ohne an Genauigkeit zu verlieren
Dian Jiao und fünf weitere Autoren adressieren in ihrer Arbeit ein strukturelles Problem heutiger Mixture-of-Experts-Modelle (MoE, eine Architektur, bei der pro Eingabe nur ein Teil spezialisierter Teilnetzwerke aktiviert wird): Weil jede Transformer-Schicht klassischerweise ihre eigenen, schicht-isolierten Experten besitzt, lernen benachbarte Schichten häufig redundante Funktionen. Mit CS-MoE schlagen die Autoren stattdessen einen zentralen, schichtübergreifend geteilten Experten-Pool vor, auf den einzelne Schichten zusätzlich zu ihren eigenen unabhängigen Experten zugreifen können – ein Mechanismus, der die Aktivierung von Parametern und Rechenaufwand pro Token elastisch steuerbar macht. In Experimenten erreichte CS-MoE laut den Autoren eine niedrigere Perplexität (ein Maß für die Vorhersagegüte eines Sprachmodells) als gleich große, dichte Transformer, während gleichzeitig nur 55 Prozent der Parameter aktiviert wurden; die Leistung skaliere zudem gleichmäßig mit der Zahl aktivierter Experten und nähere sich bei festem Rechenbudget klassischen MoE-Modellen mit höherem Rechenaufwand an. Das zählt, weil sich damit eine flexible Kompromisslinie zwischen Rechenkosten und Modellkapazität ergibt, die sich – ähnlich wie ein früherer Digest-Fund zu einem MoE-Modell auf einer einzelnen Edge-Grafikkarte zeigte – gezielt für rechenbeschränkte Umgebungen nutzen lässt.
Vier der fünf Arbeiten sind bislang unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind nicht durch unabhängige Begutachtung oder Replikation bestätigt. Die Studie zu mehrsprachigen Sicherheitssignalen ist nach Angaben der Autoren zwar für die Hauptkonferenz von EMNLP 2026 angenommen, liegt zum Zeitpunkt dieses Digests aber noch als Preprint vor. Wie belastbar sich SCOPEs Sicherheits-Fähigkeits-Kompromiss und CS-MoEs Parameter-Einsparung außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen – die Studie zum Richter-Konsens in diesem Digest liefert dafür selbst eine Mahnung: Auch mehrere übereinstimmende automatisierte Urteile sind kein Ersatz für unabhängige Prüfung.


