Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.LG und cs.CL wählt dieser Digest vier Preprints aus, die zeigen, wie weit Agenten durch Übung und die richtige Werkzeugausstattung kommen – und wo Kontrolle und Sicherheit mit diesem Tempo noch nicht mithalten. Zwei Arbeiten drehen sich um Agenten, die sich durch Wiederholung und bessere Wahrnehmung selbst verbessern, zwei weitere um blinde Flecken bei der Prüfung von Cybersicherheits-Werkzeugnutzung und beim Training mit überprüfbaren Belohnungen. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt vierfacher Wiederholung desselben Teilgebiets.
Agenten in der Praxis
Ein visueller Harness hebt Claude auf ein perfektes Rätsel-Ergebnis
Qiushi Han und ein vierköpfiges Team von Forschenden unter anderem am MIT stellen mit VISTA einen visuellen Harness vor – ein Gerüst aus Werkzeugen und Regeln, das einem bestehenden Modell zusätzliche Fähigkeiten verschafft, ohne es neu zu trainieren. VISTA gibt einem multimodalen Modell ein verlustfreies visuelles Gedächtnis: Statt frühere Bildschirmansichten zu verwerfen, bewahrt es sie im Original auf, sodass das Modell gezielt auf zurückliegende Beobachtungen zurückgreifen und seine visuelle Eingabe aktiv neu ordnen kann, während es nachdenkt. Auf dem Benchmark ARC-AGI-3 – einer Sammlung interaktiver visueller Rätsel, die gezielt so gestaltet sind, dass sie sich nicht auswendig lernen lassen – hebt dieser Ansatz nach Angabe der Autoren den Effizienz-Wert von Claude Opus 5.0 von 40,68 auf einen perfekten Wert von 100,00 und löst alle 25 öffentlichen Spiele mit 57,4 Prozent weniger Aktionen als menschliche Erstspieler. Das zählt, weil es zeigt, dass ein Großteil dessen, was Agenten heute noch an visueller Kontinuität fehlt, offenbar nicht am zugrunde liegenden Modell liegt, sondern am Gerüst drumherum – ein Befund, der an einen früheren Digest-Fund anschließt, wonach Claude Opus 4.8 ganz ohne Spezialtraining Goldmedaillen-Niveau bei der Linguistik-Olympiade erreichte: In beiden Fällen entscheidet weniger das Modell selbst als die Aufgabenumgebung und das Zusammenspiel mit ihr über das Ergebnis.
Ein Roboter-Agent übt sich von 28,6 auf 95,0 Prozent Erfolgsquote hoch
Yen-Jen Wang und ein neunköpfiges Team unter anderem von UC Berkeley stellen mit Reconstruct, Practice, Go Real (RPG) ein Verfahren vor, mit dem ein Roboter-Ausführungssystem sich selbst verbessert, ohne die Gewichte des zugrunde liegenden Modells zu verändern. RPG identifiziert in einem vorhandenen Datensatz vorhandene Manipulationsfähigkeiten, baut dazu passende Übungsaufgaben in Simulation und diagnostiziert anhand von Ausführungs-Feedback, privilegiertem Simulatorzustand und Beispielvideos, warum ein Versuch scheitert. Aus diesen Diagnosen entwickelt das System neue, wiederverwendbare symbolische Fertigkeiten, verfeinert bestehende und passt den Systemprompt an, bevor es jede Änderung in eigenen Testläufen prüft. Bei 22 Manipulationsaufgaben steigt die Erfolgsquote dadurch den Autoren zufolge von 28,6 Prozent nach der ersten Übungsrunde auf 95,0 Prozent nach 15 Runden – deutlich vor den Vergleichsverfahren ASPIRE (75,5 Prozent) und einem GPT-6-Astra-Pro-gestützten Agenten (60,0 Prozent); nach einer einmaligen Kalibrierung besteht das eingefrorene System anschließend alle 30 physischen Testdurchläufe auf echter Hardware. Das zählt, weil es einen Weg zeigt, Roboterfähigkeiten durch Übung statt durch erneutes, teures Training zu verbessern – ein Ansatz, der sich von einem früheren Digest-Fund unterscheidet, in dem ein einziger Agent verschiedene Roboterplattformen ganz ohne jedes Spezialtraining steuerte: Dort zählte die Generalität ganz ohne Anpassung, hier der gezielte Lernfortschritt auf eine konkrete Aufgabe hin.
Sicherheit und Training
Kein offenes Modell übersetzt Sicherheits-Befehle zuverlässig in die Kommandozeile
Pengfei Li und ein dreiköpfiges Team stellen mit KaliBench einen Benchmark vor, der prüft, wie zuverlässig Sprachmodelle natürlichsprachliche Anweisungen in ausführbare Befehle für Cybersicherheits-Werkzeuge auf Kali Linux übersetzen – eine auf Penetrationstests spezialisierte Linux-Distribution. Der Datensatz umfasst 8.504 Anfrage-Befehl-Paare über 1.642 Werkzeuge, 23 Fähigkeitsdimensionen und fünf Phasen eines Sicherheitstests, konstruiert über eine Pipeline mit deterministischer Vereinheitlichung der Befehlsformen und einer mehrstufigen Prüfung aus automatischer Bewertung, isolierter Testausführung und menschlicher Kontrolle. In 24 Konfigurationen allgemeiner und sicherheitsspezialisierter offener Modelle erreicht laut den Autoren kein einziges mehr als 42 Prozent exakte Befehlsgenauigkeit im unbeschränkten Testmodus, was die Schwierigkeit präziser Kommandozeilen-Befehle ganz ohne Werkzeughinweise unterstreiche; gezieltes Feintuning und Reinforcement Learning mit überprüfbaren Belohnungen aus KaliBench heben ein 8-Milliarden-Parameter-Modell anschließend auf ein Niveau, das einem 685-Milliarden-Parameter-Mixture-of-Experts-Modell entspricht. Das zählt, weil Sicherheitsteams zunehmend prüfen, ob sich Routineaufgaben bei Penetrationstests an Sprachmodelle delegieren lassen, obwohl schon einfache Flag-Verwechslungen einen Befehl unbrauchbar machen können – diese Studie liefert dafür erstmals eine feingranulare, reproduzierbare Messlatte statt reiner End-to-End-Erfolgsquoten.
Trainingsdruck erlaubt unkontrollierten Sprachdrift in Denkspuren
Michael Sullivan und Alexander Koller untersuchen in ihrer Studie, warum Reasoning-Modelle beim Nachdenken zunehmend in ungewöhnliche, kaum verständliche Sprache abgleiten – ein Phänomen, das die Überwachbarkeit ihrer Denkspuren durch Menschen erschwert. Die Autoren zeigen zunächst theoretisch, dass Reinforcement Learning mit überprüfbaren Belohnungen (RLVR) unbegrenzten Sprachdrift zulässt, während überwachtes Feintuning (SFT) dies nicht tut, weil es das Modell enger an vorgegebene, menschenlesbare Textbeispiele bindet. Empirisch tritt der Drift demnach gezielt dann auf, wenn RLVR auf neuartigen Aufgaben trainiert wird, für die das Basismodell das Zielverhalten noch nicht beherrscht – das Modell entwickelt dann, so die Autoren, eigene sprachliche Abkürzungen, statt auf bereits erlernte, verständliche Denkmuster zurückzugreifen. Als dritten Schritt beweisen sie formal, dass sich Sprachdrift nicht eindämmen lässt, ohne zugleich die erwartete Belohnung zu begrenzen – Überwachbarkeit der Denkspur und Trainingsleistung stehen demnach bei RLVR an der Spitze der Modellentwicklung in einem nicht auflösbaren Zielkonflikt. Das zählt, weil Anbieter von Reasoning-Modellen lesbare Denkspuren zunehmend als Sicherheitsmerkmal anführen, obwohl dieser Befund nahelegt, dass gerade das Training, das die stärksten Fähigkeitssprünge bringt, diese Lesbarkeit systematisch untergräbt; der Befund ergänzt einen früheren Digest-Fund, wonach allein die Sprache, in der ein Modell nachdenkt, seine Bereitschaft zu einem simulierten Atomschlag von 93 auf 17 Prozent senken konnte: Beide Arbeiten zeigen, wie stark die Sprache der Denkspur das Verhalten eines Modells mitbestimmt, ohne dass Nutzende das ohne Weiteres bemerken.
Alle vier Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Für VISTA, RPG und KaliBench stellen die Autoren Projektseiten beziehungsweise Teile von Code und Daten in Aussicht, für die Studie zum Sprachdrift ist aus dem Abstract keine Veröffentlichung von Material ersichtlich. Wie belastbar sich die perfekte ARC-AGI-3-Quote, die 95-Prozent-Erfolgsquote des Roboter-Agenten, die 42-Prozent-Obergrenze bei KaliBench und der bewiesene Zielkonflikt zwischen Sprachdrift und Trainingsleistung außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.


