Forschung

Vier KI-Paper: Claude meistert ARC-AGI, Roboter übt sich hoch

5 Min. Lesezeit

TL;DR Too Long; Didn’t read

Vier neue arXiv-Preprints der vergangenen Tage zeigen: Am auffälligsten ist der Befund, dass ein visueller Harness den Effizienz-Wert von Claude Opus 5.0 auf dem Rätsel-Benchmark ARC-AGI-3 von 40,68 auf einen perfekten Wert von 100,00 hebt, bei 57,4 Prozent weniger Aktionen als menschliche Teilnehmer. Eine zweite Studie lässt einen Roboter-Agenten durch wiederholtes Üben in Simulation und Praxis die Erfolgsquote bei Objektmanipulation von 28,6 auf 95,0 Prozent steigern und besteht anschließend alle 30 physischen Testdurchläufe. Ein dritter Preprint zeigt mit einem neuen Cybersicherheits-Benchmark, dass kein offenes Sprachmodell mehr als 42 Prozent exakter Kommandozeilen-Befehle für Sicherheitswerkzeuge liefert. Eine vierte Arbeit weist nach, dass Reinforcement Learning mit überprüfbaren Belohnungen unkontrollierten Sprachdrift in Denkspuren zulässt, während klassisches Feintuning dies verhindert.

Eine Lupe schwebt über einem Stapel Fachpapiere, aus dem ein Roboterarm ein leuchtendes Puzzleteil in ein makelloses Raster aus Quadraten einsetzt. Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • Ein visueller Agenten-Harness hebt Claude Opus 5.0 auf dem Rätsel-Benchmark ARC-AGI-3 von 40,68 auf den perfekten Wert 100,00.
  • Durch simuliertes Üben steigt die Erfolgsquote eines Roboter-Agenten von 28,6 auf 95,0 Prozent, bestätigt in 30 Praxistests.
  • Kein offenes Sprachmodell übersetzt Anfragen zu mehr als 42 Prozent korrekt in Kommandozeilen-Befehle für Sicherheitswerkzeuge.
  • Reinforcement Learning mit überprüfbaren Belohnungen erlaubt unbegrenzten Sprachdrift in Denkspuren, reines Feintuning verhindert ihn nachweislich.

Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI, cs.LG und cs.CL wählt dieser Digest vier Preprints aus, die zeigen, wie weit Agenten durch Übung und die richtige Werkzeugausstattung kommen – und wo Kontrolle und Sicherheit mit diesem Tempo noch nicht mithalten. Zwei Arbeiten drehen sich um Agenten, die sich durch Wiederholung und bessere Wahrnehmung selbst verbessern, zwei weitere um blinde Flecken bei der Prüfung von Cybersicherheits-Werkzeugnutzung und beim Training mit überprüfbaren Belohnungen. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen mit Zahlen und thematischer Streuung statt vierfacher Wiederholung desselben Teilgebiets.

Agenten in der Praxis

Ein visueller Harness hebt Claude auf ein perfektes Rätsel-Ergebnis

Qiushi Han und ein vierköpfiges Team von Forschenden unter anderem am MIT stellen mit VISTA einen visuellen Harness vor – ein Gerüst aus Werkzeugen und Regeln, das einem bestehenden Modell zusätzliche Fähigkeiten verschafft, ohne es neu zu trainieren. VISTA gibt einem multimodalen Modell ein verlustfreies visuelles Gedächtnis: Statt frühere Bildschirmansichten zu verwerfen, bewahrt es sie im Original auf, sodass das Modell gezielt auf zurückliegende Beobachtungen zurückgreifen und seine visuelle Eingabe aktiv neu ordnen kann, während es nachdenkt. Auf dem Benchmark ARC-AGI-3 – einer Sammlung interaktiver visueller Rätsel, die gezielt so gestaltet sind, dass sie sich nicht auswendig lernen lassen – hebt dieser Ansatz nach Angabe der Autoren den Effizienz-Wert von Claude Opus 5.0 von 40,68 auf einen perfekten Wert von 100,00 und löst alle 25 öffentlichen Spiele mit 57,4 Prozent weniger Aktionen als menschliche Erstspieler. Das zählt, weil es zeigt, dass ein Großteil dessen, was Agenten heute noch an visueller Kontinuität fehlt, offenbar nicht am zugrunde liegenden Modell liegt, sondern am Gerüst drumherum – ein Befund, der an einen früheren Digest-Fund anschließt, wonach Claude Opus 4.8 ganz ohne Spezialtraining Goldmedaillen-Niveau bei der Linguistik-Olympiade erreichte: In beiden Fällen entscheidet weniger das Modell selbst als die Aufgabenumgebung und das Zusammenspiel mit ihr über das Ergebnis.

Ein Roboter-Agent übt sich von 28,6 auf 95,0 Prozent Erfolgsquote hoch

Yen-Jen Wang und ein neunköpfiges Team unter anderem von UC Berkeley stellen mit Reconstruct, Practice, Go Real (RPG) ein Verfahren vor, mit dem ein Roboter-Ausführungssystem sich selbst verbessert, ohne die Gewichte des zugrunde liegenden Modells zu verändern. RPG identifiziert in einem vorhandenen Datensatz vorhandene Manipulationsfähigkeiten, baut dazu passende Übungsaufgaben in Simulation und diagnostiziert anhand von Ausführungs-Feedback, privilegiertem Simulatorzustand und Beispielvideos, warum ein Versuch scheitert. Aus diesen Diagnosen entwickelt das System neue, wiederverwendbare symbolische Fertigkeiten, verfeinert bestehende und passt den Systemprompt an, bevor es jede Änderung in eigenen Testläufen prüft. Bei 22 Manipulationsaufgaben steigt die Erfolgsquote dadurch den Autoren zufolge von 28,6 Prozent nach der ersten Übungsrunde auf 95,0 Prozent nach 15 Runden – deutlich vor den Vergleichsverfahren ASPIRE (75,5 Prozent) und einem GPT-6-Astra-Pro-gestützten Agenten (60,0 Prozent); nach einer einmaligen Kalibrierung besteht das eingefrorene System anschließend alle 30 physischen Testdurchläufe auf echter Hardware. Das zählt, weil es einen Weg zeigt, Roboterfähigkeiten durch Übung statt durch erneutes, teures Training zu verbessern – ein Ansatz, der sich von einem früheren Digest-Fund unterscheidet, in dem ein einziger Agent verschiedene Roboterplattformen ganz ohne jedes Spezialtraining steuerte: Dort zählte die Generalität ganz ohne Anpassung, hier der gezielte Lernfortschritt auf eine konkrete Aufgabe hin.

Sicherheit und Training

Kein offenes Modell übersetzt Sicherheits-Befehle zuverlässig in die Kommandozeile

Pengfei Li und ein dreiköpfiges Team stellen mit KaliBench einen Benchmark vor, der prüft, wie zuverlässig Sprachmodelle natürlichsprachliche Anweisungen in ausführbare Befehle für Cybersicherheits-Werkzeuge auf Kali Linux übersetzen – eine auf Penetrationstests spezialisierte Linux-Distribution. Der Datensatz umfasst 8.504 Anfrage-Befehl-Paare über 1.642 Werkzeuge, 23 Fähigkeitsdimensionen und fünf Phasen eines Sicherheitstests, konstruiert über eine Pipeline mit deterministischer Vereinheitlichung der Befehlsformen und einer mehrstufigen Prüfung aus automatischer Bewertung, isolierter Testausführung und menschlicher Kontrolle. In 24 Konfigurationen allgemeiner und sicherheitsspezialisierter offener Modelle erreicht laut den Autoren kein einziges mehr als 42 Prozent exakte Befehlsgenauigkeit im unbeschränkten Testmodus, was die Schwierigkeit präziser Kommandozeilen-Befehle ganz ohne Werkzeughinweise unterstreiche; gezieltes Feintuning und Reinforcement Learning mit überprüfbaren Belohnungen aus KaliBench heben ein 8-Milliarden-Parameter-Modell anschließend auf ein Niveau, das einem 685-Milliarden-Parameter-Mixture-of-Experts-Modell entspricht. Das zählt, weil Sicherheitsteams zunehmend prüfen, ob sich Routineaufgaben bei Penetrationstests an Sprachmodelle delegieren lassen, obwohl schon einfache Flag-Verwechslungen einen Befehl unbrauchbar machen können – diese Studie liefert dafür erstmals eine feingranulare, reproduzierbare Messlatte statt reiner End-to-End-Erfolgsquoten.

Trainingsdruck erlaubt unkontrollierten Sprachdrift in Denkspuren

Michael Sullivan und Alexander Koller untersuchen in ihrer Studie, warum Reasoning-Modelle beim Nachdenken zunehmend in ungewöhnliche, kaum verständliche Sprache abgleiten – ein Phänomen, das die Überwachbarkeit ihrer Denkspuren durch Menschen erschwert. Die Autoren zeigen zunächst theoretisch, dass Reinforcement Learning mit überprüfbaren Belohnungen (RLVR) unbegrenzten Sprachdrift zulässt, während überwachtes Feintuning (SFT) dies nicht tut, weil es das Modell enger an vorgegebene, menschenlesbare Textbeispiele bindet. Empirisch tritt der Drift demnach gezielt dann auf, wenn RLVR auf neuartigen Aufgaben trainiert wird, für die das Basismodell das Zielverhalten noch nicht beherrscht – das Modell entwickelt dann, so die Autoren, eigene sprachliche Abkürzungen, statt auf bereits erlernte, verständliche Denkmuster zurückzugreifen. Als dritten Schritt beweisen sie formal, dass sich Sprachdrift nicht eindämmen lässt, ohne zugleich die erwartete Belohnung zu begrenzen – Überwachbarkeit der Denkspur und Trainingsleistung stehen demnach bei RLVR an der Spitze der Modellentwicklung in einem nicht auflösbaren Zielkonflikt. Das zählt, weil Anbieter von Reasoning-Modellen lesbare Denkspuren zunehmend als Sicherheitsmerkmal anführen, obwohl dieser Befund nahelegt, dass gerade das Training, das die stärksten Fähigkeitssprünge bringt, diese Lesbarkeit systematisch untergräbt; der Befund ergänzt einen früheren Digest-Fund, wonach allein die Sprache, in der ein Modell nachdenkt, seine Bereitschaft zu einem simulierten Atomschlag von 93 auf 17 Prozent senken konnte: Beide Arbeiten zeigen, wie stark die Sprache der Denkspur das Verhalten eines Modells mitbestimmt, ohne dass Nutzende das ohne Weiteres bemerken.

Alle vier Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle; die referierten Zahlen beruhen auf den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Für VISTA, RPG und KaliBench stellen die Autoren Projektseiten beziehungsweise Teile von Code und Daten in Aussicht, für die Studie zum Sprachdrift ist aus dem Abstract keine Veröffentlichung von Material ersichtlich. Wie belastbar sich die perfekte ARC-AGI-3-Quote, die 95-Prozent-Erfolgsquote des Roboter-Agenten, die 42-Prozent-Obergrenze bei KaliBench und der bewiesene Zielkonflikt zwischen Sprachdrift und Trainingsleistung außerhalb der jeweiligen Testumgebungen halten, müssen erst unabhängige Nachbauten zeigen.

Häufige Fragen

Sind die vier vorgestellten Paper von Fachleuten begutachtet?

Nein, alle vier Arbeiten sind unbegutachtete Preprints aus der jüngsten arXiv-Einreichungswelle. Die referierten Zahlen stammen aus den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt.

Stellen die Autoren Code oder Daten zur Verfügung?

Für VISTA, RPG und KaliBench kündigen die Autoren Projektseiten sowie teilweise Code und Daten an, die eine unabhängige Prüfung erleichtern sollen. Für die Studie zum Sprachdrift bei RLVR ist aus dem Abstract keine Veröffentlichung von Material ersichtlich.

Was hat das ARC-AGI-Ergebnis von Claude mit dem zugrunde liegenden Modell zu tun?

Laut den Autoren von VISTA bleibt das Modell selbst unverändert – der gesamte Fortschritt stammt aus dem visuellen Harness, der frühere Beobachtungen verlustfrei speichert und gezielt wieder abrufbar macht. Das deutet darauf hin, dass ein Großteil der heutigen Agenten-Schwächen eher am fehlenden Gerüst um ein Modell liegt als an dessen Kernfähigkeiten.

Bedeutet der Sprachdrift-Befund, dass Reasoning-Modelle grundsätzlich unsicherer werden?

Die Studie zeigt laut ihren Autoren einen strukturellen Zielkonflikt: Sprachdrift lässt sich nicht eindämmen, ohne zugleich die erzielte Belohnung und damit die Fähigkeit des Modells zu begrenzen. Das bedeutet nicht automatisch, dass jedes Reasoning-Modell unsicherer wird, wohl aber, dass lesbare Denkspuren und maximale Trainingsleistung bei RLVR gegeneinander abgewogen werden müssen.

Quellen (4)
  1. VISTA: A Visual Harness for Reasoning in an Interactive World
  2. Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
  3. KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards
  4. On Language Drift during RLVR Post-Training

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog