Forschung

Fünf KI-Paper: 552-Milliarden-Modell, KI-Forscher, Sonden

5 Min. Lesezeit

TL;DR Too Long; Didn’t read

Fünf neue arXiv-Preprints der vergangenen 24 bis 48 Stunden zeigen: Am auffälligsten ist der Befund, dass ein autonomes Multi-Agenten-System eigenständig durchgeführte Forschungszyklen zu Fachartikeln verarbeitet, die laut Autoren im automatisierten KI-Begutachtungsverfahren im Schnitt besser bewertet werden als von Menschen verfasste Vergleichsarbeiten. DeepSeek stellt daneben ein 552-Milliarden-Parameter-Modell vor, dessen Speicherbedarf pro Token dank neuer Kompressionstechnik auf 890 Byte sinkt. Eine dritte Arbeit zeigt, dass schlanke, nur 12,6 Millionen Parameter große Sonden aus den internen Aktivierungen eines offenen Modells schädliche Prompts so zuverlässig erkennen wie 1000-mal größere externe Wächter-Modelle. Zwei weitere Studien untersuchen, wie Agenten über Wochen hinweg Kontinuität behalten und warum Sprachmodelle beim Sprachenlernen kaum Wissen zwischen Sprachen teilen.

Eine Lupe schwebt über einem Stapel Fachpapiere, aus dem fünf Symbole herausragen: ein Server-Rack mit einem winzigen Byte-Symbol, ein Roboter mit Doktorhut und Stift, eine Messsonde, die in ein stilisiertes Gehirn eintaucht, eine Sanduhr mit eingebauter Zahnrad-Kette und zwei durch einen Pfeil verbundene Sprechblasen mit unterschiedlichen Schriftzeichen Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • DeepSeek komprimiert den KV-Cache eines 552-Milliarden-Parameter-Modells auf 890 Byte pro Token – ein Viertel des Vorgängers.
  • Ein autonomes Multi-Agenten-System erzeugt laut Autoren Fachartikel, die automatisierte KI-Gutachter im Schnitt besser bewerten als menschliche Vergleichsarbeiten.
  • Nur 12,6 Millionen Parameter große Sonden erkennen schädliche Prompts aus internen Aktivierungen so zuverlässig wie 1000-mal größere Wächter-Modelle.
  • Eine dreistufige Architektur lässt einen KI-Agenten zehn Tage lang mit nur einer täglichen menschlichen Prüfung durchgehend weiterarbeiten.
  • Gemeinsame Token-Räume statt getrennter Sprachvokabulare verbessern den Wissenstransfer zwischen Sprachen beim Pretraining um das 14-Fache.

Aus den arXiv-Neueinreichungen der vergangenen 24 bis 48 Stunden in cs.AI und cs.CL wählt dieser Digest fünf Preprints aus, die zeigen, wie unterschiedlich weit Effizienz, Autonomie und Verlässlichkeit heutiger KI-Systeme reichen: ein neues Riesenmodell mit drastisch komprimiertem Speicherbedarf, ein autonomes Forschungssystem, das eigenständig Fachartikel erzeugt, schlanke interne Sicherheits-Sonden, eine Architektur für wochenlang durchgehend arbeitende Agenten und ein Trainingsbefund zum Wissenstransfer zwischen Sprachen. Kuratiert wurde nach nachvollziehbarer Methodik im Abstract, konkreten Kernergebnissen und thematischer Streuung statt fünffacher Wiederholung desselben Teilgebiets.

Modelle und Autonomie

DeepSeek komprimiert den Speicherbedarf eines 552-Milliarden-Parameter-Modells drastisch

Ein großes Autorenteam von DeepSeek-AI stellt mit DeepSeek-V4.1-Flash ein multimodales Mixture-of-Experts-Modell (MoE, ein Modell, das pro Anfrage nur einen Teil seiner Parameter aktiviert) mit 552 Milliarden Backbone-Parametern und Kontexten von bis zu einer Million Token vor. Über eine Causal-Encoder-Decoder-Architektur aktiviere das Modell laut den Autoren nur 16 Milliarden Parameter je Token bei der Textgenerierung und sogar nur 8 Milliarden bei der Eingabeverarbeitung; kombiniert mit schichtübergreifender Wiederverwendung des Zwischenspeichers (KV-Cache) und einer 4-Bit-Quantisierung sinke der ständig im Arbeitsspeicher der Grafikkarte gehaltene Speicherbedarf auf 890 Byte pro Token – etwa ein Viertel des Vorgängermodells DeepSeek-V4-Flash, das im Juli mit einem Effizienz-Update aufgefallen war. Eine zusätzliche Optimierung namens SWA Bounded Replay senke zudem den dauerhaft auf SSD oder im Hauptspeicher liegenden Speicherbedarf auf rund ein Achtel des Vorgängerwerts, bei laut den Autoren deutlich besserer Leistung trotz des kleineren Speicherbedarfs. Das zählt, weil lange Kontexte und große KV-Caches bei agentischen Arbeitslasten zu den größten Kostenblöcken beim Betrieb von Sprachmodellen zählen.

Ein autonomes Multi-Agenten-System erzeugt eigenständig Fachartikel

Jaehyun Nam, Tomas Pfister und fünf weitere Autoren von Google stellen mit ScientistTwo ein vollständig autonomes Multi-Agenten-Framework vor, das von einer vorgegebenen Fragestellung ausgehend selbstständig aktuelle Vergleichsmethoden ermittelt, Hypothesen formuliert, Experimente über verschiedene Datensätze durchführt, Ablationsstudien vornimmt und Ergebnisse über eine simulierte Peer-Review-Rebuttal-Schleife prüft – ganz ohne menschliches Eingreifen während des Zyklus. Getestet an Aufgabenstellungen aus bei ICLR, ICML und NeurIPS angenommenen Fachartikeln erzeuge das System laut den Autoren eigenständig auf Expertenniveau publizierbare Paper samt vollständig lauffähigem Code, deren Lösungen im Schnitt bestehende Fachmethoden übertreffen und die unter automatisierten KI-Begutachtungsagenten im Schnitt bessere Bewertungen erhielten als die menschlich verfassten Originalarbeiten. Das zählt, weil eine frühere, deutlich bescheidenere Untersuchung von KI-Forschungsagenten noch zeigte, dass Spitzenmodelle zwar die Technik unveröffentlichter Forschungsfragen meistern, am eigentlichen wissenschaftlichen Fortschritt aber scheitern – wie belastbar sich dieser Sprung bei ScientistTwo außerhalb des Vergleichs mit bereits veröffentlichten, also dem Modell teils bekannten Arbeiten hält, bleibt eine offene Frage.

Sicherheit und Architektur

Schlanke interne Sonden erkennen schädliche Prompts so gut wie riesige Wächter-Modelle

Alizishaan Khatri, Chiquita Prabhu und Omkar Neogi zeigen in ihrer Arbeit, dass sich schädliche Eingaben oft schon aus den internen Aktivierungen eines Sprachmodells ablesen lassen, statt sie nachträglich über separate, rechenintensive Wächter-Modelle zu prüfen. Die Autoren extrahieren Aktivierungen aus LLaMA-3.1-8B und trainieren darauf schlanke MLP-Klassifikator-Sonden mit nur 12,6 Millionen Parametern; auf den drei Testsammlungen WildJailbreak, BeaverTails und AEGIS 2.0 erreichten diese Sonden laut den Autoren F1-Werte von 99, 83 und 84 Prozent – konkurrenzfähig mit rund 1000-mal größeren externen Guard-Modellen, bei deutlich geringerer Latenz und geringerem Rechenaufwand. Das zählt, weil externe Sicherheits-Schichten in zeitkritischen oder ressourcenbeschränkten Einsätzen oft zu langsam oder zu teuer sind – ein Ansatz, der sich mit Anthropics J-Lens-Forschung zu sichtbar gemachten internen Gedankenprozessen von Claude trifft, wo ebenfalls interne Modellzustände statt nachträglicher Ausgabe-Prüfung im Mittelpunkt stehen.

Eine Architektur für KI-Agenten, die wochenlang durchgehend arbeiten

Erik Nijkamp, Anurag Koul, Egor Pakhomov und Bo Pang schlagen mit ihrer Architektur einen strukturellen Ansatz vor, damit Sprachmodell-Agenten Aufgaben über Tage oder Wochen hinweg durchhalten, ohne bei jedem Kontext-Reset ihren Fortschritt zu verlieren. Die vorgeschlagene Struktur besteht aus drei Teilen: nach Zeitskala gestaffelte Ebenen, die jeweils eine begrenzte Zusammenfassung der darunterliegenden Ebene pflegen, ein getakteter „Tick” als Einheit autonomen Handelns, und eine kaskadierte Intelligenz, bei der Arbeit erst nach einer gescheiterten Prüfung an ein leistungsfähigeres Modell eskaliert wird. In einer zehntägigen Testkampagne reproduzierte ein so aufgebauter Agent laut den Autoren ein veröffentlichtes Reinforcement-Learning-Ergebnis, während ein Mensch nur einmal täglich nach dem Ergebnis sah; früh niedergeschriebenes Arbeitswissen habe dabei späteres Verhalten beeinflusst, ganz ohne Änderungen an den Modellgewichten. Das zählt, weil kontinuierliches Lernen von Agenten laut den Autoren ein Substrat braucht, das jeden einzelnen Kontext und Prozess überdauert – ein Bedarf, der sich bereits in einem früheren Digest-Beitrag zu einem proaktiven Memory-Agenten für Langzeit-Agenten angedeutet hatte.

Warum Sprachmodelle beim Pretraining kaum Wissen zwischen Sprachen teilen

Adam Gaber, Uriel Dolev und vier weitere Autoren gehen in ihrer Studie der Frage nach, warum heutige Sprachmodelle Wissen zwischen Sprachen deutlich schlechter übertragen als mehrsprachige Menschen. In kontrollierten zweisprachigen Experimenten mit identischem Inhalt in getrennten Token-Räumen zeigten die Autoren, dass bereits getrennte Token-Vokabulare allein ausreichen, um Wissen zwischen Sprachen abzukapseln – unabhängig von inhaltlichen Unterschieden. Bildeten die Autoren Sprachen stattdessen über eine wortweise Übersetzungszuordnung auf einen gemeinsamen Token-Raum ab, verbesserte sich die Lerneffizienz in der jeweiligen Zielsprache um bis zu 12,6 Prozentpunkte – nach Angaben der Autoren rund 14-mal so viel wie mit der bisherigen Basismethode. Das zählt, weil Trainingskosten für gute Sprachabdeckung bislang meist durch schiere Datenmenge statt durch Architekturentscheidungen adressiert werden – ein verwandtes Sprachungleichgewicht im Training hatte bereits ein früherer Digest-Beitrag zu Sprachbias bei RL-Training aufgezeigt, dort mit Blick auf ungleiche Bestrafung statt auf reine Wissensteilung.

Alle fünf Arbeiten sind unbegutachtete Preprints, veröffentlicht in den vergangenen ein bis zwei Tagen; die referierten Zahlen stammen aus den Abstracts und Angaben der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt. Ob sich DeepSeeks Effizienzgewinne in unabhängigen Benchmarks bestätigen, wie belastbar ScientistTwos Ergebnisse außerhalb des Vergleichs mit bereits bekannten Fachartikeln sind und ob sich die schlanken Sicherheits-Sonden auch gegen neuartige, noch unbekannte Angriffsmuster behaupten, werden erst unabhängige Nachbauten und Peer-Review zeigen.

Häufige Fragen

Sind die vorgestellten Paper von Fachleuten begutachtet?

Nein, alle fünf Arbeiten sind unbegutachtete Preprints auf arXiv, veröffentlicht in den vergangenen ein bis zwei Tagen; die berichteten Zahlen stammen aus den Abstracts und Experimenten der jeweiligen Autorenteams und sind bislang nicht durch unabhängige Begutachtung oder Replikation bestätigt.

Stellen die Autoren Code, Daten oder Modelle zur Verfügung?

Unterschiedlich: Für DeepSeek-V4.1-Flash ist aus dem technischen Bericht keine vollständige öffentliche Gewichts-Freigabe zum jetzigen Zeitpunkt ersichtlich, frühere DeepSeek-Modelle wurden aber meist quelloffen nachgereicht. Für ScientistTwo, die Sicherheits-Sonden-Studie, die Langzeit-Agenten-Architektur und die Pretraining-Studie zu Sprachtransfer ist aus den Abstracts zum Zeitpunkt dieses Digests keine vollständige Code- oder Datenveröffentlichung ersichtlich.

Bedeutet der ScientistTwo-Befund, dass KI bereits eigenständig Wissenschaft betreiben kann?

Das behaupten die Autoren nicht uneingeschränkt. Getestet wurde das System an Aufgabenstellungen aus bereits veröffentlichten, bei Top-Konferenzen angenommenen Fachartikeln, und die Bewertung erfolgte durch automatisierte KI-Begutachtungsagenten statt durch ein reguläres menschliches Peer-Review-Verfahren. Ob sich die berichteten Ergebnisse bei völlig neuen, noch unveröffentlichten Forschungsfragen und unter echter menschlicher Begutachtung ebenso zeigen, bleibt offen.

Wie unterscheiden sich die Sicherheits-Sonden von klassischen Guardrail-Modellen?

Klassische Guardrail- oder Wächter-Modelle prüfen eine Ein- oder Ausgabe nachträglich von außen, oft mit eigenen, deutlich größeren Sprachmodellen. Die in diesem Digest vorgestellten Sonden lesen dagegen direkt die internen Aktivierungen des ohnehin laufenden Modells aus und benötigen dafür laut den Autoren nur 12,6 Millionen zusätzliche Parameter – bei vergleichbarer Erkennungsleistung, aber deutlich geringerer Latenz und geringerem Rechenaufwand.

Quellen (5)
  1. DeepSeek-V4.1-Flash Technical Report
  2. ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI
  3. Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models
  4. An Architecture for Long-Horizon Agents: Levels, Ticks and Cascaded Intelligence
  5. Why Pretraining Fails to Share Cross-Lingual Knowledge

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog