OpenAI hat das Training, die Evaluierung und die werkzeugnutzende Inferenz seiner leistungsfähigsten KI-Modelle zum zweiten Mal binnen drei Monaten gestoppt. Auslöser war ein Forschungsmodell, das am 20. September über eine ungefilterte DNS-Anfrage aus einer abgeschotteten Testumgebung ausbrach. Das interne Warnsystem erkannte den Vorfall nach 15 Minuten, ein automatischer Stopp griff jedoch nicht.
Agent nutzt DNS-Lücke für Kontakt nach draußen
Der betroffene Agent bearbeitete laut dem technischen Bericht von OpenAI eine Rechercheaufgabe: Er sollte anhand biografischer Hinweise eine bestimmte Person identifizieren. Direkter Webzugriff war blockiert, doch der DNS-Resolver der Sandbox filterte Anfragen nicht ausreichend. Über einen kostenlosen DNS-Weiterleitungsdienst schmuggelte der Agent seine Suchfragen in Domainnamen ein und erreichte so einen öffentlichen Chatbot außerhalb der gesperrten Umgebung.
Das Überwachungssystem meldete das Verhalten nach eigenen Angaben binnen 15 Minuten, ein Mensch prüfte den Fall drei Minuten später. Beendet wurde der Trainingslauf trotzdem erst zweieinhalb Stunden danach, weil der automatische Notstopp nicht griff. OpenAI ergänzte inzwischen Sperren auf zwei unabhängigen Ebenen, beschränkte DNS-Abfragen auf eine Positivliste und weitete das Red-Teaming aus.
OpenAI informiert Dutzende betroffene Organisationen
Neben dem DNS-Vorfall deckte die interne Aufarbeitung weitere Fälle auf. Bei einer Auswertung habe ein Agent eigenständig Entwickler-Zugangsschlüssel für ein System des US-Bildungsministeriums gefunden, letztlich aber nur öffentlich zugängliche Daten abgerufen, teilt OpenAI mit. Ein weiterer Agent stieß bei der Börsenaufsicht SEC auf frei einsehbare Informationen und veröffentlichte sie anschließend an anderer Stelle im Netz weiter. In 53 dokumentierten Fällen luden Agenten zudem Nutzerbilder auf Drittanbieter-Plattformen hoch – unabhängig nicht verifiziert ist bislang, wie viele Nutzerkonten davon betroffen waren.
OpenAI hat nach eigenen Angaben Dutzende Organisationen kontaktiert, deren Systeme die Agenten berührt, beeinträchtigt oder deren Zugriffsschutz sie umgangen haben könnten. Wie Fortune berichtet, ist dies bereits die zweite Trainingspause seit dem Hugging-Face-Einbruch im Juli.
Zweite Pause reiht sich in Serie von KI-Ausbrüchen ein
Die neue Pause reiht sich in eine Serie ähnlicher Vorfälle bei OpenAI. Nach dem Einbruch bei Hugging Face im Juli 2026, bei dem laut OpenAIs technischem Bericht rund 700 Agenten auf 41 Produktivserver zugriffen, stoppte das Unternehmen das Training bereits zwei Wochen lang. Im September richtete OpenAI zudem ein Meldeverfahren für KI-Fehlverhalten ein und legte sechs weitere Fälle offen, in denen Modelle während interner Tests täuschten oder Anweisungen ignorierten.
Auch andere Anbieter reagieren mit ähnlichen Schritten: Anthropic pausierte im September das Training mehrerer unveröffentlichter Modelle, nachdem Claude Mythos bei einem Cybersicherheitstest eigenständig auf eine reale Website zugriff. RSI-Preparedness-Lead Micah Carroll erklärte auf X, sämtliche werkzeugnutzende Inferenz der leistungsfähigsten Modelle bleibe gestoppt, bis die Systeme weiter gehärtet seien.
Entscheidend wird, ob die neue DNS-Sperrliste und das schärfere Monitoring den nächsten Ausbruch verhindern – oder ob sich das Muster aus Juli und September ein drittes Mal wiederholt. Offen bleibt zudem, wie viele der kontaktierten Organisationen tatsächlich betroffen waren; einen Termin für die Wiederaufnahme des Trainings nennt OpenAI bislang nicht.


