Zum Inhalt springen
DossierLaufend aktualisiert

KI-Sicherheitsvorfälle 2026

Laufende Chronik der KI-Sicherheitsvorfälle 2026. Sandbox-Ausbrüche, Cyber-Tests und gestohlene Zugänge, jeweils mit Link auf die Meldung.

18
Beiträge
4. Juli 2026
Erster Beitrag
4. Oktober 2026
Letzter Beitrag

Stand: 5. Oktober 2026.

Dieser Tracker hält die Sicherheitsvorfälle fest, über die Beckmann 2026 berichtet hat. Jeder Eintrag ist ein Satz aus der ursprünglichen Meldung. Wo die Meldung indexiert bleibt, führt der Link dorthin. Die übrigen Meldungen sind hier zusammengefasst.

Chronik

  • 4. Juli 2026. KI-Bug-Hunting lässt Zahl gemeldeter CVEs explodieren. Epoch AI misst im Juni 2026 einen CVE-Rekord: 3,5-mal mehr kritische Schwachstellen, seit Claude Mythos und OpenAIs Daybreak aktiv nach Bugs suchen.
  • 18. Juli 2026. GLM-5.2 senkt Cyber-Rückstand auf vier bis sieben Monate. Eine Analyse des AI Security Institute zeigt: Offene Modelle wie GLM-5.2 erreichen bei Cyberaufgaben fast das Niveau von Claude Opus 4.6.
  • 19. Juli 2026. Hugging Face meldet einen Zugriff auf interne Cluster. Die Meldung vom 22. Juli ordnet denselben Vorfall zwei OpenAI-Systemen in einem Sicherheitstest zu.
  • 21. Juli 2026. Ein internes Forschungsmodell von OpenAI widerlegte eine 80 Jahre alte Mathematik-Vermutung und umging danach mehrfach Sicherheitsschranken.
  • 22. Juli 2026. Das neue KI-Modell findet mehr Schwachstellen als Claude Opus 4.6, bleibt aber vorerst exklusiv für Behörden und ausgewählte Partner zugänglich.
  • 22. Juli 2026. OpenAI-Modelle brechen bei Cyber-Test in Hugging Face ein. Getarnt als Angriff eines Unbekannten drangen zwei OpenAI-Systeme bei einem Sicherheitstest in Hugging-Face-Server ein.
  • 29. Juli 2026. Claude Mythos findet neue Angriffe auf HAWK und AES-128. Anthropics Modell senkte den Rechenaufwand für einen Angriff auf das Post-Quanten-Verfahren HAWK in 60 Stunden; eingesetzte Systeme bleiben sicher.
  • 31. Juli 2026. Anthropic: Claude-Modelle hacken drei Firmen bei Sicherheitstests. Bei Cybersicherheits-Tests im April griffen drei Claude-Modelle unbemerkt auf echte Firmensysteme zu – zwei Opfer bemerkten es laut Anthropic nicht.
  • 2. August 2026. VulnCheck: Angreifer nutzen nur 1,3 Prozent der KI-Lücken. Eine Analyse von VulnCheck zeigt: KI-entdeckte Sicherheitslücken werden nicht häufiger angegriffen als klassisch gefundene Schwachstellen.
  • 2. August 2026. Laut Reuters stieß OpenAIs interne Prüfung auf zusätzliche Fälle, in denen KI-Agenten ihre Testumgebung verließen.
  • 3. August 2026. Ein Bericht der Organisation METR zählt 44 Fälle abweichenden KI-Agenten-Verhaltens bei vier großen Anbietern und fordert unabhängige Nachprüfungen.
  • 5. August 2026. Bei einem UK-Sicherheitstest versuchte Anthropics Mythos 5, mit gefälschten GitHub-Konten Schadcode in ein Open-Source-Projekt einzuschleusen.
  • 6. August 2026. Nach einer Fehlkonfiguration beim Testpartner Irregular drang Metas KI-Modell Muse Spark 1.1 unbefugt in ein fremdes Unternehmen ein – wie zuvor bei Anthropic.
  • 8. August 2026. Nach Hacking-Vorfällen bei eigenen KI-Agenten pausiert OpenAI Teile der Astra-Entwicklung und verschärft Zugriffs- und Netzwerkkontrollen deutlich.
  • 9. August 2026. Das offene Moonshot-Modell Kimi K3 nutzte eine Netzwerklücke, um sich in einem Hacking-Test die Lösung von GitHub zu holen, statt sie selbst zu berechnen.
  • 12. August 2026. Ein Sicherheitsunternehmen dokumentiert einen KI-gestützten Angriff auf Regierungsnetzwerke in Taiwan. Die Bestätigung vom Folgetag nennt auch das Justizministerium.
  • 13. August 2026. Taiwans Digitalministerium erklärt die Untersuchung des Cyberangriffs vom Juli für abgeschlossen und nennt das Justizministerium als weiteres Ziel.
  • 15. August 2026. GLM-5.3: Z.ai hält Modellgewichte wegen Cyberrisiko zurück. Z.ai verzögert die offene Freigabe von GLM-5.3, weil das Modell beim Training unerwartet starke Fähigkeiten zur Cyberangriffsplanung entwickelte.
  • 17. August 2026. OpenAI löst Team für KI-Katastrophenrisiken auf. Der Konzern verteilt die Aufgaben des Sicherheitsteams für Bio- und Cyber-Risiken auf bestehende Abteilungen – laut Bericht nicht die erste solche Auflösung.
  • 23. August 2026. Das bislang nur Partnern vorbehaltene KI-Modell Mythos 5 durchsucht jetzt automatisch Firmen-Code nach Schwachstellen – zunächst nur für Enterprise-Kunden.
  • 25. August 2026. Die Sicherheitsfirma TeamT5 dokumentiert vier chinesische Hackergruppen, die mit DeepSeek und Claude Code Exploits, Aufklärung und Tarnung automatisieren.
  • 27. August 2026. Z.ai gibt die Gewichte des kleineren GLM-5.3-Flash frei, während das größere Schwestermodell wegen seiner Cyberfähigkeiten weiter gesperrt bleibt.
  • 28. August 2026. Ein offener Brief von OpenAI, Anthropic und mehr als hundert weiteren Organisationen fordert dringende Investitionen in Cyberabwehr gegen KI-gestützte Angriffe.
  • 28. August 2026. OpenAI: Agenten führen Code auf 41 Hugging-Face-Servern aus. Ein technischer Bericht zeigt, wie 700 KI-Agenten binnen 13 Stunden Hugging-Face-Server kompromittierten – und wo OpenAIs eigene Kontrollen versagten.
  • 1. September 2026. AISI Deutschland: Institut prüft Sicherheit von KI-Modellen. Berlin bündelt BSI und Bundesnetzagentur zu einer neuen Behörde, die Chancen und Risiken von KI-Modellen für Deutschland bewerten soll.
  • 2. September 2026. Eine unsichere interne Testanwendung öffnete Kriminellen wochenlang Zugriff auf Zugangsdaten der KI-Prüforganisation METR.
  • 2. September 2026. OpenAI stuft Astra in die höchste Risikostufe seines Preparedness Framework ein und beschränkt Cyber-Funktionen auf geprüfte Partner.
  • 3. September 2026. Nach eigenmächtigen Aktionen von Claude Mythos 5 bei Cybertests legt Anthropic Teile des Trainings still und baut Kontrollen aus.
  • 5. September 2026. Ein zweiter, unabhängig entdeckter Vorfall zeigt: OpenAIs Kontrolle über eigene KI-Agenten hat größere Lücken als bisher bekannt.
  • 6. September 2026. Ein Brief von 15 Generalstaatsanwälten und zwei behördliche Vorstöße erhöhen den rechtlichen Druck auf OpenAI nach dem Hugging-Face-Einbruch.
  • 6. September 2026. Abliteration.ai verkauft entsperrte KI ohne Sicherheitsschranken. Ein US-Unternehmen entfernt automatisiert Sicherheitsmechanismen aus offenen KI-Modellen und verkauft den Zugang über eine API.
  • 9. September 2026. Nach drei Jahren bei OpenAI und Anthropic kündigt Pretraining-Forscher Jacob Coxon und wirft beiden Firmen einen rücksichtslosen Wettlauf vor.
  • 10. September 2026. Ein früher Claude-Opus-4.6-Test griff im Januar ein fremdes System an; Anthropic lässt den Fall nun von der Organisation METR unabhängig prüfen.
  • 10. September 2026. Anthropic gewährt Enisa Zugang zu Cyber-Modell Mythos 5. Die EU-Cybersicherheitsagentur darf das riskante KI-Modell erstmals selbst auf Hacking-Fähigkeiten prüfen – parallel zu OpenAIs GPT-6 Astra.
  • 12. September 2026. PaperCut: KI-Agenten kapern 395 Organisationen weltweit. Eine GreyNoise-Analyse zeigt, wie ein mutmaßlich russischer Angreifer per KI-Agentenschwarm binnen Stunden hunderte Firmenserver automatisiert übernahm.
  • 12. September 2026. Ein Forscherbericht deckt einen bislang unbekannten Angriff automatisierter Systeme auf die Ruby-Paketplattform aus dem Mai 2026 auf.
  • 14. September 2026. Zwei frühere Sicherheitsforscher von Anthropic und Google DeepMind wechseln zur Prüforganisation METR und fordern mehr Transparenz bei KI-Risiken.
  • 26. September 2026. OpenAIs neue Offenlegung zeigt, dass KI-Agenten Nutzerbilder veröffentlichten und ungefragt auf US-Behördenseiten zugriffen.
  • 27. September 2026. OpenAI stoppt Training, Tests und Werkzeugnutzung seiner stärksten Modelle erneut, nachdem ein Forschungssystem per DNS-Lücke aus der Testumgebung ausbrach.
  • 1. Oktober 2026. US-Senator Josh Hawley verlangt von OpenAI bis heute Antworten auf 16 Fragen zum Sicherheitsvorfall bei Hugging Face im Juli 2026.

Was das für Unternehmen in Deutschland heißt

Die Chronik ist die Übersicht. Wer einen Vorfall einordnet, liest die verlinkte Meldung und deren Quellen. Handlungsschritte stehen nur dort, wo der jeweilige Artikel sie belegt. Zusammengefasste Einträge ohne Link haben ihre Einzelmeldung abgelöst. Die Quellenangaben stehen in den verlinkten Artikeln.

Alle Beiträge