Dossier · Laufend aktualisiert

KI-Cybertests außer Kontrolle

Seit Juli 2026 erreichen KI-Modelle bei Sicherheitstests reale Firmensysteme – die Vorfälle bei Anthropic, OpenAI, Meta und AISI im Überblick.

Seit Juli 2026 häufen sich Fälle, in denen KI-Modelle während interner Cybersicherheits-Tests aus ihren Testumgebungen heraus reale Systeme erreichten. Mehrfach lag dieselbe Ursache zugrunde: fehlkonfigurierte Umgebungen des externen Testpartners Irregular, die entgegen der Planung mit dem offenen Internet verbunden waren. Nacheinander räumten OpenAI, Anthropic und Meta solche Zwischenfälle ein; parallel dokumentierte das britische AI Security Institute Agenten, die in eigenen Tests gefälschte Identitäten aufbauten und reale Personen täuschten.

Dieses Dossier bündelt die Chronik der Vorfälle, die Aufarbeitung durch die beteiligten Unternehmen und die Reaktionen von Prüforganisationen wie METR sowie der Politik – darunter das im August 2026 im Weißen Haus verhandelte freiwillige Testregime für die Hacking-Fähigkeiten von Spitzenmodellen.

Chronologie

  1. Anthropic: Claude-Modelle hacken drei Firmen bei Sicherheitstests

    Bei Cybersicherheits-Tests im April griffen drei Claude-Modelle unbemerkt auf echte Firmensysteme zu – zwei Opfer bemerkten es laut Anthropic nicht.

  2. Anthropics Mythos 5 täuscht Entwickler bei UK-Sicherheitstest

    Bei einem UK-Sicherheitstest versuchte Anthropics Mythos 5, mit gefälschten GitHub-Konten Schadcode in ein Open-Source-Projekt einzuschleusen.

  3. Meta: Muse-Spark-Modell hackt Firma bei Sicherheitstest

    Nach einer Fehlkonfiguration beim Testpartner Irregular drang Metas KI-Modell Muse Spark 1.1 unbefugt in ein fremdes Unternehmen ein – wie zuvor bei Anthropic.

  4. Kimi K3 umgeht Cybersicherheitstest über GitHub

    Das offene Moonshot-Modell Kimi K3 nutzte eine Netzwerklücke, um sich in einem Hacking-Test die Lösung von GitHub zu holen, statt sie selbst zu berechnen.

  5. OpenAI, Anthropic und 100 Firmen warnen vor KI-Angriffen

    Ein offener Brief von OpenAI, Anthropic und mehr als hundert weiteren Organisationen fordert dringende Investitionen in Cyberabwehr gegen KI-gestützte Angriffe.