Sicherheit

Z.ai öffnet GLM-5.3-Flash – Cyber-Modell bleibt gesperrt

3 Min. Lesezeit

TL;DR Too Long; Didn’t read

Z.ai hat am 26. August 2026 mit GLM-5.3-Flash ein neues offenes Sprachmodell veröffentlicht. Die Gewichte stehen unter MIT-Lizenz kostenlos auf Hugging Face bereit, das Modell verarbeitet bis zu eine Million Token Kontext gleichzeitig. Das größere Schwestermodell GLM-5.3 mit auffällig starken Cyberangriffsfähigkeiten bleibt dagegen weiterhin unter Sicherheitsprüfung gesperrt.

Ein kleines Vorhängeschloss mit Z.ai-Logo-Sticker steht offen, während ein größeres Schloss daneben mit einem roten Warnsymbol verschlossen bleibt. Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • GLM-5.3-Flash nutzt 320 Milliarden Parameter, aktiviert davon aber nur 18 Milliarden pro Anfrage.
  • Vor dem offiziellen Start lief das Modell rund eine Woche unerkannt als „Ox Alpha" auf OpenRouter und OpenCode.
  • Die Inferenz läuft vollständig auf chinesischen KI-Chips, laut Z.ai mit dreifach schnellerer Auslieferung durch eine eigene SGLang-Anpassung.
  • API-Preise liegen bei 0,15 Dollar je Million Eingabe- und 0,50 Dollar je Million Ausgabe-Token.
  • Das größere GLM-5.3 mit Cyberangriffsfähigkeiten bleibt laut Ankündigung bis Ende August unter Verschluss.
  • GLM-Coding-Plan-Abonnenten erhalten für GLM-5.3-Flash die dreifache Nutzungsquote im Vergleich zu GLM-5.3.

Das chinesische KI-Unternehmen Z.ai hat am 26. August 2026 mit GLM-5.3-Flash ein neues offenes Sprachmodell veröffentlicht. Die Gewichte stehen unter MIT-Lizenz kostenlos auf Hugging Face bereit, das Modell verarbeitet bis zu eine Million Token Kontext gleichzeitig. Das größere Schwestermodell GLM-5.3 mit auffällig starken Cyberangriffsfähigkeiten bleibt dagegen weiterhin unter Sicherheitsprüfung gesperrt.

Offene Gewichte senken die Einstiegshürde für Selbst-Hoster

GLM-5.3-Flash ist ein Mixture-of-Experts-Modell mit 320 Milliarden Parametern, von denen pro Anfrage nur 18 Milliarden aktiv sind – das hält Rechenkosten und Antwortzeiten niedrig. Das Modell verarbeitet Text, Bilder und Video nativ in einem einzigen Kontextfenster von rund einer Million Token; das reicht nach groben Schätzungen für etwa 1500 Buchseiten Text in einem einzigen Durchgang. Wer die Gewichte selbst hostet, kann sie kostenlos von Hugging Face herunterladen und mit gängigen Inferenz-Werkzeugen wie vLLM oder SGLang betreiben.

Für den Zugriff über die Z.ai-API fallen laut Unternehmensangaben 0,15 Dollar je Million Eingabe-Token, 0,03 Dollar für zwischengespeicherte Eingaben und 0,50 Dollar je Million Ausgabe-Token an. Abonnentinnen und Abonnenten des GLM Coding Plan, der bei 18 Dollar monatlich beginnt und über die Entwicklungsumgebung ZCode genutzt wird, erhalten für GLM-5.3-Flash die dreifache Nutzungsquote im Vergleich zum größeren GLM-5.3. Eine Einschränkung für Deutschland oder die EU ist nicht bekannt, der Zugang läuft wie bei den Vorgängermodellen über die reguläre Z.ai-Plattform.

Ox Alpha lief eine Woche unerkannt auf chinesischen Chips

Bereits ab dem 20. August 2026 tauchte ein noch unbenanntes Modell unter dem Codenamen „Ox Alpha” auf den Plattformen OpenRouter und OpenCode auf und wurde dort binnen einer Woche zum meistgenutzten Modell der Charts. Erst mit der offiziellen Ankündigung bestätigte Z.ai, dass es sich bei „Ox Alpha” um GLM-5.3-Flash handelte. Der gesamte Datenverkehr lief nach Unternehmensangaben vollständig über in China gefertigte KI-Chips, ganz ohne Nvidia-Hardware.

Für die Auslieferung entwickelte Z.ai eine eigene, auf SGLang basierende Serving-Engine, die nach Angaben des Unternehmens die Antwortgeschwindigkeit gegenüber Standardlösungen verdreifacht. Der unauffällige Testlauf unter falschem Namen erlaubte es Z.ai, Last und Nutzerverhalten unter Realbedingungen zu prüfen, bevor Marke und Preis feststanden – ein Vorgehen, das unter chinesischen Anbietern bislang selten zu beobachten war.

Bei eigenen Vergleichstests schneidet GLM-5.3-Flash nahe an Anthropics Spitzenmodell Claude Opus 4.8 ab: Im Terminal-Bench 2.1 erreicht es 84,3 von 100 möglichen Punkten, Opus 4.8 kommt auf 85,0. Beim internen Programmier-Vergleich Z.ai Code Bench liegen beide mit 29,0 zu 29,5 Punkten nahezu gleichauf, unabhängig nicht verifiziert. Gegenüber dem Vorgänger GLM-5.2 steigt der Wert im Coding-Benchmark DeepSWE v1.1 von 46,2 auf 63,4 Punkte.

Das cyberfähige Schwestermodell bleibt weiter gesperrt

Anders als GLM-5.3-Flash ist das im August vorgestellte Flaggschiff GLM-5.3 weiterhin nicht offen verfügbar. Das rund 743 Milliarden Parameter große Modell erreichte beim Sicherheits-Benchmark CyberGym nach Angaben von Z.ai 84,5 Prozent und damit einen Spitzenwert vor Anthropics Mythos 5 und OpenAIs GPT-5.6 Sol. Die Fähigkeit zur eigenständigen Verkettung von Angriffsschritten wuchs beim Training deutlicher als vom Unternehmen beabsichtigt.

Z.ai kündigte deshalb Mitte August eine zusätzliche Sicherheitsprüfung an und verschob die Freigabe der offenen Gewichte auf voraussichtlich Ende August 2026. Eine Analyse des britischen AI Security Institute hatte bereits im Juli gezeigt, dass offene Modelle wie GLM-5.2 ihren Rückstand bei Angriffsfähigkeiten gegenüber Spitzenmodellen auf vier bis sieben Monate verkürzt hatten – ein Trend, den GLM-5.3 nach eigenen Angaben fortsetzt. Für Sicherheitsteams bedeutet der gestaffelte Rollout, dass sie das risikoärmere GLM-5.3-Flash bereits heute selbst hosten und testen können, während die potenziell gefährlichere Variante vorerst nur über die kontrollierte API zugänglich bleibt.

Entscheidend wird, ob Z.ai die für Ende August angekündigte Freigabe der GLM-5.3-Gewichte tatsächlich einhält oder die Sicherheitsprüfung erneut verlängert. Bislang hat kein anderer chinesischer Anbieter offener Modelle Sicherheitsbedenken und offene Gewichte so konsequent getrennt behandelt wie Z.ai mit seiner zweigleisigen GLM-5.3-Familie – ein Vorgehen, das zum Präzedenzfall für künftige Modelle mit ähnlich auffälligen Fähigkeiten werden könnte.

Häufige Fragen

Ist GLM-5.3-Flash kostenlos nutzbar?

Die Modellgewichte stehen unter MIT-Lizenz kostenlos auf Hugging Face zum Selbst-Hosten bereit. Wer die API nutzt, zahlt nach Token, der GLM Coding Plan startet bei 18 US-Dollar im Monat.

Was unterscheidet GLM-5.3-Flash vom zurückgehaltenen GLM-5.3?

GLM-5.3-Flash ist mit 320 Milliarden Parametern deutlich kleiner als das 743 Milliarden Parameter große GLM-5.3 und wurde von Anfang an offen veröffentlicht, ohne den auffällig hohen Cyber-Benchmark-Wert des größeren Modells.

Ist GLM-5.3-Flash in Deutschland oder der EU nutzbar?

Eine regionale Sperre ist nicht bekannt. Der Zugang läuft wie bei den Vorgängermodellen über die reguläre Z.ai-Plattform oder per Selbst-Hosting der offenen Gewichte.

Wann sollen die Gewichte des großen GLM-5.3 erscheinen?

Laut einer Ankündigung von Mitte August 2026 voraussichtlich Ende August, nach Abschluss einer zusätzlichen Sicherheitsprüfung.

Wie schneidet GLM-5.3-Flash im Vergleich zu Claude Opus 4.8 ab?

Nach Z.ais eigenen Benchmarks liegt es nah dran, etwa 84,3 zu 85,0 Punkten im Terminal-Bench 2.1. Die Werte stammen vom Hersteller und sind unabhängig nicht verifiziert.

Quellen (3)
  1. Z.ai: GLM-5.3-Flash – Frontier Intelligence, Flash Cost
  2. MarkTechPost: Z.ai Releases GLM-5.3-Flash
  3. Z.ai: GLM-5.3 – Frontier Coding with Emergent Cyber Capabilities

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog