KI-Praxis

Meta veröffentlicht Muse Glimmer: KI-Agent für eine Grafikkarte

3 Min. Lesezeit

TL;DR Too Long; Didn’t read

Meta bringt mit Muse Glimmer ein offenes 30-Milliarden-Parameter-Modell für lokale KI-Agenten, das komplett ohne Cloud-Server auskommt. Vier-Bit-Quantisierung drückt den Speicherbedarf auf 18 bis 20 Gigabyte, sodass eine einzelne Consumer-Grafikkarte reicht. Die Gewichte sind unter Apache 2.0 kostenlos über Hugging Face erhältlich.

Eine Grafikkarte mit Meta-Logo-Sticker liegt auf einem Schreibtisch, aus ihrem Lüfter steigt ein kleiner Roboterarm und tippt auf einer Laptop-Tastatur, daneben schwebt eine durchgestrichene Wolke. Generiertes Bild mit GPT Image 2

Das Wichtigste in Kürze

  • Ein 30-Milliarden-Parameter-Agentenmodell läuft bei Muse Glimmer erstmals vollständig ohne Cloud-Anbindung.
  • Vier-Bit-Quantisierung senkt den Speicherbedarf von 55 auf 18 bis 20 Gigabyte.
  • Die offenen Gewichte stehen unter Apache-2.0-Lizenz kostenlos auf Hugging Face bereit.
  • Meta destilliert das Modell aus dem größeren Cloud-Modell Muse Spark.
  • Laut Meta übertrifft Muse Glimmer die offenen Modelle Gemma4-31B und Qwen3.6-27B bei Agenten-Benchmarks.
  • Ollama unterstützt das Modell bereits zum Start ab Version 0.32.7.

Meta hat am 10. August 2026 mit Muse Glimmer ein offenes Agentenmodell mit 30 Milliarden Parametern vorgestellt, das vollständig lokal auf einer einzelnen Consumer-Grafikkarte läuft. Das Unternehmen destilliert das Modell aus dem größeren Cloud-Modell Muse Spark und stellt es kostenlos unter der Lizenz Apache 2.0 auf Hugging Face bereit. Anders als bisherige Agentenmodelle benötigt Muse Glimmer damit keine Cloud-Anbindung mehr.

Vier-Bit-Quantisierung drückt den Speicherbedarf auf ein Drittel

Muse Glimmer kombiniert einen 28-Milliarden-Parameter-Textdecoder mit einem zwei Milliarden Parameter großen Bildencoder im Vit-Stil, der Text, Bilder und kurze Videosequenzen gemeinsam verarbeitet. Eine wechselnde Kombination aus lokalen Aufmerksamkeitsfenstern und vollständiger Aufmerksamkeit sowie ein als „gated” bezeichnetes Verfahren bei der Schlüssel-Wert-Zwischenspeicherung senken laut Metas eigenem Forschungsblog den Speicherbedarf für den Kontext um das Sechzehnfache. Durch zusätzliche Vier-Bit-Quantisierung fällt der Gesamtspeicherbedarf von 55 auf 18 bis 20 Gigabyte, sodass Modell, Zwischenspeicher und Bildencoder in eine einzelne Grafikkarte mit 24 oder 32 Gigabyte passen.

Ein Zusatzbaustein namens DFlash beschleunigt die Texterzeugung per spekulativer Dekodierung um das 1,5- bis 3,1-Fache und erreicht damit bis zu 20.000 Token pro Sekunde auf einer Grafikkarte. Zum Start unterstützen die Bibliothek Transformers, llama.cpp und vLLM das Modell direkt, ebenso Hugging-Face-eigene Inferenz-Endpunkte in der Cloud. Laut Phoronix bindet auch der lokale Modell-Server Ollama Muse Glimmer bereits ab Version 0.32.7 zum Starttag ein; optimierte Unterstützung für MLX und ExecuTorch sowie Anbindungen bei LM Studio, Unsloth, SGLang, Together AI, Fireworks AI und OpenRouter kündigt Meta für die kommenden Tage an.

Modell übernimmt Fähigkeiten des größeren Muse Spark

Muse Glimmer entsteht durch sogenannte Logit-Distillation aus Muse Spark, dem größeren Cloud-Modell von Meta, und folgt denselben Trainingsdaten in kompakterer Form. Das kleinere Modell übernimmt dabei mehrstufiges Schlussfolgern, zuverlässige Werkzeugnutzung samt multimodalem Funktionsaufruf sowie Fehlerkorrektur bei gescheiterten Arbeitsschritten. Es verarbeitet Videosequenzen mit bis zu 96 Einzelbildern bei zwei Bildern pro Sekunde ohne Ton, beherrscht mehr als 100 Sprachen und lässt sich in seiner Denktiefe gezielt steuern.

Bei Agenten-Benchmarks wie MCP Atlas erreicht Muse Glimmer nach Metas eigenen Angaben 75,5 Punkte gegenüber 54,2 bei Gemma4-31B, beim Programmier-Benchmark SWE-Bench Pro liegt es bei 51,2 gegenüber 36,9 Punkten – unabhängig nicht verifiziert. Beim multimodalen Test Charxiv Reasoning kommt Muse Glimmer auf 78,8 Punkte; als Vergleichsmodell zieht Meta neben Gemma4-31B zusätzlich Qwen3.6-27B von Alibaba heran. Einsatzfelder sieht Meta unter anderem in lokalen Coding-Agenten und als Bewertungsinstanz für andere KI-Ausgaben, ähnlich wie beim bereits gestarteten Terminal-Agenten Muse Code, der ebenfalls auf der Muse-Spark-Familie aufbaut, aber weiterhin auf Cloud-Rechenleistung angewiesen bleibt.

Release fällt in Metas Umbau der Open-Source-Strategie

Mit Muse Glimmer positioniert sich Meta erneut als Anbieter offener Modelle, nachdem der Konzern im April 2026 zunächst von der offenen Llama-Reihe zu geschlossenen Spark-Modellen gewechselt war – auch als Reaktion auf Kritik, wonach Spark-Modelle bei unabhängigen Tests hinter Konkurrenzprodukten von OpenAI und Anthropic zurückbleiben. Der neue Kurs reagiert zudem auf wachsenden Wettbewerbsdruck durch offene Modelle aus China wie DeepSeek und aus Deutschland, etwa Soofi S eines deutschen Forschungsverbunds.

Meta positioniert die offenen Gewichte ausdrücklich als Gegenentwurf zu zentralisierten, geschlossenen KI-Systemen einzelner Anbieter und wirbt damit um Entwicklerinnen und Entwickler, die aus Kosten- oder Datenschutzgründen keine Cloud-Anbindung wollen. Der Start fällt zudem in eine Phase wachsenden Interesses an lokal laufender KI, da immer mehr Unternehmen sensible Daten nicht an externe Server-Infrastruktur weitergeben möchten. Für Selbstständige und kleinere Kanzleien oder Praxen bedeutet das: Ein KI-Agent für Termin- und Dateiorganisation kann künftig auf dem eigenen Rechner laufen, ohne dass Dokumente das Haus verlassen. Ein konkretes Rollout-Datum für weitere, größere Varianten von Muse Glimmer nennt Meta bislang nicht.

Entscheidend wird, ob unabhängige Entwickler die von Meta genannten Benchmark-Werte bestätigen und ob sich dauerhaft laufende, lokale Agentenmodelle in der Praxis als vertrauenswürdig genug erweisen – erst wenige Wochen zuvor musste Meta einen Sicherheitsvorfall mit dem größeren Vorgängermodell Muse Spark einräumen.

Häufige Fragen

Was kostet Muse Glimmer?

Nichts. Die Modellgewichte stehen unter der freizügigen Apache-2.0-Lizenz kostenlos zum Download auf Hugging Face bereit.

Welche Hardware wird für Muse Glimmer benötigt?

Eine einzelne Consumer-Grafikkarte mit 24 oder 32 Gigabyte Grafikspeicher genügt, da Vier-Bit-Quantisierung den Bedarf auf 18 bis 20 Gigabyte drückt. Das Modell läuft auf Mac und PC.

Ist Muse Glimmer in Deutschland und der EU verfügbar?

Ja. Da es sich um offene Modellgewichte handelt, lässt sich Muse Glimmer weltweit ohne Zugangsbeschränkung herunterladen; Meta nennt keine regionalen Einschränkungen.

Wie unterscheidet sich Muse Glimmer von Muse Spark?

Muse Glimmer ist eine kleinere, aus Muse Spark destillierte Variante für den lokalen Einsatz statt für die Cloud, mit weniger Parametern, aber laut Meta vergleichbaren Agentenfähigkeiten.

Welche Werkzeuge unterstützen Muse Glimmer bereits?

Ollama bindet das Modell ab Version 0.32.7 zum Start ein. Optimierte Unterstützung für llama.cpp, MLX und ExecuTorch kündigt Meta für die kommenden Tage an, dazu geplante Anbindungen bei LM Studio, Unsloth, vLLM, SGLang, Together AI, Fireworks AI und OpenRouter.

Quellen (5)
  1. Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device – Meta AI Research
  2. Muse Glimmer – Hugging Face Blog
  3. Meta's open source Muse Glimmer model can run on a single computer – Engadget
  4. Meta Publishes Muse Glimmer As 30B Open Agentic Model – Phoronix
  5. Meta releases Muse Glimmer as an open local agent model – Techzine Global

Dein KI-Update für die Arbeitswoche

Einmal pro Woche das Wichtigste aus der KI-Welt – plus ein Praxis-Tipp zum direkt Ausprobieren. Kein Spam, jederzeit abbestellbar.

← Zurück zum Blog