{"content_id":"vupqjenc6z","slug":"meta-muse-glimmer-local-ai-agent-model","locale":"de","schema_type":"TechArticle","category":"ai_data","category_name":"KI-Daten","title":"Meta Muse Glimmer: Das Wichtigste zum lokalen KI-Modell mit 30 Milliarden Parametern für Laptops","summary":"Muse Glimmer wurde als multimodales Modell vorgestellt, das mit rund 30 Milliarden Parametern für den Betrieb auf Verbraucherhardware quantisiert wurde und auf lokale KI-Agenten für den langfristigen Werkzeugeinsatz ausgerichtet ist. Da die Angaben zu Speicher, Geschwindigkeit und Benchmarks jedoch auf Messwerten von Meta beruhen, die in den bereitgestellten Unterlagen zitiert werden, ist eine Überprüfung anhand der offiziellen Modellkarte und unabhängiger Bewertungen erforderlich.","author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["Muse Glimmer zielt nicht nur auf einen einfachen lokalen Chatbot ab, sondern auf einen langfristig laufenden KI-Agenten, der Dateien, Bildschirminhalte und Werkzeuge verarbeitet.","Den bereitgestellten Unterlagen zufolge wurde die 4-Bit-quantisierte Version dafür konzipiert, das gesamte System in einer Speicherumgebung mit etwa 24 GB oder 32 GB auszuführen.","Speculative Decoding mit dem DFlash Drafter verarbeitet mehrere Token-Kandidaten auf einmal, nachdem sie vom Hauptmodell überprüft wurden.","Die lokale Verarbeitung kann die externe Übertragung von Daten verringern, beseitigt jedoch nicht die Risiken durch Prompt-Injection, übermäßige Systemberechtigungen oder Dateibeschädigungen.","Leistung und Lizenz sollten erst beurteilt werden, nachdem die Modellkarte im offiziellen Repository, die tatsächliche Lizenzdatei und unabhängige Messergebnisse für die jeweilige Hardware geprüft wurden."],"content_markdown":"Meta Muse Glimmer wurde als Modell vorgestellt, das mit rund 30 Milliarden Parametern auf einem PC oder leistungsstarken Notebook ausgeführt werden kann und darauf langfristig arbeitende lokale AI-Agenten ermöglichen soll. Das Hauptziel besteht nicht nur in der Texterzeugung, sondern auch darin, Bilder und Bildschirminhalte zu verstehen und Werkzeuge wie Dateien, Funktionen und Terminals über mehrere Schritte hinweg zu nutzen.\n\nDie Produktspezifikationen und Benchmark-Werte in diesem Beitrag wurden anhand der in den bereitgestellten Unterlagen zitierten Angaben von Meta zusammengestellt. Da weder eine direkte URL zum Originalartikel noch zur offiziellen Modellkarte bereitgestellt wurde, sollten die Werte nicht als unabhängig verifizierte Ergebnisse interpretiert werden.\n\n## Die wichtigsten Spezifikationen von Muse Glimmer\n\nDie bereitgestellten Unterlagen beschreiben die wichtigsten Spezifikationen wie folgt.\n\n| Punkt | Vorgestellte Angaben | Bei der Interpretation zu beachten |\n|---|---|---|\n| Modellgröße | Rund 30 Milliarden Parameter | Tatsächlich aktive Parameter und detaillierte Architektur müssen anhand der Modellkarte geprüft werden |\n| Eingabeformate | Text und Bilder | Unterstützte Bildauflösung, Anzahl der Frames und Kosten für Vision-Token müssen separat geprüft werden |\n| Kontext | Bis zu mindestens 131.072 Token | Genauigkeit und Speicherbedarf bei maximaler Länge können sich von kurzen Eingaben unterscheiden |\n| Sprachen | Mindestens 100 Sprachen | Bedeutet nicht, dass die Qualität in allen Sprachen gleich ist |\n| Versionen mit niedriger Präzision | K-Quant-17GB, K-Quant-Dynamic | Die im Namen enthaltene Kapazität ist vom gesamten Arbeitsspeicherbedarf zu unterscheiden |\n| Hauptanwendungen | Programmierung, Desktop-Automatisierung, Funktionsaufrufe, Dokumentenanalyse, Evaluierung | Die tatsächlichen Funktionen hängen von der angebundenen Laufzeitumgebung und den Berechtigungsrichtlinien ab |\n| Beschleunigungsmethode | Speculative Decoding mit einem DFlash-Drafter | Der Beschleunigungsfaktor variiert je nach Hardware und Eingabelänge |\n| Veröffentlichungsform | BF16, 4-Bit-Quantisierung, Drafter-Modell | Bereitgestellte Dateien und unterstützte Laufzeitumgebungen müssen im Repository geprüft werden |\n| Lizenz | Als Apache License 2.0 vorgestellt | Die tatsächliche LICENSE und zusätzliche Nutzungsbedingungen im Modell-Repository müssen geprüft werden |\n\n## Wie 30 Milliarden Parameter mit 24GB funktionieren\n\n### Einfache Berechnung des Speichers für die Gewichte\n\nWenn nur die Modellgewichte berücksichtigt werden, lässt sich der benötigte Speicherplatz ungefähr wie folgt berechnen.\n\n- BF16 oder FP16: 30 Milliarden × 2 Byte = rund 60GB\n- 8 Bit: 30 Milliarden × 1 Byte = rund 30GB\n- 4 Bit: 30 Milliarden × 0,5 Byte = rund 15GB\n\nBei 4-Bit-Gewichten kommen Quantisierungsskalen, Metadaten, Ausrichtung und Laufzeit-Overhead hinzu. Daher kann das in den bereitgestellten Unterlagen genannte Gewichtspaket mit rund 17GB größer als die theoretischen 15GB sein.\n\n### Zusätzlich zu den Gewichten benötigter Speicher\n\nEine 17GB große Modelldatei bedeutet nicht, dass sie unmittelbar auf einem Gerät mit 17GB Arbeitsspeicher ausgeführt werden kann. Bei der tatsächlichen Inferenz beanspruchen zusätzlich die folgenden Komponenten Speicherplatz.\n\n- KV-Cache zur Aufbewahrung des Eingabe- und Ausgabeverlaufs\n- Vision-Encoder zur Verarbeitung von Bildeingaben\n- Zwischenaktivierungen und Arbeitsbereich der Laufzeitumgebung\n- Hilfsmodelle wie der DFlash-Drafter\n- Speicherbedarf des Betriebssystems, Desktops und anderer Anwendungen\n- Puffer und Kopierspeicher zwischen GPU- und Systemspeicher\n\nDie bereitgestellten Unterlagen beschreiben K-Quant-17GB als Version für Umgebungen mit rund 24GB und K-Quant-Dynamic als Version für Umgebungen mit rund 32GB. Ob mit diesem Speicher jedoch dedizierter VRAM, ein vereinheitlichter Speicher wie bei Apple Silicon oder eine Konfiguration gemeint ist, die einen Teil des System-RAM mitverwendet, muss anhand der tatsächlichen Ausführungsanleitung geprüft werden.\n\nMit zunehmender Kontextlänge wächst auch der KV-Cache. Allein aus der Spezifikation, dass 131.072 Token unterstützt werden, lässt sich daher nicht schließen, dass die maximale Länge in einer 24GB-Umgebung immer nutzbar ist.\n\n## Warum das Modell als lokaler AI-Agent konzipiert wurde\n\nDer von Muse Glimmer angestrebte Agent unterscheidet sich von einem Chatbot, der eine Frage einmal beantwortet und dann endet. Ein typischer Arbeitsablauf sieht wie folgt aus.\n\n1. Er interpretiert das Ziel und die Einschränkungen des Nutzers.\n2. Er plant die für die Erledigung erforderlichen Teilaufgaben.\n3. Er ruft Dateisuche, Funktionen, Terminal- oder Browser-Werkzeuge auf.\n4. Er liest Ausführungsergebnisse und Fehlermeldungen.\n5. Er überarbeitet den Plan oder den Code.\n6. Er führt Test- oder Prüfwerkzeuge erneut aus.\n7. Er wiederholt den Prozess, bis die Abschlussbedingungen erfüllt sind.\n\nBei der Behebung eines Projektfehlers folgen beispielsweise Quellcodeanalyse, Befehlsausführung, Auswertung von Protokollen, Codeänderungen, Tests und erneute Überarbeitungen unmittelbar aufeinander. Da in jedem Schritt wiederholt Modellinferenz erfolgt, sind neben der Antwortgeschwindigkeit auch die Genauigkeit der Werkzeugaufrufe, die Fähigkeit zur Fehlerbehebung und die Aufrechterhaltung des Zustands wichtig.\n\n## Trainingsmethoden und Agentenfähigkeiten\n\nDen bereitgestellten Unterlagen zufolge wurde Muse Glimmer durch Destillation vortrainiert, wobei Ergebnisse des größeren Lehrermodells Muse Spark genutzt wurden. Anschließend wurden Daten für lange Kontexte und Agentenaufgaben hinzugefügt; für das Post-Training kamen den Angaben zufolge überwachtes Lernen, On-Policy-Destillation und bestärkendes Lernen zum Einsatz.\n\nDie allgemeine Funktion der einzelnen Methoden lässt sich wie folgt verstehen.\n\n- **Destillation:** Ein kleineres Modell wird darauf trainiert, Ausgaben oder Verhaltensweisen eines größeren Lehrermodells nachzuahmen.\n- **Überwachtes Lernen:** Erwünschte Antworten, Funktionsaufrufe oder Arbeitsabläufe werden als korrekte Beispiele vorgegeben.\n- **On-Policy-Lernen:** Fehler werden anhand der Verhaltensverläufe korrigiert, die das aktuelle Modell tatsächlich erzeugt hat.\n- **Bestärkendes Lernen:** Belohnungen für Aufgabenerfolg, korrekte Werkzeugnutzung und Einhaltung von Sicherheitsregeln werden optimiert.\n\nSolche Trainingsverfahren garantieren nicht automatisch eine hohe Erfolgsquote des Agenten. Der Umfang der Trainingsdaten, die Evaluierungsumgebung, die Werkzeugdefinitionen und die Ausführungs-Sandbox haben erheblichen Einfluss auf die Ergebnisse.\n\n## Multimodale Funktionen und Einsatzbereiche\n\nMuse Glimmer wurde als multimodales Modell vorgestellt, das neben Text auch Bildeingaben versteht. Mögliche Eingaben und Anwendungsbeispiele sind:\n\n| Visuelle Eingabe | Beispiele möglicher Aufgaben |\n|---|---|\n| Bildschirmaufnahme eines PCs | Interpretation von Fehlermeldungen oder des UI-Zustands |\n| Dokumentbild | Extraktion und Zusammenfassung von Inhalten aus Tabellen, Absätzen und Formularen |\n| Grafiken und Diagramme | Achsen, Legenden und Trends lesen und erläutern |\n| GUI-Bildschirm | Schaltflächen und Eingabefelder erkennen und die nächste Aktion planen |\n| Ansicht eines Entwicklungswerkzeugs | Terminalausgaben oder Debugger-Zustände analysieren |\n| Mehrere Dateien und Bilder | Dokumente vergleichen und Aufzeichnungen langfristiger Aufgaben aufrechterhalten |\n\nVisuelles Verständnis und die tatsächliche Bedienung eines Computers sind getrennte Funktionen. Selbst wenn das Modell den Bildschirm interpretiert, sind für die Bedienung von Maus oder Tastatur eine separate Agenten-Laufzeitumgebung, eine Barrierefreiheitsschnittstelle oder ein Automatisierungswerkzeug erforderlich.\n\n## DFlash und Speculative Decoding\n\nAutoregressive Sprachmodelle berechnen das nächste Token üblicherweise sequenziell auf Grundlage der zuvor erzeugten Token. Beim Speculative Decoding schlägt ein kleineres Drafter-Modell zunächst mehrere Token-Kandidaten vor, die das Hauptmodell anschließend in einem Durchgang überprüft.\n\nDer Prozess lässt sich wie folgt zusammenfassen.\n\n1. Der DFlash-Drafter schlägt eine Gruppe von Token vor, die mit hoher Wahrscheinlichkeit als Nächstes auftreten.\n2. Das eigentliche Muse Glimmer-Modell überprüft die vorgeschlagenen Token.\n3. Token, die mit der Verteilung des Hauptmodells übereinstimmen, werden übernommen.\n4. Ab der Stelle, an der keine Übereinstimmung besteht, wird erneut generiert.\n\nMit einem korrekten Prüfverfahren lässt sich die Generierungszeit verkürzen, während die Ausgabeverteilung des Hauptmodells erhalten bleibt. Ist die Trefferquote des Drafters jedoch niedrig oder die Speicherbandbreite unzureichend, kann die erwartete Beschleunigung ausbleiben.\n\n## In den bereitgestellten Unterlagen genannte Generierungsgeschwindigkeit\n\nDie folgenden Werte wurden als eigene Messergebnisse von Meta für K-Quant-17GB mit DFlash-Drafter vorgestellt. Es handelt sich nicht um einen unabhängigen Benchmark. Ohne Angaben zu Hardwarekonfiguration, Prompt, Kontextlänge, Laufzeitumgebung und Leistungsbedingungen sind direkte Vergleiche nur eingeschränkt möglich.\n\n| Hardware | Grundgeschwindigkeit | Mit DFlash | Angegebene Steigerung |\n|---|---:|---:|---:|\n| NVIDIA GeForce RTX 5090 | 74,9 Token/Sekunde | 233,4 Token/Sekunde | rund 3,1-fach |\n| Apple M5 Max | 26,6 Token/Sekunde | 50,2 Token/Sekunde | rund 1,8-fach |\n| Apple M4 Max | 23,7 Token/Sekunde | 37,8 Token/Sekunde | rund 1,5-fach |\n\nDa ein Agent mehrfach Inferenzen durchführt und auf externe Werkzeuge wartet, entspricht die Geschwindigkeit der Token-Generierung nicht der gesamten Bearbeitungszeit. Die tatsächliche Abschlusszeit umfasst auch die Geschwindigkeit der Prompt-Verarbeitung, Datei-Ein- und -Ausgaben, Codeausführung, Netzwerkzugriffe und die Anzahl der Werkzeugwiederholungen.\n\n## Wie die Benchmark-Ergebnisse zu lesen sind\n\nDie bereitgestellten Unterlagen vergleichen Muse Glimmer mit Gemma 4 31B und Qwen 3.6 27B und nennen die folgenden Ergebnisse.\n\n| Benchmark | Muse Glimmer | Gemma 4 31B | Qwen 3.6 27B |\n|---|---:|---:|---:|\n| MCP Atlas | 75,5 | Keine Angabe in den Unterlagen | Keine Angabe in den Unterlagen |\n| DeepSearch QA | 74,6 | Keine Angabe in den Unterlagen | Keine Angabe in den Unterlagen |\n\nZugleich wird berichtet, dass Qwen 3.6 27B bei OSWorld Verified, TerminalBench 2.1 und SWE-bench Verified bessere Ergebnisse als Muse Glimmer erzielte. Das bedeutet, dass aufgabenspezifische Bewertungen wichtiger sind als ein einzelner Durchschnittswert.\n\nBei der Prüfung von Benchmarks sollte Folgendes kontrolliert werden.\n\n- Wurden dieselbe Modellpräzision und dieselben Quantisierungsbedingungen verwendet?\n- Waren die Anzahl der Werkzeugaufrufe und das Zeitlimit identisch?\n- Wurden der Agenten-Prompt und der Orchestrierungscode veröffentlicht?\n- Waren Bildauflösung und maximaler Kontext gleich?\n- Wurden Mittelwert und Streuung mehrerer Durchläufe angegeben?\n- Wurde geprüft, ob die Evaluierungsdaten möglicherweise in den Trainingsdaten enthalten waren?\n- Wurden fehlgeschlagene Aufgaben nicht von Menschen korrigiert oder neu gestartet?\n\nDen bereitgestellten Unterlagen zufolge wurde über den Durchschnitt von 15 Benchmarks für K-Quant-Dynamic gegenüber dem Original ein Leistungsrückgang von rund 0,2% und für K-Quant-17GB von rund 1% gemessen. Auch diese Werte werden als eigene Evaluierung von Meta vorgestellt; der Rückgang bei einzelnen Aufgaben kann vom Durchschnitt abweichen.\n\n## Datenschutzvorteile und Grenzen der lokalen Ausführung\n\nEine vollständig lokale Konfiguration hilft dabei, ein System aufzubauen, das Quellcode, interne Dokumente, Bildschirmaufnahmen und Datenbankinhalte nicht an eine externe LLM-API übermittelt. Weitere Vorteile sind die Nutzung in abgeschotteten Netzwerken und die Vermeidung tokenbasierter Nutzungsgebühren externer APIs.\n\nDie Tatsache, dass sich die Modelldatei lokal befindet, bedeutet jedoch nicht, dass alle Datenflüsse lokal bleiben. Die folgenden Komponenten können auf externe Systeme zugreifen.\n\n- Websuche oder Remote-Browser-Werkzeuge\n- Telemetrie zur Fehler- und Nutzungsanalyse\n- Erweiterungen und Agenten-Plug-ins\n- Cloudbasierte Dokumentenspeicher\n- Paketmanager und Code-Repositorys\n- Remote-Dienste für Embeddings, Suche oder Evaluierung\n\nOrganisationen mit sensiblen Daten sollten Netzwerkprotokolle und laufende Prozesse kontrollieren und nicht nur die Datenpfade der Modell-Laufzeitumgebung, sondern aller angebundenen Werkzeuge prüfen.\n\n## Sicherheitsrisiken lokaler Agenten und Gegenmaßnahmen\n\nLokale AI kann Übertragungsrisiken verringern, zugleich können jedoch die von Systemberechtigungen ausgehenden Risiken zunehmen. Besondere Vorsicht ist bei indirekten Prompt-Injections geboten, bei denen in externen Dokumenten oder Webseiten verborgene Anweisungen das ursprüngliche Ziel des Agenten verändern.\n\nEmpfohlene Schutzmaßnahmen sind:\n\n- Zunächst in einem schreibgeschützten Arbeitsbereich ausführen.\n- Nicht das gesamte Home-Verzeichnis, sondern nur die erforderlichen Ordner freigeben.\n- Für Löschen, Überschreiben, Überweisungen und Bereitstellungen die Zustimmung eines Menschen verlangen.\n- Administratorrechte und den Zugriff auf zentrale Betriebssystemordner sperren.\n- Geheime Schlüssel und Authentifizierungs-Token nicht direkt in den Modellkontext eingeben.\n- Für Terminalbefehle eine Positivliste und Ausführungszeitlimits festlegen.\n- Sätze aus externen Dokumenten als nicht vertrauenswürdige Daten behandeln.\n- Vor Änderungen Snapshots oder Commits in der Versionsverwaltung erstellen.\n- Alle Werkzeugaufrufe und Dateiänderungen in einem Audit-Protokoll festhalten.\n- Tests in einem Container oder einer virtuellen Maschine durchführen, die von der tatsächlichen Produktionsumgebung getrennt ist.\n\nIn Medizin, Finanzwesen, Recht, Verteidigung und öffentlichem Sektor genügt lokale Verarbeitung allein nicht, um regulatorische Anforderungen vollständig zu erfüllen. Zusätzlich sind Zugriffskontrollen, Aufbewahrung von Aufzeichnungen, Zustimmung der Verantwortlichen, Datenklassifizierung und Modellvalidierung erforderlich.\n\n## Was die Veröffentlichung unter Apache 2.0 bedeutet\n\nDie bereitgestellten Unterlagen erklären, dass die Gewichte von Muse Glimmer unter der Apache License 2.0 veröffentlicht wurden. Apache 2.0 ist im Allgemeinen eine freizügige Lizenz, die Nutzung, Änderung, Verbreitung und kommerzielle Nutzung erlaubt und eine ausdrückliche Patentklausel enthält. Bei der Weiterverbreitung müssen Bedingungen wie die Beibehaltung einer Lizenzkopie, von Urheberrechtshinweisen und die Kennzeichnung von Änderungen eingehalten werden.\n\nVor der tatsächlichen Nutzung des Modells sollte jedoch Folgendes separat geprüft werden.\n\n- Ob jede Modelldatei tatsächlich unter Apache 2.0 fällt\n- Ob die Modellkarte oder das Repository zusätzliche Nutzungsbeschränkungen enthält\n- Ob der enthaltene Code und der Tokenizer derselben Lizenz unterliegen\n- Ob für den Vision-Encoder und das Drafter-Modell gesonderte Bedingungen gelten\n- Ob Markenrechte oder Rechte an Daten Dritter vom genehmigten Nutzungsumfang erfasst sind\n\nDie Veröffentlichung der Gewichte bedeutet nicht, dass der gesamte Trainingsprozess als Open Source verfügbar ist. Den bereitgestellten Unterlagen zufolge wurden weder die vollständigen Trainingsdaten noch der vollständige Trainingscode veröffentlicht. Muse Glimmer kann daher zwar als Modell mit offenen Gewichten bezeichnet werden, sollte aber nicht ohne Weiteres als vollständig quelloffenes Modell gelten, dessen gesamter Trainingsprozess reproduzierbar ist.\n\n## Checkliste vor der Einführung\n\nBei der Produktbewertung sind Ergebnisse, die den eigenen Arbeitsablauf reproduzieren, wichtiger als die in Presseunterlagen genannte Höchstgeschwindigkeit.\n\n1. Den offiziellen Herausgeber und das Modell-Repository prüfen.\n2. Architektur, Kontext, unterstützte Sprachen und Eingabeformate anhand der Modellkarte prüfen.\n3. Die LICENSE-Datei und zusätzliche Nutzungsbedingungen durch die Rechtsabteilung prüfen lassen.\n4. Den maximalen Speicherbedarf einschließlich Modell, KV-Cache, Vision-Encoder und Drafter messen.\n5. Genauigkeit, Erfolgsquote der Werkzeugnutzung und Wiederherstellungsrate nach Fehlern mit tatsächlichen Dokumenten und echtem Code bewerten.\n6. Bei langen Kontexten die Geschwindigkeit der Eingabeverarbeitung und den Anstieg des Speicherbedarfs messen.\n7. Nach dem Sperren des Netzwerkzugriffs prüfen, ob alle Funktionen tatsächlich lokal arbeiten.\n8. Angriffstests mit Prompt-Injections und schädlichen Dateien durchführen.\n9. Für wichtige Änderungen menschliche Zustimmung und automatische Sicherungen einsetzen.\n10. Die aufgabenspezifischen Qualitätsunterschiede zwischen den quantisierten Versionen und dem BF16-Original vergleichen.\n\n## Gesamtbewertung\n\nDas Alleinstellungsmerkmal von Muse Glimmer liegt weniger in der Behauptung, ein Universalmodell mit den höchsten Ergebnissen in allen Benchmarks zu sein, sondern vielmehr in seinem Design, das ein multimodales Modell mit rund 30 Milliarden Parametern und langfristig arbeitenden Agentenfunktionen auf Verbraucherhardware bringen soll. Wenn 4-Bit-Quantisierung, lange Kontexte, DFlash-Beschleunigung und eine freizügige Lizenz wie in den offiziellen Unterlagen beschrieben bereitgestellt werden, könnte es eine relevante Option für lokale Programmierung, Dokumentenanalyse und Automatisierung in abgeschotteten Netzwerken sein.\n\nDie Angaben von 24GB oder 32GB garantieren dagegen nicht, dass alle Modellfunktionen und der maximale Kontext auf jedem Gerät reibungslos funktionieren. Bis eine offizielle Modellkarte und reproduzierbare Benchmarks vorliegen, sollten die Angaben zu Geschwindigkeit und Qualität als eigene Messbehauptungen von Meta eingeordnet und Speicherbedarf, Sicherheit und Genauigkeit anhand realer Workloads bewertet werden.","content_html":"\u003cp\u003eMeta Muse Glimmer wurde als Modell vorgestellt, das mit rund 30 Milliarden Parametern auf einem PC oder leistungsstarken Notebook ausgeführt werden kann und darauf langfristig arbeitende lokale AI-Agenten ermöglichen soll. Das Hauptziel besteht nicht nur in der Texterzeugung, sondern auch darin, Bilder und Bildschirminhalte zu verstehen und Werkzeuge wie Dateien, Funktionen und Terminals über mehrere Schritte hinweg zu nutzen.\u003c/p\u003e\n\u003cp\u003eDie Produktspezifikationen und Benchmark-Werte in diesem Beitrag wurden anhand der in den bereitgestellten Unterlagen zitierten Angaben von Meta zusammengestellt. Da weder eine direkte URL zum Originalartikel noch zur offiziellen Modellkarte bereitgestellt wurde, sollten die Werte nicht als unabhängig verifizierte Ergebnisse interpretiert werden.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#die-wichtigsten-spezifikationen-von-muse-glimmer\" class=\"anchor\" id=\"die-wichtigsten-spezifikationen-von-muse-glimmer\"\u003e\u003c/a\u003eDie wichtigsten Spezifikationen von Muse Glimmer\u003c/h2\u003e\n\u003cp\u003eDie bereitgestellten Unterlagen beschreiben die wichtigsten Spezifikationen wie folgt.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003ePunkt\u003c/th\u003e\n\u003cth\u003eVorgestellte Angaben\u003c/th\u003e\n\u003cth\u003eBei der Interpretation zu beachten\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eModellgröße\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eRund 30 Milliarden Parameter\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eTatsächlich aktive Parameter und detaillierte Architektur müssen anhand der Modellkarte geprüft werden\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eEingabeformate\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eText und Bilder\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eUnterstützte Bildauflösung, Anzahl der Frames und Kosten für Vision-Token müssen separat geprüft werden\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eKontext\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eBis zu mindestens 131.072 Token\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eGenauigkeit und Speicherbedarf bei maximaler Länge können sich von kurzen Eingaben unterscheiden\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eSprachen\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eMindestens 100 Sprachen\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eBedeutet nicht, dass die Qualität in allen Sprachen gleich ist\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eVersionen mit niedriger Präzision\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eK-Quant-17GB, K-Quant-Dynamic\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eDie im Namen enthaltene Kapazität ist vom gesamten Arbeitsspeicherbedarf zu unterscheiden\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eHauptanwendungen\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eProgrammierung, Desktop-Automatisierung, Funktionsaufrufe, Dokumentenanalyse, Evaluierung\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eDie tatsächlichen Funktionen hängen von der angebundenen Laufzeitumgebung und den Berechtigungsrichtlinien ab\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eBeschleunigungsmethode\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eSpeculative Decoding mit einem DFlash-Drafter\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eDer Beschleunigungsfaktor variiert je nach Hardware und Eingabelänge\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eVeröffentlichungsform\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eBF16, 4-Bit-Quantisierung, Drafter-Modell\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eBereitgestellte Dateien und unterstützte Laufzeitumgebungen müssen im Repository geprüft werden\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Punkt\"\u003eLizenz\u003c/td\u003e\n\u003ctd data-label=\"Vorgestellte Angaben\"\u003eAls Apache License 2.0 vorgestellt\u003c/td\u003e\n\u003ctd data-label=\"Bei der Interpretation zu beachten\"\u003eDie tatsächliche LICENSE und zusätzliche Nutzungsbedingungen im Modell-Repository müssen geprüft werden\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003ch2\u003e\n\u003ca href=\"#wie-30-milliarden-parameter-mit-24gb-funktionieren\" class=\"anchor\" id=\"wie-30-milliarden-parameter-mit-24gb-funktionieren\"\u003e\u003c/a\u003eWie 30 Milliarden Parameter mit 24GB funktionieren\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#einfache-berechnung-des-speichers-f%C3%BCr-die-gewichte\" class=\"anchor\" id=\"einfache-berechnung-des-speichers-für-die-gewichte\"\u003e\u003c/a\u003eEinfache Berechnung des Speichers für die Gewichte\u003c/h3\u003e\n\u003cp\u003eWenn nur die Modellgewichte berücksichtigt werden, lässt sich der benötigte Speicherplatz ungefähr wie folgt berechnen.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eBF16 oder FP16: 30 Milliarden × 2 Byte = rund 60GB\u003c/li\u003e\n\u003cli\u003e8 Bit: 30 Milliarden × 1 Byte = rund 30GB\u003c/li\u003e\n\u003cli\u003e4 Bit: 30 Milliarden × 0,5 Byte = rund 15GB\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eBei 4-Bit-Gewichten kommen Quantisierungsskalen, Metadaten, Ausrichtung und Laufzeit-Overhead hinzu. Daher kann das in den bereitgestellten Unterlagen genannte Gewichtspaket mit rund 17GB größer als die theoretischen 15GB sein.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#zus%C3%A4tzlich-zu-den-gewichten-ben%C3%B6tigter-speicher\" class=\"anchor\" id=\"zusätzlich-zu-den-gewichten-benötigter-speicher\"\u003e\u003c/a\u003eZusätzlich zu den Gewichten benötigter Speicher\u003c/h3\u003e\n\u003cp\u003eEine 17GB große Modelldatei bedeutet nicht, dass sie unmittelbar auf einem Gerät mit 17GB Arbeitsspeicher ausgeführt werden kann. Bei der tatsächlichen Inferenz beanspruchen zusätzlich die folgenden Komponenten Speicherplatz.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eKV-Cache zur Aufbewahrung des Eingabe- und Ausgabeverlaufs\u003c/li\u003e\n\u003cli\u003eVision-Encoder zur Verarbeitung von Bildeingaben\u003c/li\u003e\n\u003cli\u003eZwischenaktivierungen und Arbeitsbereich der Laufzeitumgebung\u003c/li\u003e\n\u003cli\u003eHilfsmodelle wie der DFlash-Drafter\u003c/li\u003e\n\u003cli\u003eSpeicherbedarf des Betriebssystems, Desktops und anderer Anwendungen\u003c/li\u003e\n\u003cli\u003ePuffer und Kopierspeicher zwischen GPU- und Systemspeicher\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eDie bereitgestellten Unterlagen beschreiben K-Quant-17GB als Version für Umgebungen mit rund 24GB und K-Quant-Dynamic als Version für Umgebungen mit rund 32GB. Ob mit diesem Speicher jedoch dedizierter VRAM, ein vereinheitlichter Speicher wie bei Apple Silicon oder eine Konfiguration gemeint ist, die einen Teil des System-RAM mitverwendet, muss anhand der tatsächlichen Ausführungsanleitung geprüft werden.\u003c/p\u003e\n\u003cp\u003eMit zunehmender Kontextlänge wächst auch der KV-Cache. Allein aus der Spezifikation, dass 131.072 Token unterstützt werden, lässt sich daher nicht schließen, dass die maximale Länge in einer 24GB-Umgebung immer nutzbar ist.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#warum-das-modell-als-lokaler-ai-agent-konzipiert-wurde\" class=\"anchor\" id=\"warum-das-modell-als-lokaler-ai-agent-konzipiert-wurde\"\u003e\u003c/a\u003eWarum das Modell als lokaler AI-Agent konzipiert wurde\u003c/h2\u003e\n\u003cp\u003eDer von Muse Glimmer angestrebte Agent unterscheidet sich von einem Chatbot, der eine Frage einmal beantwortet und dann endet. Ein typischer Arbeitsablauf sieht wie folgt aus.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eEr interpretiert das Ziel und die Einschränkungen des Nutzers.\u003c/li\u003e\n\u003cli\u003eEr plant die für die Erledigung erforderlichen Teilaufgaben.\u003c/li\u003e\n\u003cli\u003eEr ruft Dateisuche, Funktionen, Terminal- oder Browser-Werkzeuge auf.\u003c/li\u003e\n\u003cli\u003eEr liest Ausführungsergebnisse und Fehlermeldungen.\u003c/li\u003e\n\u003cli\u003eEr überarbeitet den Plan oder den Code.\u003c/li\u003e\n\u003cli\u003eEr führt Test- oder Prüfwerkzeuge erneut aus.\u003c/li\u003e\n\u003cli\u003eEr wiederholt den Prozess, bis die Abschlussbedingungen erfüllt sind.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eBei der Behebung eines Projektfehlers folgen beispielsweise Quellcodeanalyse, Befehlsausführung, Auswertung von Protokollen, Codeänderungen, Tests und erneute Überarbeitungen unmittelbar aufeinander. Da in jedem Schritt wiederholt Modellinferenz erfolgt, sind neben der Antwortgeschwindigkeit auch die Genauigkeit der Werkzeugaufrufe, die Fähigkeit zur Fehlerbehebung und die Aufrechterhaltung des Zustands wichtig.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#trainingsmethoden-und-agentenf%C3%A4higkeiten\" class=\"anchor\" id=\"trainingsmethoden-und-agentenfähigkeiten\"\u003e\u003c/a\u003eTrainingsmethoden und Agentenfähigkeiten\u003c/h2\u003e\n\u003cp\u003eDen bereitgestellten Unterlagen zufolge wurde Muse Glimmer durch Destillation vortrainiert, wobei Ergebnisse des größeren Lehrermodells Muse Spark genutzt wurden. Anschließend wurden Daten für lange Kontexte und Agentenaufgaben hinzugefügt; für das Post-Training kamen den Angaben zufolge überwachtes Lernen, On-Policy-Destillation und bestärkendes Lernen zum Einsatz.\u003c/p\u003e\n\u003cp\u003eDie allgemeine Funktion der einzelnen Methoden lässt sich wie folgt verstehen.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eDestillation:\u003c/strong\u003e Ein kleineres Modell wird darauf trainiert, Ausgaben oder Verhaltensweisen eines größeren Lehrermodells nachzuahmen.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eÜberwachtes Lernen:\u003c/strong\u003e Erwünschte Antworten, Funktionsaufrufe oder Arbeitsabläufe werden als korrekte Beispiele vorgegeben.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eOn-Policy-Lernen:\u003c/strong\u003e Fehler werden anhand der Verhaltensverläufe korrigiert, die das aktuelle Modell tatsächlich erzeugt hat.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eBestärkendes Lernen:\u003c/strong\u003e Belohnungen für Aufgabenerfolg, korrekte Werkzeugnutzung und Einhaltung von Sicherheitsregeln werden optimiert.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eSolche Trainingsverfahren garantieren nicht automatisch eine hohe Erfolgsquote des Agenten. Der Umfang der Trainingsdaten, die Evaluierungsumgebung, die Werkzeugdefinitionen und die Ausführungs-Sandbox haben erheblichen Einfluss auf die Ergebnisse.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#multimodale-funktionen-und-einsatzbereiche\" class=\"anchor\" id=\"multimodale-funktionen-und-einsatzbereiche\"\u003e\u003c/a\u003eMultimodale Funktionen und Einsatzbereiche\u003c/h2\u003e\n\u003cp\u003eMuse Glimmer wurde als multimodales Modell vorgestellt, das neben Text auch Bildeingaben versteht. Mögliche Eingaben und Anwendungsbeispiele sind:\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eVisuelle Eingabe\u003c/th\u003e\n\u003cth\u003eBeispiele möglicher Aufgaben\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Visuelle Eingabe\"\u003eBildschirmaufnahme eines PCs\u003c/td\u003e\n\u003ctd data-label=\"Beispiele möglicher Aufgaben\"\u003eInterpretation von Fehlermeldungen oder des UI-Zustands\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Visuelle Eingabe\"\u003eDokumentbild\u003c/td\u003e\n\u003ctd data-label=\"Beispiele möglicher Aufgaben\"\u003eExtraktion und Zusammenfassung von Inhalten aus Tabellen, Absätzen und Formularen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Visuelle Eingabe\"\u003eGrafiken und Diagramme\u003c/td\u003e\n\u003ctd data-label=\"Beispiele möglicher Aufgaben\"\u003eAchsen, Legenden und Trends lesen und erläutern\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Visuelle Eingabe\"\u003eGUI-Bildschirm\u003c/td\u003e\n\u003ctd data-label=\"Beispiele möglicher Aufgaben\"\u003eSchaltflächen und Eingabefelder erkennen und die nächste Aktion planen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Visuelle Eingabe\"\u003eAnsicht eines Entwicklungswerkzeugs\u003c/td\u003e\n\u003ctd data-label=\"Beispiele möglicher Aufgaben\"\u003eTerminalausgaben oder Debugger-Zustände analysieren\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Visuelle Eingabe\"\u003eMehrere Dateien und Bilder\u003c/td\u003e\n\u003ctd data-label=\"Beispiele möglicher Aufgaben\"\u003eDokumente vergleichen und Aufzeichnungen langfristiger Aufgaben aufrechterhalten\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eVisuelles Verständnis und die tatsächliche Bedienung eines Computers sind getrennte Funktionen. Selbst wenn das Modell den Bildschirm interpretiert, sind für die Bedienung von Maus oder Tastatur eine separate Agenten-Laufzeitumgebung, eine Barrierefreiheitsschnittstelle oder ein Automatisierungswerkzeug erforderlich.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#dflash-und-speculative-decoding\" class=\"anchor\" id=\"dflash-und-speculative-decoding\"\u003e\u003c/a\u003eDFlash und Speculative Decoding\u003c/h2\u003e\n\u003cp\u003eAutoregressive Sprachmodelle berechnen das nächste Token üblicherweise sequenziell auf Grundlage der zuvor erzeugten Token. Beim Speculative Decoding schlägt ein kleineres Drafter-Modell zunächst mehrere Token-Kandidaten vor, die das Hauptmodell anschließend in einem Durchgang überprüft.\u003c/p\u003e\n\u003cp\u003eDer Prozess lässt sich wie folgt zusammenfassen.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eDer DFlash-Drafter schlägt eine Gruppe von Token vor, die mit hoher Wahrscheinlichkeit als Nächstes auftreten.\u003c/li\u003e\n\u003cli\u003eDas eigentliche Muse Glimmer-Modell überprüft die vorgeschlagenen Token.\u003c/li\u003e\n\u003cli\u003eToken, die mit der Verteilung des Hauptmodells übereinstimmen, werden übernommen.\u003c/li\u003e\n\u003cli\u003eAb der Stelle, an der keine Übereinstimmung besteht, wird erneut generiert.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eMit einem korrekten Prüfverfahren lässt sich die Generierungszeit verkürzen, während die Ausgabeverteilung des Hauptmodells erhalten bleibt. Ist die Trefferquote des Drafters jedoch niedrig oder die Speicherbandbreite unzureichend, kann die erwartete Beschleunigung ausbleiben.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#in-den-bereitgestellten-unterlagen-genannte-generierungsgeschwindigkeit\" class=\"anchor\" id=\"in-den-bereitgestellten-unterlagen-genannte-generierungsgeschwindigkeit\"\u003e\u003c/a\u003eIn den bereitgestellten Unterlagen genannte Generierungsgeschwindigkeit\u003c/h2\u003e\n\u003cp\u003eDie folgenden Werte wurden als eigene Messergebnisse von Meta für K-Quant-17GB mit DFlash-Drafter vorgestellt. Es handelt sich nicht um einen unabhängigen Benchmark. Ohne Angaben zu Hardwarekonfiguration, Prompt, Kontextlänge, Laufzeitumgebung und Leistungsbedingungen sind direkte Vergleiche nur eingeschränkt möglich.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eHardware\u003c/th\u003e\n\u003cth\u003eGrundgeschwindigkeit\u003c/th\u003e\n\u003cth\u003eMit DFlash\u003c/th\u003e\n\u003cth\u003eAngegebene Steigerung\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eNVIDIA GeForce RTX 5090\u003c/td\u003e\n\u003ctd data-label=\"Grundgeschwindigkeit\"\u003e74,9 Token/Sekunde\u003c/td\u003e\n\u003ctd data-label=\"Mit DFlash\"\u003e233,4 Token/Sekunde\u003c/td\u003e\n\u003ctd data-label=\"Angegebene Steigerung\"\u003erund 3,1-fach\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eApple M5 Max\u003c/td\u003e\n\u003ctd data-label=\"Grundgeschwindigkeit\"\u003e26,6 Token/Sekunde\u003c/td\u003e\n\u003ctd data-label=\"Mit DFlash\"\u003e50,2 Token/Sekunde\u003c/td\u003e\n\u003ctd data-label=\"Angegebene Steigerung\"\u003erund 1,8-fach\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Hardware\"\u003eApple M4 Max\u003c/td\u003e\n\u003ctd data-label=\"Grundgeschwindigkeit\"\u003e23,7 Token/Sekunde\u003c/td\u003e\n\u003ctd data-label=\"Mit DFlash\"\u003e37,8 Token/Sekunde\u003c/td\u003e\n\u003ctd data-label=\"Angegebene Steigerung\"\u003erund 1,5-fach\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eDa ein Agent mehrfach Inferenzen durchführt und auf externe Werkzeuge wartet, entspricht die Geschwindigkeit der Token-Generierung nicht der gesamten Bearbeitungszeit. Die tatsächliche Abschlusszeit umfasst auch die Geschwindigkeit der Prompt-Verarbeitung, Datei-Ein- und -Ausgaben, Codeausführung, Netzwerkzugriffe und die Anzahl der Werkzeugwiederholungen.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#wie-die-benchmark-ergebnisse-zu-lesen-sind\" class=\"anchor\" id=\"wie-die-benchmark-ergebnisse-zu-lesen-sind\"\u003e\u003c/a\u003eWie die Benchmark-Ergebnisse zu lesen sind\u003c/h2\u003e\n\u003cp\u003eDie bereitgestellten Unterlagen vergleichen Muse Glimmer mit Gemma 4 31B und Qwen 3.6 27B und nennen die folgenden Ergebnisse.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eBenchmark\u003c/th\u003e\n\u003cth\u003eMuse Glimmer\u003c/th\u003e\n\u003cth\u003eGemma 4 31B\u003c/th\u003e\n\u003cth\u003eQwen 3.6 27B\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Benchmark\"\u003eMCP Atlas\u003c/td\u003e\n\u003ctd data-label=\"Muse Glimmer\"\u003e75,5\u003c/td\u003e\n\u003ctd data-label=\"Gemma 4 31B\"\u003eKeine Angabe in den Unterlagen\u003c/td\u003e\n\u003ctd data-label=\"Qwen 3.6 27B\"\u003eKeine Angabe in den Unterlagen\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Benchmark\"\u003eDeepSearch QA\u003c/td\u003e\n\u003ctd data-label=\"Muse Glimmer\"\u003e74,6\u003c/td\u003e\n\u003ctd data-label=\"Gemma 4 31B\"\u003eKeine Angabe in den Unterlagen\u003c/td\u003e\n\u003ctd data-label=\"Qwen 3.6 27B\"\u003eKeine Angabe in den Unterlagen\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eZugleich wird berichtet, dass Qwen 3.6 27B bei OSWorld Verified, TerminalBench 2.1 und SWE-bench Verified bessere Ergebnisse als Muse Glimmer erzielte. Das bedeutet, dass aufgabenspezifische Bewertungen wichtiger sind als ein einzelner Durchschnittswert.\u003c/p\u003e\n\u003cp\u003eBei der Prüfung von Benchmarks sollte Folgendes kontrolliert werden.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eWurden dieselbe Modellpräzision und dieselben Quantisierungsbedingungen verwendet?\u003c/li\u003e\n\u003cli\u003eWaren die Anzahl der Werkzeugaufrufe und das Zeitlimit identisch?\u003c/li\u003e\n\u003cli\u003eWurden der Agenten-Prompt und der Orchestrierungscode veröffentlicht?\u003c/li\u003e\n\u003cli\u003eWaren Bildauflösung und maximaler Kontext gleich?\u003c/li\u003e\n\u003cli\u003eWurden Mittelwert und Streuung mehrerer Durchläufe angegeben?\u003c/li\u003e\n\u003cli\u003eWurde geprüft, ob die Evaluierungsdaten möglicherweise in den Trainingsdaten enthalten waren?\u003c/li\u003e\n\u003cli\u003eWurden fehlgeschlagene Aufgaben nicht von Menschen korrigiert oder neu gestartet?\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eDen bereitgestellten Unterlagen zufolge wurde über den Durchschnitt von 15 Benchmarks für K-Quant-Dynamic gegenüber dem Original ein Leistungsrückgang von rund 0,2% und für K-Quant-17GB von rund 1% gemessen. Auch diese Werte werden als eigene Evaluierung von Meta vorgestellt; der Rückgang bei einzelnen Aufgaben kann vom Durchschnitt abweichen.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#datenschutzvorteile-und-grenzen-der-lokalen-ausf%C3%BChrung\" class=\"anchor\" id=\"datenschutzvorteile-und-grenzen-der-lokalen-ausführung\"\u003e\u003c/a\u003eDatenschutzvorteile und Grenzen der lokalen Ausführung\u003c/h2\u003e\n\u003cp\u003eEine vollständig lokale Konfiguration hilft dabei, ein System aufzubauen, das Quellcode, interne Dokumente, Bildschirmaufnahmen und Datenbankinhalte nicht an eine externe LLM-API übermittelt. Weitere Vorteile sind die Nutzung in abgeschotteten Netzwerken und die Vermeidung tokenbasierter Nutzungsgebühren externer APIs.\u003c/p\u003e\n\u003cp\u003eDie Tatsache, dass sich die Modelldatei lokal befindet, bedeutet jedoch nicht, dass alle Datenflüsse lokal bleiben. Die folgenden Komponenten können auf externe Systeme zugreifen.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eWebsuche oder Remote-Browser-Werkzeuge\u003c/li\u003e\n\u003cli\u003eTelemetrie zur Fehler- und Nutzungsanalyse\u003c/li\u003e\n\u003cli\u003eErweiterungen und Agenten-Plug-ins\u003c/li\u003e\n\u003cli\u003eCloudbasierte Dokumentenspeicher\u003c/li\u003e\n\u003cli\u003ePaketmanager und Code-Repositorys\u003c/li\u003e\n\u003cli\u003eRemote-Dienste für Embeddings, Suche oder Evaluierung\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eOrganisationen mit sensiblen Daten sollten Netzwerkprotokolle und laufende Prozesse kontrollieren und nicht nur die Datenpfade der Modell-Laufzeitumgebung, sondern aller angebundenen Werkzeuge prüfen.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#sicherheitsrisiken-lokaler-agenten-und-gegenma%C3%9Fnahmen\" class=\"anchor\" id=\"sicherheitsrisiken-lokaler-agenten-und-gegenmaßnahmen\"\u003e\u003c/a\u003eSicherheitsrisiken lokaler Agenten und Gegenmaßnahmen\u003c/h2\u003e\n\u003cp\u003eLokale AI kann Übertragungsrisiken verringern, zugleich können jedoch die von Systemberechtigungen ausgehenden Risiken zunehmen. Besondere Vorsicht ist bei indirekten Prompt-Injections geboten, bei denen in externen Dokumenten oder Webseiten verborgene Anweisungen das ursprüngliche Ziel des Agenten verändern.\u003c/p\u003e\n\u003cp\u003eEmpfohlene Schutzmaßnahmen sind:\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eZunächst in einem schreibgeschützten Arbeitsbereich ausführen.\u003c/li\u003e\n\u003cli\u003eNicht das gesamte Home-Verzeichnis, sondern nur die erforderlichen Ordner freigeben.\u003c/li\u003e\n\u003cli\u003eFür Löschen, Überschreiben, Überweisungen und Bereitstellungen die Zustimmung eines Menschen verlangen.\u003c/li\u003e\n\u003cli\u003eAdministratorrechte und den Zugriff auf zentrale Betriebssystemordner sperren.\u003c/li\u003e\n\u003cli\u003eGeheime Schlüssel und Authentifizierungs-Token nicht direkt in den Modellkontext eingeben.\u003c/li\u003e\n\u003cli\u003eFür Terminalbefehle eine Positivliste und Ausführungszeitlimits festlegen.\u003c/li\u003e\n\u003cli\u003eSätze aus externen Dokumenten als nicht vertrauenswürdige Daten behandeln.\u003c/li\u003e\n\u003cli\u003eVor Änderungen Snapshots oder Commits in der Versionsverwaltung erstellen.\u003c/li\u003e\n\u003cli\u003eAlle Werkzeugaufrufe und Dateiänderungen in einem Audit-Protokoll festhalten.\u003c/li\u003e\n\u003cli\u003eTests in einem Container oder einer virtuellen Maschine durchführen, die von der tatsächlichen Produktionsumgebung getrennt ist.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eIn Medizin, Finanzwesen, Recht, Verteidigung und öffentlichem Sektor genügt lokale Verarbeitung allein nicht, um regulatorische Anforderungen vollständig zu erfüllen. Zusätzlich sind Zugriffskontrollen, Aufbewahrung von Aufzeichnungen, Zustimmung der Verantwortlichen, Datenklassifizierung und Modellvalidierung erforderlich.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#was-die-ver%C3%B6ffentlichung-unter-apache-20-bedeutet\" class=\"anchor\" id=\"was-die-veröffentlichung-unter-apache-20-bedeutet\"\u003e\u003c/a\u003eWas die Veröffentlichung unter Apache 2.0 bedeutet\u003c/h2\u003e\n\u003cp\u003eDie bereitgestellten Unterlagen erklären, dass die Gewichte von Muse Glimmer unter der Apache License 2.0 veröffentlicht wurden. Apache 2.0 ist im Allgemeinen eine freizügige Lizenz, die Nutzung, Änderung, Verbreitung und kommerzielle Nutzung erlaubt und eine ausdrückliche Patentklausel enthält. Bei der Weiterverbreitung müssen Bedingungen wie die Beibehaltung einer Lizenzkopie, von Urheberrechtshinweisen und die Kennzeichnung von Änderungen eingehalten werden.\u003c/p\u003e\n\u003cp\u003eVor der tatsächlichen Nutzung des Modells sollte jedoch Folgendes separat geprüft werden.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eOb jede Modelldatei tatsächlich unter Apache 2.0 fällt\u003c/li\u003e\n\u003cli\u003eOb die Modellkarte oder das Repository zusätzliche Nutzungsbeschränkungen enthält\u003c/li\u003e\n\u003cli\u003eOb der enthaltene Code und der Tokenizer derselben Lizenz unterliegen\u003c/li\u003e\n\u003cli\u003eOb für den Vision-Encoder und das Drafter-Modell gesonderte Bedingungen gelten\u003c/li\u003e\n\u003cli\u003eOb Markenrechte oder Rechte an Daten Dritter vom genehmigten Nutzungsumfang erfasst sind\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eDie Veröffentlichung der Gewichte bedeutet nicht, dass der gesamte Trainingsprozess als Open Source verfügbar ist. Den bereitgestellten Unterlagen zufolge wurden weder die vollständigen Trainingsdaten noch der vollständige Trainingscode veröffentlicht. Muse Glimmer kann daher zwar als Modell mit offenen Gewichten bezeichnet werden, sollte aber nicht ohne Weiteres als vollständig quelloffenes Modell gelten, dessen gesamter Trainingsprozess reproduzierbar ist.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#checkliste-vor-der-einf%C3%BChrung\" class=\"anchor\" id=\"checkliste-vor-der-einführung\"\u003e\u003c/a\u003eCheckliste vor der Einführung\u003c/h2\u003e\n\u003cp\u003eBei der Produktbewertung sind Ergebnisse, die den eigenen Arbeitsablauf reproduzieren, wichtiger als die in Presseunterlagen genannte Höchstgeschwindigkeit.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eDen offiziellen Herausgeber und das Modell-Repository prüfen.\u003c/li\u003e\n\u003cli\u003eArchitektur, Kontext, unterstützte Sprachen und Eingabeformate anhand der Modellkarte prüfen.\u003c/li\u003e\n\u003cli\u003eDie LICENSE-Datei und zusätzliche Nutzungsbedingungen durch die Rechtsabteilung prüfen lassen.\u003c/li\u003e\n\u003cli\u003eDen maximalen Speicherbedarf einschließlich Modell, KV-Cache, Vision-Encoder und Drafter messen.\u003c/li\u003e\n\u003cli\u003eGenauigkeit, Erfolgsquote der Werkzeugnutzung und Wiederherstellungsrate nach Fehlern mit tatsächlichen Dokumenten und echtem Code bewerten.\u003c/li\u003e\n\u003cli\u003eBei langen Kontexten die Geschwindigkeit der Eingabeverarbeitung und den Anstieg des Speicherbedarfs messen.\u003c/li\u003e\n\u003cli\u003eNach dem Sperren des Netzwerkzugriffs prüfen, ob alle Funktionen tatsächlich lokal arbeiten.\u003c/li\u003e\n\u003cli\u003eAngriffstests mit Prompt-Injections und schädlichen Dateien durchführen.\u003c/li\u003e\n\u003cli\u003eFür wichtige Änderungen menschliche Zustimmung und automatische Sicherungen einsetzen.\u003c/li\u003e\n\u003cli\u003eDie aufgabenspezifischen Qualitätsunterschiede zwischen den quantisierten Versionen und dem BF16-Original vergleichen.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch2\u003e\n\u003ca href=\"#gesamtbewertung\" class=\"anchor\" id=\"gesamtbewertung\"\u003e\u003c/a\u003eGesamtbewertung\u003c/h2\u003e\n\u003cp\u003eDas Alleinstellungsmerkmal von Muse Glimmer liegt weniger in der Behauptung, ein Universalmodell mit den höchsten Ergebnissen in allen Benchmarks zu sein, sondern vielmehr in seinem Design, das ein multimodales Modell mit rund 30 Milliarden Parametern und langfristig arbeitenden Agentenfunktionen auf Verbraucherhardware bringen soll. Wenn 4-Bit-Quantisierung, lange Kontexte, DFlash-Beschleunigung und eine freizügige Lizenz wie in den offiziellen Unterlagen beschrieben bereitgestellt werden, könnte es eine relevante Option für lokale Programmierung, Dokumentenanalyse und Automatisierung in abgeschotteten Netzwerken sein.\u003c/p\u003e\n\u003cp\u003eDie Angaben von 24GB oder 32GB garantieren dagegen nicht, dass alle Modellfunktionen und der maximale Kontext auf jedem Gerät reibungslos funktionieren. Bis eine offizielle Modellkarte und reproduzierbare Benchmarks vorliegen, sollten die Angaben zu Geschwindigkeit und Qualität als eigene Messbehauptungen von Meta eingeordnet und Speicherbedarf, Sicherheit und Genauigkeit anhand realer Workloads bewertet werden.\u003c/p\u003e\n","tags":["KI-Agent","Meta","Muse Glimmer","Lokale KI","Quantisierung"],"faqs":[{"question":"Worin unterscheidet sich Muse Glimmer von üblichen lokalen LLMs?","answer":"Der Unterschied besteht darin, dass es in erster Linie als langfristig laufender AI-Agent konzipiert ist, der Dateien und Bildschirminhalte analysiert, Werkzeuge wie Funktionen oder ein Terminal aufruft, die Ergebnisse überprüft und daraufhin seinen Plan anpasst, statt lediglich wie ein Chatbot Textantworten zu erzeugen."},{"question":"Lässt sich ein Modell mit 30 Milliarden Parametern wirklich mit 24GB Arbeitsspeicher ausführen?","answer":"In den bereitgestellten Unterlagen wird erklärt, dass die 4-Bit-Version K-Quant-17GB für eine Umgebung mit etwa 24GB ausgelegt wurde. Der erforderliche Arbeitsspeicher hängt jedoch von der Kontextlänge, den visuellen Eingaben, dem KV-Cache, dem Drafter-Modell und der Speichernutzung des Betriebssystems ab. Daher dürfen 24GB nicht als garantierte Mindestanforderung für alle Nutzungsbedingungen verstanden werden."},{"question":"Warum unterscheiden sich die Modellgröße von 17GB und der benötigte Arbeitsspeicher von 24GB?","answer":"17GB bezeichnet hauptsächlich das Paket mit den quantisierten Gewichten. Für die tatsächliche Ausführung wird zusätzlich Arbeitsspeicher für den KV-Cache, Zwischenaktivierungen, den Vision-Encoder, den Arbeitsbereich der Laufzeitumgebung und das Betriebssystem benötigt."},{"question":"Kann der Kontext von 131,072 Token immer genutzt werden?","answer":"Selbst wenn das Modell diese Länge unterstützt, kann das tatsächliche Maximum je nach Laufzeitumgebung, Arbeitsspeicher, Präzision des KV-Caches und Umfang der Bildeingaben begrenzt sein. Außerdem muss gesondert geprüft werden, ob die Genauigkeit beim Informationsabruf auch bei maximaler Länge erhalten bleibt."},{"question":"Verringert der DFlash-Drafter die Antwortqualität des Modells?","answer":"Speculative Decoding ist so konzipiert, dass das Hauptmodell die vom Drafter vorgeschlagenen Token überprüft. Bei korrekter Implementierung kann daher die Ausgabeverteilung des Hauptmodells beibehalten werden. Je nach Implementierungsweise und Sampling-Einstellungen können sich jedoch sowohl die Ergebnisse als auch der Grad der Beschleunigung unterscheiden."},{"question":"Werden Daten bei lokaler Ausführung garantiert niemals nach außen übertragen?","answer":"Nein. Auch wenn das Modell lokal läuft, können Websuche, Plug-ins, Remote-Repositorys, Telemetrie oder cloudbasierte Embedding-Werkzeuge Daten übertragen. Die Netzwerkkommunikation der gesamten Agentenkonfiguration muss überprüft werden."},{"question":"Welche Berechtigungen können einem lokalen AI-Agent sicher erteilt werden?","answer":"Es empfiehlt sich, nur für die benötigten Arbeitsordner minimale Berechtigungen zu erteilen und den Agenten anfangs schreibgeschützt auszuführen. Für risikoreiche Aufgaben wie das Löschen von Dateien, die externe Übertragung, die Installation von Software oder die Bereitstellung sollte eine menschliche Genehmigung erforderlich sein."},{"question":"Kann Apache 2.0 kommerziell frei genutzt werden?","answer":"Apache 2.0 selbst ist eine freizügige Lizenz, die kommerzielle Nutzung, Änderungen und Weiterverbreitung erlaubt. Es muss jedoch in der LICENSE-Datei und der Modellkarte des offiziellen Repositorys geprüft werden, ob diese Lizenz tatsächlich für die Modelldateien gilt und ob zusätzliche Bedingungen oder Komponenten von Drittanbietern vorhanden sind."},{"question":"Ist Muse Glimmer ein vollständig quelloffenes Modell?","answer":"Den bereitgestellten Unterlagen zufolge wurden die Gewichte veröffentlicht, jedoch nicht die vollständigen Trainingsdaten und der vollständige Trainingscode. Es kann daher als Modell mit öffentlich zugänglichen Gewichten bezeichnet werden, doch davon ist die Frage zu unterscheiden, ob es sich um ein vollständig quelloffenes Modell handelt, dessen gesamter Trainingsprozess reproduziert werden kann."},{"question":"Kann man den von Meta angegebenen Geschwindigkeits- und Benchmarkwerten uneingeschränkt vertrauen?","answer":"Eigene Messwerte sind als erste Referenz nützlich, ersetzen jedoch keine unabhängige Überprüfung. Es werden reproduzierte Ergebnisse benötigt, die mit derselben Quantisierung, Laufzeitumgebung, Kontextlänge, Leistungseinstellung und denselben Agentenwerkzeugen erzielt wurden."}],"sources":[{"url":"https://www.apache.org/licenses/LICENSE-2.0","title":"Apache-Lizenz, Version 2.0","type":"source"},{"url":"https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf","title":"NIST AI 600-1: Risikomanagementrahmen für künstliche Intelligenz – Profil für generative künstliche Intelligenz","type":"source"}],"images":[{"id":602,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NzE2MywicHVyIjoiYmxvYl9pZCJ9fQ==--655d2556aee6b63b88d70cffbc019429039bcd2b/ai-7afa8941.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"데이터 블록을 받아 문서·이미지·코드로 처리하는 로컬 AI 노트북 개념도","caption":"노트북에서 로컬 AI가 다양한 데이터를 처리하고 보안 워크플로를 수행하는 모습을 나타낸다.","description":null},"en":{"alt":"Local AI laptop processing data blocks into documents, images, folders, code, and charts","caption":"The diagram depicts a laptop running local AI for multimodal processing and secure workflows.","description":null},"ja":{"alt":"データブロックを文書・画像・コードなどに処理するローカルAI搭載ノートPCの概念図","caption":"ノートPC上のローカルAIが多様なデータを処理し、安全なワークフローを実行する様子を示す。","description":null},"es":{"alt":"Portátil con IA local que procesa bloques de datos en documentos, imágenes, código y gráficos","caption":"El diagrama muestra una IA local en un portátil gestionando datos multimodales y flujos seguros.","description":null},"id":{"alt":"Laptop AI lokal memproses blok data menjadi dokumen, gambar, folder, kode, dan grafik","caption":"Diagram ini menggambarkan AI lokal di laptop yang menangani data multimodal dan alur kerja aman.","description":null},"pt":{"alt":"Notebook com IA local processando blocos de dados em documentos, imagens, códigos e gráficos","caption":"O diagrama mostra uma IA local no notebook gerenciando dados multimodais e fluxos seguros.","description":null},"zh-hant":{"alt":"本機 AI 筆電將資料區塊處理成文件、圖像、資料夾、程式碼與圖表","caption":"示意圖呈現筆電上的本機 AI 處理多模態資料並執行安全工作流程。","description":null},"de":{"alt":"Laptop mit lokaler KI verarbeitet Datenblöcke zu Dokumenten, Bildern, Code und Diagrammen","caption":"Die Grafik zeigt lokale KI auf einem Laptop bei der multimodalen Verarbeitung und sicheren Abläufen.","description":null}}},{"id":603,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NzE2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--febd3177afd7cf52d6fa7bb0e86da563e46d0ffb/ai-34107f0a.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 칩이 표시된 노트북과 보안 방패, 파일, 경고, 성능 계기판을 배치한 일러스트","caption":"노트북에서 실행되는 로컬 AI의 보안, 파일 처리, 최적화 및 성능 측정을 시각화했다.","description":null},"en":{"alt":"Laptop with an AI chip, security shield, files, warnings, and performance gauges","caption":"The illustration visualizes security, file processing, optimization, and performance for local AI on a laptop.","description":null},"ja":{"alt":"AIチップを表示したノートPCと、セキュリティ盾、ファイル、警告、性能メーターの図","caption":"ノートPCで動作するローカルAIの安全性、ファイル処理、最適化、性能測定を表している。","description":null},"es":{"alt":"Portátil con chip de IA, escudo de seguridad, archivos, alertas y medidores de rendimiento","caption":"La ilustración representa la seguridad, el procesamiento, la optimización y el rendimiento de una IA local.","description":null},"id":{"alt":"Laptop dengan cip AI, perisai keamanan, berkas, peringatan, dan pengukur kinerja","caption":"Ilustrasi ini menggambarkan keamanan, pemrosesan berkas, optimasi, dan kinerja AI lokal di laptop.","description":null},"pt":{"alt":"Notebook com chip de IA, escudo de segurança, arquivos, alertas e medidores de desempenho","caption":"A ilustração mostra segurança, processamento de arquivos, otimização e desempenho de IA local no notebook.","description":null},"zh-hant":{"alt":"顯示 AI 晶片的筆電，周圍有安全盾牌、檔案、警告與效能儀表","caption":"插圖呈現筆電本機 AI 的安全性、檔案處理、最佳化與效能測量。","description":null},"de":{"alt":"Laptop mit KI-Chip, Sicherheitsschild, Dateien, Warnsymbolen und Leistungsanzeigen","caption":"Die Illustration zeigt Sicherheit, Dateiverarbeitung, Optimierung und Leistung lokaler KI auf einem Laptop.","description":null}}}],"published_at":"2026-08-12T14:00:06+09:00","updated_at":"2026-08-12T14:00:06+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/meta-muse-glimmer-local-ai-agent-model"}