Modellbevezetés

Mesterséges intelligenciával generált szöveg

Meta nyílt forrásúra vált: Muse Glimmer 30 milliárdos, Apache 2.0 modellel a helyi ügynökökért

A Meta bemutatta a Muse Glimmer nevű, 29,6 milliárd paraméteres, nyílt súlyú modellt, amelyet ügynökalapú feladatokra optimalizáltak és Apache 2.0 licenc alatt érhető el.

Meta nyílt forrásúra vált: Muse Glimmer 30 milliárdos, Apache 2.0 modellel a helyi ügynökökért

Meta ma kiadta a Muse Glimmer nevű modellt, egy körülbelül 29,6 milliárd paraméteres, sűrű (dense) multimodális transzformert, amelyet kifejezetten arra terveztek, hogy autonóm AI-ügynökök helyben, fogyasztói hardveren fussanak. A bejelentés egyik központi eleme a licenc: a Glimmer súlyai Apache 2.0 alatt kerültek közzétételre, ami Meta első teljesen nyílt kiadása a Llama-hoz képest történt váltást követően, és jogi szempontból szabadabb, mint a korábbi Llama-közösségi licenc.

Mit tartalmaz a kiadás és mikor érhető el

  • A modell súlyai ma elérhetők a Hugging Face-en. Meta közlése szerint a támogatás ezen a héten terjed ki több futtatókörnyezetre és integrációra: Ollama, LM Studio, vLLM, SGLang, Together AI, Fireworks AI és OpenRouter; optimalizált integrációk a llama.cpp, MLX és ExecuTorch felé a következő napokban érkeznek. Unsloth helyi runtime-partnerként szerepel, és a PyTorch TorchTitan is említve van finomhangoláshoz.
  • Mark Zuckerberg, a Meta társalapító-vezérigazgatója X-en (korábban @finkd) jelentette be a súlyok megnyitását, és jelezte, hogy hamarosan a Muse Spark 1.2 súlyai is kiadásra kerülnek.

Műszaki jellemzők

  • Paraméterek: kb. 29,6 milliárd összes paraméter 52 rétegen keresztül, amelyben egy körülbelül 1,8 milliárd paraméteres ViT-G/14 percepciós kódoló is szerepel.
  • Input: kevert szöveg- és képinformációt fogad, kimenete szöveg. Több mint 100 nyelvet támogat.
  • Kontextushossz: 131 072 token vagy annál több.
  • Tudásvágás (knowledge cutoff): 2026. január 4.

A modellt kifejezetten az ügynök-loopra (tervezés, eszközhívások, eredmények értelmezése, folytatás, hibakezelés) képezték ki, nem elsősorban általános csevegőbotként. Alexandr Wang, a Meta fő AI-igazgatója X-en hangsúlyozta, hogy a Glimmer „teljes értékű ügynökként” képes működni tervezéssel, eszközhívásokkal, saját eredmények ellenőrzésével és hibajavítással, és hogy 24 GB VRAM mellett is megőrzi az ügynöki megbízhatóságot.

Képzés és finomhangolás

A Muse Glimmer Meta szerint Muse Spark kimeneteinek logit-distillációjával előtréningezett, közbenső (mid-)tréningje hosszabb kontextusú, ügynökcentrikus adatokon zajlott, részletesebb érvelési nyomvonalakkal. Ezt szupervíziós finomhangolás, on-policy distilláció és megerősítéses tanulás követte különböző tartományokban (általános, érvelés, kódolás, ügynöki feladatok).

Hardver és kvantizáció: helyi futtatás 24–32 GB környezetben

  • Teljes precízióban a modell több mint 55 GB memóriát igényelne, ami meghaladja egyetlen fogyasztói GPU kapacitását. Ennek megfelelően Meta 4-bites kvantált változatokat fejlesztett, amelyek a nyelvi súlyokat 20 GB alá zsugorítják, így marad hely az ügynök által szükséges további elemeknek (KV cache, percepciós kódoló, és egy kísérő, spekulatív dekódoló modell).
  • Két kiemelt kvantált konfiguráció: a K-Quant-17GB (24 GB cél) és a K-Quant-Dynamic (32 GB cél). Ezek lehetővé teszik a futtatást magasabb végpontú fogyasztói GPU-kon, például Nvidia RTX 3090 vagy RTX 4090 (mindkettő 24 GB VRAM), illetve az RTX 5090 (32 GB) esetén. Mac gépeken az Apple Silicon egységes memóriáját használva egy 32 GB vagy annál nagyobb MacBook Pro vagy Mac Studio képes lehet a teljes veremet tárolni; Meta saját tesztjeit M4 Max és M5 Max MacBook Pro gépeken futtatta.
  • A tipikus 8 GB vagy 16 GB-os laptopok továbbra sem elegendők; a teljes pontosságú BF16 kiadás (~64 GB) inkább adatközponti GPU-kat vagy csúcs Mac Studio konfigurációkat igényel.

Meta által mért pontosságromlás: a K-Quant-Dynamic (32 GB cél) átlagosan 0,2% pontosságvesztést mutat 15 benchmarkon, míg a K-Quant-17GB (24 GB cél) konfigurációnál ez körülbelül 1%. Ezek a Meta saját mérései, nem független értékelések.

Sebesség: DFlash spekulatív dekódolás

A késleltetés csökkentésére Meta a DFlash spekulatív dekódolást alkalmazza: egy kisebb „drafter” modell blokkban (pl. 16 token) javasol generációkat, amelyeket a fő modell párhuzamosan ellenőriz. Meta mérései szerint ez jelentősen gyorsítja a generálást:

  • Nvidia RTX 5090: 74,9 token/s → 233,4 token/s (3,1×)
  • Apple M5 Max: 26,6 token/s → 50,2 token/s (1,8×)
  • Apple M4 Max: 23,7 token/s → 37,8 token/s (1,5×)

A mérések batch méret 1 és greedy dekódolás mellett készültek; Apple rendszereken ExecuTorch-ot, az RTX 5090-en llama.cpp-t használtak.

Benchmarkok és versenytársak

Glimmer közvetlenül a piacon lévő más, hasonló méretű nyílt súlyú modellekkel versenyez, különösen Google Gemma 4 családjával és Alibaba Qwen3.6-27B-jével. Meta saját összehasonlító táblázata alapján Glimmer vezet több ügynöki vizsgálaton (például MCP Atlas 75,5; DeepSearch QA 74,6; τ³-Banking 23,5; WildClawBench 47,6; GAIA2 43,3). SWE-Bench Pro pontszáma 51,2 volt, a Gemma4-31B 36,9, Qwen3.6-27B pedig 50,2 a Meta táblázata szerint.

Ugyanakkor Glimmer nem veri le minden teszten a versenytársakat: Qwen jobb eredményeket ért el több benchmarkon (például OSWorld-Verified, TerminalBench 2.1, GDPval-AA és multimodális feladatok többsége). Összességében a számok inkább azt sugallják, hogy Glimmer elsősorban specializált, helyi ügynökfeladatokra optimalizált modell, nem egyértelmű univerzális teljesítményvezető.

Biztonság és kockázatok

A helyben futó ügynökök más jellegű biztonsági kockázatokat jelentenek, mint a hagyományos csevegőbotok. Meta saját biztonsági mérései szerint Glimmer nem minden területen erősebb a riválisoknál: például a CI Memories adatvédelmi benchmarkon Glimmer 26,4-es eredményt mutat, szemben Gemma 12,1-gyel és Qwen 53,4-gyel. A Siren AgentDojo promptinjekciós teszten Glimmer 28,4%-os sikerarányt jelez (Gemma 25,6%, Qwen 40,3%), miközben Glimmer rendelkezik a három közül a legmagasabb hasznossági pontszámmal (94,2).

Meta a Glimmert az Advanced AI Scaling Framework keretében értékelte, és megállapította, hogy a modell nem éri el a „Frontier AI” definícióját, mert általánosságban kevésbé képességes a Muse Sparknál. A Preparedness Team a kémiai/biológiai, kibertámadási és irányvesztési kategóriákban mérsékelt (Moderate) vagy ennél alacsonyabb kockázatúnak ítélte. A vállalat továbbra is guardrailokat, például emberi jóváhagyást javasol visszafordíthatatlan lépésekhez.

Licenc, elérhetőség és ökoszisztéma

  • Meta Apache 2.0 alatt adja ki a BF16 teljes-precizitású súlyokat, a két 4-bites kvantált változatot, a DFlash draftert és a percepciós kódolót. Az Apache 2.0 lehetővé teszi korlátozás nélküli kereskedelmi felhasználást, módosítást és újraelosztást.
  • A súlyok letölthetők; Meta nem adott meg saját hosztolt API-árazást a modellhez, így a költség a helyi hardver vagy harmadik fél hosztolása alapján alakul. Fontos megjegyezni, hogy a legtöbb nyílt modellkiadásnál a „nyíltság” a súlyokra vonatkozik — Meta nem tette közzé a teljes képzési adatot vagy a képzési kódot.

Miért számít ez?

A Glimmer azt a stratégiai javaslatot testesíti meg, hogy a fejlesztői munkaállomás és a csúcskategóriás fogyasztói hardver valós, éles üzemre alkalmas célpont lehet autonóm ügynökök számára. A 30B körüli méret, a kvantizált verem és a 24–32 GB célkitűzés közelebb hozza az olyan ügynöki munkaterheléseket, amelyeket eddig főként felhőalapú API-k hátterére terveztek. A következő próbatétel az lesz, hogy a benchmarkelőnyök hogyan teljesítenek valós, hosszú lefolyású vállalati munkafolyamatokban és eszközök mellett — ha sikeres, a helyben futó ügynökök alkalmazása elterjedtebbé válhat a fejlesztők asztalain.