Modellbevezetés

Mesterséges intelligenciával generált szöveg

Meta Muse Glimmer: helyi, ügynökalapú AI-munkafolyamatok futtatása NVIDIA hardveren

A főszereplő a Meta által kiadott Muse Glimmer nevű nyílt forráskódú, 30 milliárd paraméteres tömör (dense) nyelvi modell, amely több mint 120 000 token hosszú kontextust támogat.

Meta Muse Glimmer: helyi, ügynökalapú AI-munkafolyamatok futtatása NVIDIA hardveren

Meta bemutatta a Muse Glimmert, egy 30 milliárd paraméteres (30B) nyílt súlyú, dense (sűrű) architektúrájú nyelvi modellt, amely több mint 120 000 token hosszú kontextust támogat. A modell célja, hogy helyben, ügynökalapú (agentic) munkafolyamatokat szolgáljon ki — például hosszú ideig futó asszisztenseket, dokumentum-revíziót vagy többlépcsős eszközhívásokat egyetlen munkamenetben.

Miért más ez, mint a chat-optimalizált modellek?

Sok jelenlegi LLM elsősorban chatre van optimalizálva: gyors első token-generálásra és rövid, egylépéses interakciókra. Ezzel szemben az ügynökalapú feladatok tartós kontextust, kiszámítható késleltetést, megbízható utasításkövetést és folyamatos áteresztőképességet igényelnek — jellemzők, amelyekre a Muse Glimmeret tervezték. A modell dense architektúrája minden token feldolgozásakor az összes paramétert aktiválja, nincs routing, szakértő-választás vagy útvonalvariancia, ami stabilabb viselkedést és kevesebb hibamódot tesz lehetővé ügynökalapú munkák során.

Teljesítmény és kontextuskezelés

A közlemény szerint Muse Glimmer egyetlen GPU-n 20K tokens/sec teljesítményt képes elérni, amely lehetővé teszi az „always-on” ügynökök számára a helyi adatfeldolgozást és a komplex, többlépcsős munkamenetek végrehajtását. Ugyanakkor a cikk későbbi része megemlíti, hogy NVIDIA Blackwell Ultra eszközön Muse Glimmer "over 20 tokens/sec/GPU" sebességet ér el BF16/NVF4 pontosság mellett, és hangsúlyozza, hogy a 30B dense modell magas egyidejűséget bír el routing-költség nélkül, szemben a MoE (Mixture of Experts) megközelítéssel.

E két, a forrásban szereplő számadat eltéréseire a közlemény maga nem ad magyarázatot; mindkét értéket a gyártói leírásként közöljük.

Adatvédelem és helyi futtatás

A Muse Glimmer célja, hogy optimális kompromisszumot kínáljon: elég nagy a több lépéses, összetett következtetésekhez, de elég kicsi ahhoz, hogy egyetlen NVIDIA GPU VRAM-jában elférjen anélkül, hogy modell-shardingra, CPU-offloadra vagy külső végpontokra lenne szükség. A közlemény kiemeli, hogy az NVIDIA Tensor Core architektúra különösen jól gyorsítja ezt a számítási mintát, így valós idejű, teljes kontextusú, eszközön végzett inferencia válik lehetővé.

Példaként említik a következő NVIDIA termékeket és szerepüket:

  • NVIDIA GeForce RTX 5090: 32 GB VRAM és ötödik generációs Tensor Core-ok, cél a helyi fejlesztői eszközökön való futtatás és a tulajdonkód helyben tartása.
  • NVIDIA DGX Spark: munkafolyamatok és vállalati ügynökalapú csővezetékek számára, NVLink memóriamegosztással és NIM konténerekkel.
  • NVIDIA DGX Station: on-premise rack-szintű Blackwell Ultra számítás érzékeny, elszeparált (air-gap) vagy megfelelőségi környezetekhez.
  • NVIDIA Jetson: élhető helyi inferencia beágyazott rendszerekben, robotikában és ipari automatizálásban, ahol a hálózati izoláció kötelező.

Teljesítmény Blackwell Ultrán

A forrás szerint NVIDIA Blackwell Ultra architektúrán Muse Glimmer „over 20 tokens/sec/GPU” teljesítményt biztosít BF16/NVF4 precizitáson. Egyetlen Blackwell Ultra képes a teljes modellt VRAM-ban tartani, és elegendő helyet hagy a nagy KV cache pufferek számára, ami alacsony késleltetést és nagy áteresztőképességet tesz lehetővé, különösen mindig futó helyi ügynökök számára.

Finomhangolás és ügynökalapú alkalmazások fejlesztése

A fejlesztők a cikk szerint az NVIDIA eszközkészleteivel építhetnek és finomhangolhatnak ügynökalapú alkalmazásokat:

  • NVIDIA NeMoClaw: biztonságos OpenShell környezetben futtatott eszközhám (agent harness) hosszú ideig futó személyes asszisztensekhez, kódgeneráláshoz, autonóm támogatáshoz stb.
  • NVIDIA NeMo AutoModel: finomhangolási könyvtár Hugging Face checkpoint támogatással, SFT és LoRA finomhangolással, valamint magas áteresztőképességre optimalizált működéssel NVIDIA GPU-kon, beleértve a DGX Sparkot.
  • NeMo RL: referencia-megoldások megerősítéses tanuláshoz, minták és validációs görbék kísérő példáival.

A forrás bemutat egy példát is, ahol Muse Glimmer helyileg fut a NeMoClaw eszközkerettel egy szabályozott homokozóban, vLLM szerverrel DGX Sparkon.

Telepítési lehetőségek és elérhetőség

NVIDIA többféle inferencia-stacket támogat, hogy különböző igényeket kielégítsen: SGLang és vLLM nyílt forrású inferencia recepteket biztosítanak a mélyebb teljesítménykontrollhoz, valamint elérhető egy letölthető NVIDIA NIM (inference container), amely automatikusan konfigurálja a futtatási és kiszolgálási beállításokat.

A Muse Glimmer súlyok letölthetők a HuggingFace-ről, és a cikk szerint a fejlesztők ezeket az inferencia recepteket, a letölthető NIM-et, vagy a build.nvidia.com felületet használhatják a helyi NVIDIA GPU-gyorsított környezetekben történő telepítéshez és kísérletezéshez.

Összegzés

Muse Glimmer egy 30B dense modell, amelyet kifejezetten hosszú kontextusú, ügynökalapú feladatokra terveztek, és arra optimalizáltak, hogy helyben fusson NVIDIA hardveren különböző skálákon. A gyártói anyagok teljesítmény- és telepítési opciókat sorolnak fel, beleértve a GeForce RTX 5090-et, DGX Sparkot, DGX Stationt és Jetson eszközöket, valamint NeMo és vLLM alapú eszközkészleteket a finomhangoláshoz és ügynökalapok építéséhez. A közleményben szereplő teljesítményszámok (20K tokens/sec egyes részekben vs. „over 20 tokens/sec/GPU” Blackwell Ultrán) a forrás megfogalmazásában eltérnek; a cikk mindkét értéket közli.