Modellbevezetés

Mesterséges intelligenciával generált szöveg

Alibaba nyilvánosságra hozta a Qwen3.8-2.4T-A95B nyílt súlyait, NVIDIA GB300 NVL72-n optimalizált multinode futtatással

A hír főszereplője az Alibaba által kiadott Qwen3.8-2.4T-A95B (Qwen3.8-Max) nyílt súlyú nyelvi modell és a NVIDIA GB300 NVL72 hardverplatform.

Alibaba nyilvánosságra hozta a Qwen3.8-2.4T-A95B nyílt súlyait, NVIDIA GB300 NVL72-n optimalizált multinode futtatással

Alibaba közzétette a Qwen3.8-2.4T-A95B (Qwen3.8-Max) modell nyílt súlyait, amely a cég szerint a legnagyobb, nyíltan hozzáférhető modelljük, és közel‑frontier képességeket tesz elérhetővé az open‑source ökoszisztémában. A modell teljesen 2,4 billió (2.4T) paraméterrel rendelkezik, amelyből tokenenként 95 milliárd (95B) aktiválódik.

Architektúra és célok

A Qwen3.8-2.4T-A95B finomra szabott Mixture‑of‑Experts (MoE) architektúra: vegyes megoldást alkalmaz teljes (full) és lineáris (linear) attention rétegekből, hogy a nagyon hosszú kontextusú, ügynök‑szerű (agentic) feladatokat kezelni tudja. A modell támogatja a legfeljebb egymillió (1,000,000) token hosszú kontextust és akár 128K kimeneti hosszúságot, így elsősorban összetett érvelési feladatokhoz, nagy dokumentumelemzéshez, kódgeneráláshoz és többlépéses munkafolyamatokhoz tervezték.

A hibrid attention‑séma váltogat a teljes attention rétegek (minden token minden más tokenre figyel) és a lineáris attention rétegek között; utóbbiaknál a növekvő KV cache helyett korlátozott, visszatérő (recurrent) állapotot használnak. Ez a megközelítés arra szolgál, hogy a számítási és memóriakorlátok kezelhetők maradjanak a nagyon hosszú kontextusoknál.

A finom‑granuláris MoE megoldás teszi lehetővé a 2,4T paraméter „kiszolgálását” gyakorlatias költségek mellett: sok kisebb expertet alkalmaznak a pár nagy helyett, a tanult router pedig tokenenként csak azokat az expertiseket (experteket) aktiválja, amelyek ténylegesen szükségesek. Ennek eredményeként a kiszolgálási költségek az aktív paraméterekhez igazodnak, nem a teljes 2,4T‑hez.

A modell beépített érvelési vezérlőket (low/high/xhigh) kínál, amellyel a fejlesztők kérésenként szabályozhatják az inferencia mélységét: magasabb beállításnál több számítás és mélyebb többlépéses érvelés, alacsonyabbnál nagyobb átviteli teljesítmény dokumentumfeldolgozásra.

Teljesítmény multinode környezetben: GB300 NVL72

A 2,4T paraméteres, nyílt súlyú modell üzemeltetése adatközpont‑skálájú gyorsított számítást igényel. NVIDIA a multinode telepítésekre optimalizált kernelcsomagokkal, inference runtime‑okkal és elosztott serving receptekkel dolgozik a nyílt forráskódú közösséggel.

NVIDIA GB300 NVL72 rendszeren — amelyet 72 darab NVIDIA Blackwell Ultra GPU egyetlen rack‑skálájú platformon összekapcsoló architektúra jellemez — a nagy NVLink tartomány (72 GPU, 130 TB/s all‑to‑all) csökkenti az off‑the‑shelf hálózatoknál jelentkező forgalmi szűk keresztmetszeteket, különösen az expert‑forgalom kezelésénél.

Day‑0 konfigurációban, további utólagos finomhangolás nélkül, a Qwen3.8-2.4T-A95B FP8 pontosságon több mint 4 000 token/s másodperc/GPU, illetve felhasználónként több mint 350 token/s teljesítményt ér el a GB300 NVL72‑n. NVIDIA jelezte, hogy további optimalizációk (például NVFP4 precizitás) várhatóan további teljesítményjavulást hoznak idővel.

Telepítési és finomhangolási lehetőségek

NVIDIA többféle inference stacket támogat, hogy különböző fejlesztői igényekhez igazodjon. Az SGLang, vLLM és NVIDIA Dynamo nyílt forráskódú receptjei nagyobb kontrollt adnak a teljesítmény felett NVIDIA‑gyorsított környezetben. Emellett elérhető egy „model‑free” NVIDIA NIM, egy univerzális inference konténer, amely bármely támogatott modellt kiszolgál.

A fejlesztők a Qwen3.8-2.4T-A95B modellt domain‑specifikus igényekre post‑trainelhetik az NVIDIA NeMo AutoModel könyvtárral, amely PyTorch‑natív fine‑tuning eszköz és Day‑0 Hugging Face checkpoint támogatást nyújt. A meglévő checkpointokkal közvetlenül lehet tréningezni teljes SFT‑t vagy memóriahatékony LoRA‑finomhangolást, modelkonverzió nélkül.

Hol érhető el a modell

A Qwen3.8-2.4T-A95B modellsúlyok letölthetők a Hugging Face‑ről vagy a ModelScope‑ról. A telepítéshez ajánlott út a model‑free NVIDIA NIM konténer az NVIDIA NGC‑ről, amely Day‑0‑tól használható finomhangolt checkpointok kiszolgálására és termelési skálázásra.

Összegzésként a Qwen3.8-2.4T-A95B a nyílt modellek közé hoz egy nagy paraméterű, MoE‑alapú, hosszú kontextusra optimalizált alternatívát; működtetése multinode, adatközponti erőforrásokat igényel, és NVIDIA szerint már Day‑0 multinode konfigurációban is jelentős throughputot kínál GB300 NVL72 rendszeren.