Modellbevezetés

Mesterséges intelligenciával generált szöveg

Alibaba bemutatta a Qwen3.8-Flash-Next előzetes modelljét hosszú kontextusú alkalmazásokhoz

Az Alibaba kiadta a Qwen3.8-Flash-Next modell súlyait fejlesztők számára, amely a közelgő Qwen4 architektúra előzetesének tekinthető.

Alibaba bemutatta a Qwen3.8-Flash-Next előzetes modelljét hosszú kontextusú alkalmazásokhoz

Alibaba kiadta a Qwen3.8-Flash-Next modell súlyait fejlesztői előzetesként, amely a várható Qwen4 architektúra egyik előfutára. A modell multimodális, mixture-of-experts (MoE) megközelítést használ: a fő modell 125 milliárd paraméterből áll, kiegészítve további 51 milliárd paraméternyi N-gram beágyazással. Tokenenként legfeljebb 6 milliárd paraméter aktiválódhat. A modell natív kontextusablaka 262 144 token, és YaRN használatával 1 millió tokenig kiterjeszthető.

Architektúra és skálázás hosszú kontextusokhoz

A Qwen3.8-Flash-Nextet olyan nagy mennyiségű, kontextusintenzív alkalmazásokhoz tervezték, mint az agentikus kódolás, dokumentumfeldolgozás és eszközvezérelt munkafolyamatok. A hosszú kontextusoknál az attention számítás és a KV cache memóriája lesz a szűk keresztmetszet. Ezt a problémát a modell hibrid architektúrával kezeli, amely két új elemet kombinál:

  • Gated DeltaNet (GDN): a rétegek háromnegyedében alkalmazzák, és folyamatosan tömöríti a korábbi kontextust egy fix méretű rekurzív állapotba, ezáltal megakadályozva a KV cache növekedését a szekvencia hosszával.
  • Qwen Sparse Attention (QSA): a maradék réteg a teljes kontextusból finomabb visszakeresést végez.

Korábbi sparse-attention megközelítések token-szintű indexelésre támaszkodtak, ami a kontextus növekedésével komputációs költségesé vált. A QSA helyette mikroblokkokra aggregálja a szekvenciát, blokk-szinten becsüli az adott blokkok fontosságát, és csak a releváns régiókat választja ki. Ez rétegenként csökkenti az attention, számítási és indexelési overheadet, így jól illeszkedik a GDN és QSA rétegek váltakozására épülő architektúrához.

Alibaba közzétett benchmarkjai szerint a QSA különösen hatékonynak bizonyulhat 1 millió tokenes munkameneteknél. A teljes attentionhöz képest az attention kernel előtöltés (prefill) körben legfeljebb 7,6× gyorsulást, dekódolás közben pedig 4,9× gyorsulást mutatott. Egy cache-igényes online kiszolgálási tesztben, 1 millió tokenes kontextushosszal és 90%-os prefix-cache találati aránnyal, a Qwen3.8-Flash-Next a Qwen3.7-Plus-hoz képest 8,6× prefill throughputot ért el.

NVIDIA támogatás és futtatás GB300 NVL72-n

NVIDIA napi-0 (Day 0) funkcionalitásra törekvő támogatást nyújtott több eszközzel: SGLang, vLLM és NVIDIA TensorRT LLM, valamint validációt végzett a NVIDIA GB300 NVL72 platformon az inferencia futtatásához. NVIDIA NeMo AutoModel és NVIDIA NeMo RL poszt-tréning receptjei is elérhetők a finomhangolási és megerősítéses tanulási munkafolyamatokhoz.

A GB300 NVL72 egy rack-skálájú rendszer, amely 72 darab NVIDIA Blackwell Ultra GPU-t integrál egyetlen platformon. A 72-GPU NVIDIA NVLink domain hatékony all-to-all kommunikációt tesz lehetővé 130 TB/s sávszélességgel, így minimalizálja azokat a torlódásokat, amelyek akkor jelentkeznek, amikor az expert forgalom hagyományos hálózatokon keresztül haladna. A GB300 NVL72-n futtatva a Qwen3.8-Flash-Next több mint 16 ezer token/s-t produkál GPU-nként a csúcsteljesítmény mellett, és több mint 200 token/s-t felhasználónként, ami lehetővé teszi a fejlesztők számára, hogy agentikus kódolási alkalmazásokat nagy áteresztőképességgel és alacsony késleltetéssel kísérletezzenek.

Lokális fejlesztés és skálázás

A Qwen3.8-Flash-Next nem csak rack-skálán futtatható: helyi NVIDIA eszközökön is működik, többek között NVIDIA DGX Stationön, NVIDIA DGX Spark klasztereken és munkaállomásokon, amelyek négy darab NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPU-val rendelkeznek. Ez lehetővé teszi, hogy a fejlesztők helyben prototípust készítsenek és kiértékeljék az agentikus kódolási munkafolyamatokat, majd ugyanazt a modellt skálázzák GB300 NVL72-re éles szolgáltatáshoz.

Finomhangolás, inferencia és elérhetőség

Fejlesztők a NVIDIA NeMo AutoModel segítségével finomhangolhatják a modellt domain-specifikus feladatokra; ez egy PyTorch-native finomhangoló könyvtár, amely Day-0 Hugging Face checkpoint támogatást kínál, lehetővé téve edzést a meglévő checkpointokról modellkonverzió nélkül, teljes SFT-től egészen memóriahatékony LoRA finomhangolásig. További lépésként NVIDIA NeMo RL receptek használhatók megerősítéses tanulási finomhangoláshoz.

Több inferencia stack is támogatott: SGLang, vLLM és TokenSpeed nyílt forráskódú inferencia recepteket kínálnak azoknak a fejlesztőknek, akik részletesebb teljesítményszabályozást igényelnek NVIDIA-gyorsított platformon.

Hol kezdjenek a fejlesztők

A Qwen3.8-Flash-Next modell kipróbálható QwenCloudon. A modell súlyai letölthetők Hugging Face-ről vagy ModelScope-ról, hogy fejlesztők helyileg vagy saját infrastruktúrán tesztelhessék és finomhangolhassák a modellt.