A DeepSeek bemutatta a DSpark nevű spekulatív dekódolási modult, amely egy kis "vázlat" modell segítségével előre generál tokenblokkokat, amelyeket a nagy nyelvi modell egyetlen átellenőrzéssel validál. A cég a megközelítést a DeepSeek‑V4 családon alkalmazta, és közzétette a DeepSeek‑V4‑Pro‑DSpark és DeepSeek‑V4‑Flash‑DSpark checkpointokat, amelyek a vázlatmodult hozzáadják a változatlan DeepSeek‑V4‑Pro és DeepSeek‑V4‑Flash előzetes súlyaihoz. A modellfájlok szabadon letölthetők a Hugging Face-ről MIT licenc alatt.
A fő ötlet
A spekulatív dekódolás lényege, hogy egy kisméretű vázlatmodul egyszerre javasol egy blokknyi tokent, majd a nagy célmodell egyetlen átmenetben kiszámolja a saját következő-token választását az összes vázlatolt pozíción. A rendszer megtartja a leghosszabb olyan futamot a vázlatból, amely megegyezik a célmodell választásaival, így gyorsítva a generálást, miközben a validálás fenntartja a minőséget. A DSpark három tényezőt céloz meg: a tokenek dráftolásának költségét, hogy hány vázlatolt token marad meg, és hogy mennyi ellenőrzést végez a nagy modell. DSpark fő újítása, hogy dinamikusan szabályozza a harmadik tényezőt: könnyű terhelésnél több, nagy terhelésnél kevesebb ellenőrzést végez.
Megvalósítás röviden
A DSpark egy vázlatmodult csatol a nagy, "cél" modellhez, amely fagyasztva marad. DeepSeek csak három komponenst tanított meg a vázlathoz: egy dráftolási gerincet (backbone), egy kis szekvenciális részt és egy bizalomfejet (confidence head). A vázlat a célmodell beágyazási rétegét és kimeneti fejét kölcsönzi, így ezek nem módosulnak. Offline tanításhoz a csapat Open‑PerfectBlend promptokat adott a célmodellnek, és a vázlatot a célmodell válaszaira tanította, hogy a vázlat token‑eloszlása közelítsen a célmodellhez, valamint hogy a bizalomfej megtanulja megjósolni a tokenek elfogadásának esélyét.
A DSpark gerincét a DFlash nevű korábbi párhuzamos dráfterből vették át: ez egyszerre javasol tokeneket minden pozícióra egy blokkban. Egy ilyen párhuzamos átmenet költsége független a blokk hosszától, ezért a párhuzamos dráfter több réteget engedhet meg magának, erősebb korai becslésekkel. Ugyanakkor mivel minden pozíciót függetlenül jósol, előfordulhat, hogy különböző jobb folytatásokból vegyít össze kimeneteket, ami a blokk végén pontosságromláshoz vezet.
A problémát egy kis szekvenciális komponenssel oldották meg, amelyet Markov headnek neveznek: ez minden pozícióban csak az előzően dráftolt token alapján állítja át a valószínűségeket (például az "of" után növeli a "course" esélyét és csökkenti a "problem" esélyét). Ez a lépés tokenről tokenre fut ugyan, de annyira kompakt, hogy a dráfthossz növelése 4 tokenről 16 tokenre csak 0,2–1,3 százalékkal növeli egy kör késleltetését a DFlash gerinchez képest.
Minden dráftolt tokenhez a bizalomfej egy feltételes túlélési valószínűséget becsül (azt az esélyt, hogy az adott token elfogadásra kerül, feltéve, hogy az előtte lévő tokenek mind elfogadtak). Mivel ezek a becslések túl magabiztosak lehetnek, a szerzők kalibrációs lépést alkalmaztak, amely pozíciónként átméretezi az értékeket addig, amíg a láncok előrejelzett elfogadási arányai illeszkednek a megtartott adatokon megfigyeltekre.
A szolgáltatás során egy ütemező (scheduler) a tokenenkénti becsült bizalmakat összeszorozza, hogy minden lehetséges dráfthossz túlélési valószínűségét megkapja. Az ütemező ezután az adott pillanatban elérhető kapacitásprofil és a rendszer telítettsége alapján maximalizálja a várható teljes kimenetet: könnyű terhelésnél hosszabb dráftokent ellenőriz, hogy csökkentse a várakozási időt; nagy terhelésnél rövidebb ellenőrzést választ, hogy felszabadítson kapacitást más felhasználóknak.
Eredmények
DeepSeek offline és éles összehasonlításokat végzett korábbi dráfterekkel és saját újratanított változataival. Minden vizsgált esetben a DSpark jobb teljesítményt ért el.
- A DSpark növelte az átlagosan egy ellenőrzési körben elfogadott tokenek számát (a dráfteljesítmény mérőszáma). EAGLE‑3‑hoz viszonyítva a javulás Qwen3‑4B, Qwen3‑8B és Qwen3‑14B modelleken 30,9%, 26,7% és 30,0% volt. DFlash‑hoz képest az előny ugyanazon modelleken 16,3%, 18,4% és 18,3%.
- A javulás megjelent a Gemma4‑12B modellcsaládon is, ami arra utal, hogy az előny nem egyetlen modellvonal specifikuma.
- Éles üzemben a DSpark a DeepSeek‑V4‑Flash modell esetén felhasználónként 60–85%-kal gyorsabb token‑generálást adott, a DeepSeek‑V4‑Pro esetén pedig 57–78%-kal volt gyorsabb a DeepSeek korábbi, ciklusonként egy tokent javasló MTP‑1 drafteréhez képest.
- Összességében, bizonyos hardver- és garantált token/perc feltételek mellett a teljes generált tokenek másodpercenkénti száma platformszinten 51% és 52% növekedést ért el a két V4 variánson. Más, magasabb garantált sávszélességi beállítások mellett a növekedés 406%–661% között volt; a szerzők megjegyzik, hogy a korábbi drafter gyakorlatilag kudarcot vallott a nagyobb sebességi pontokon, tehát ezek a számok új, működő üzemeltetési pontokat jeleznek, nem csupán egyszeri gyorsulásokat.
Háttere és jelentősége
A spekulatív dekódolást először a Google Research csapat írta le 2022‑ben, és azóta széleskörűen alkalmazzák a produkciós modellek szolgáltatásában. Korábban megjelent dráfterek sorra szerezték meg a párhuzamos és szekvenciális megközelítések előnyeit: a DSpark célja, hogy megtartsa a párhuzamos dráftolók sebességét és a szekvenciális dráftolók koherenciáját. DeepSeek két héttel a DeepSeek‑V4 előnézeti indítása után lecserélte addigi egyszerű szekvenciális dráfterét DSparkra.
Ennek gyakorlati következménye, hogy kevesebb token előállítása is több felhasználói választ és alacsonyabb költséget jelent. A DSpark megközelítése nem módosítja a nagy modellek súlyait, viszont rövidebb válaszidőt és alacsonyabb működési költséget eredményezhet anélkül, hogy rontaná a kimenet minőségét.
Összegzés
A DeepSeek DSpark modulja technikailag a párhuzamos és szekvenciális dráftolás erényeit kombinálja, miközben dinamikusan alkalmazkodik a kiszolgálói terheléshez. A cég által közölt mérések szerint a módszer jelentős átviteli és per‑felhasználói gyorsulást hozott, a megoldás forráskódja és a DeepSeek‑V4‑hez készült DSpark checkpointok szabadon elérhetők MIT licenc alatt.



