Kutatás

DFlash block-diffúziós spekulatív dekódolással akár 15× gyorsabb LLM-inferencia NVIDIA Blackwellen

A DFlash, egy nyílt forráskódú könnyített block-diffúziós modell, jelentősen javítja a nagy nyelvi modellek (LLM) inferenciahatékonyságát NVIDIA Blackwell GPU-kon.

DFlash block-diffúziós spekulatív dekódolással akár 15× gyorsabb LLM-inferencia NVIDIA Blackwellen

A DFlash egy nyílt forráskódú, könnyű block-diffusion (blokk-diffúziós) modell, amelyet spekulatív dekódoláshoz fejlesztettek ki, és amely a soros token-generálást blokkokban előállított jelöltekkel helyettesíti. A megközelítés lényege, hogy egy kis, gyors drafter (vázlatmodul) egyetlen előrehaladással előállít egy egész blokknyi jövőbeli token-jelöltet; a nagyobb, célmodell ezeket párhuzamosan ellenőrzi, és elfogadja a leghosszabb érvényes prefixet. Így a token-generálás sorossága részben párhuzamos munkává alakul át a GPU-kon.

Teljesítménynövekedés NVIDIA Blackwell rendszeren

A DFlash a cikk forrása szerint gpt-oss-120b számára NVIDIA Blackwell rendszeren (egy nyolc GPU-s NVIDIA DGX B300 konfiguráción) a TensorRT-LLM környezetben akár 15× nagyobb áteresztőképességet ér el ugyanazon interaktivitási szinten, mint az autoregresszív dekódolás. A magas interaktivitási tartományban (500–600 token/s felhasználónként) a DFlash több mint 15×-ös throughput-növekedést mutatott Blackwellen, és ez 1,5×-szel jobb eredmény az EAGLE-3 spekulatív dekódoláshoz képest. A legalacsonyabb konkurenciánál (batch méret 1) a DFlash több mint kétszeresére növelte az interaktivitást Blackwellen.

A DFlash különösen előnyös a decode-korlátozott régiókban, ahol az LLM-inferencia gyakran a memória mozgásán és a token-generálás sorosságán akad meg, nem pedig a nyers számítási teljesítményen. A blokk-diffúziós drafter és a párhuzamos verifikáció részben ezt a munkát a párhuzamos sávra tolja, így jobban kihasználható Blackwell nagy sűrűségű NVFP4 számítási kapacitása (a cikk szerint Blackwell Ultra GPU-nként 15 PFLOPS dense NVFP4).

A Blackwell Ultra GPU-k felépítése: egy GPU két reticle-méretű die-ból áll, amelyeket 10 TB/s nagy sávszélességű chip-to-chip összeköttetés köt össze, 160 SM-mel és 640 ötödik generációs Tensor Core-ral — a DFlash párhuzamos munkaterhelést szolgáltat, amely jól illeszkedik ehhez az architektúrához.

Összehasonlítás EAGLE-3-mal és kisebb modellekkel

A DFlash nemcsak a nagy gpt-oss-120b modellekre mutat előnyt: a cikk bemutatja, hogy Llama 3.1 8B Instruct esetén DFlash közel kétszeres interaktivitásnövekedést ér el EAGLE-3-hoz képest a Speed-Bench multilingual adatbázison. A különböző Speed-Bench feladatok mentén mért sebességnövekedések táblázata szerint gpt-oss-120b esetén az EAGLE-3 átlagosan 1.7× gyorsulást, míg DFlash 2.3×-ot mutat; Llama 3.1 8B Instruct esetén az EAGLE-3 átlag 2.2×, DFlash 2.8×.

Példák (forrásadatok szerint, azonos felhasználói konkurencia mellett):

  • Kódolás: gpt-oss-120b — EAGLE-3: 1.8×, DFlash: 2.6×; Llama 3.1 8B — EAGLE-3: 2.3×, DFlash: 3.0×
  • Multilingual: gpt-oss-120b — EAGLE-3: 1.8×, DFlash: 2.6×; Llama 3.1 8B — EAGLE-3: 1.4×, DFlash: 2.4×

Gyorsan bevezethető a fejlesztői ökoszisztémában

A DFlash kutatócsoportja (UC San Diego) "DFlash: Block Diffusion for Flash Speculative Decoding" címmel február 2026-ban publikálta a cikket, és a megoldást PyTorch-ban, natív CUDA támogatással valósították meg. A publikáció óta a csapat 20 DFlash checkpointot tett közzé a Hugging Face-en, Blackwell és Hopper receptekkel, amelyek olyan modellcsaládokat fednek le, mint Qwen, Kimi K2.6, Llama, Gemma és gpt-oss. A receptek támogatják az SGLang és vLLM népszerű inferencia-keretrendszereket.

A DFlash integrációk egyszerűsítik a bevezetést: vLLM esetén az EAGLE-3-at DFlash checkpointtal ki lehet cserélni konfigurációs módosításon kívül más kódváltoztatás nélkül; az integráció a nyílt forrású Speculators könyvtáron keresztül kapcsolja össze a DFlash draftert a célmodell rejtett állapotaival. A cikk szerint Gemma 4 31B-n, egyetlen Blackwell Ultra GPU-n vLLM-en keresztül, ez az útvonal az autoregresszív dekódoláshoz képest akár 5.8×-os throughput-növekedést eredményezett különböző feladatokon (Math500, GSM8K, HumanEval, MBPP, MT-Bench).

SGLang esetén az áttérés EAGLE-ről DFlash-re egyszerűen az algoritmus és a hozzá illő DFlash checkpoint megadását igényli. Qwen3 8-B egyetlen Blackwell GPU-n SGLang használatával a forrást idéző eredmények szerint Math500-on akár 5.1×, HumanEval-en 4.2× speedup volt mérhető az autoregresszív dekódoláshoz képest.

Hogyan működik a DFlash spekulatív dekódolás?

A spekulatív dekódolás két fázisból áll: drafting (vázlatkészítés) és verification (ellenőrzés). A hagyományos megoldások autoregresszív draftert használnak, amely továbbra is tokenenként generál, így a vázlatkészítés költsége nő a spekulatív tokenek számával. DFlash ehelyett egy blokk-diffúziós draftert alkalmaz: a drafter egyetlen előrehaladással több jövőbeli, maszkolt tokent jósol meg párhuzamosan.

A DFlash három fő elemet kombinál:

  • Blokk-diffúziós drafting: több jövőbeli token párhuzamos megjóslása egy lépésben.
  • Target hidden-state conditioning: a drafter a célmodellből kinyert kontextusjellemzőket használja.
  • KV injection: a célmodell kontextusjellemzőit injektálják a draft modell kulcs-érték (key-value) projekcióiba a rétegek között, hogy magas elfogadási arányt tartsanak.

A célmodell továbbra is végzi a verifikációt, így a DFlash megőrzi a célmodell kimeneti eloszlását, miközben felgyorsítja a generálást.

Kiindulási pont fejlesztőknek

A DFlash már elérhető nyílt modell-checkpoinokként NVIDIA GPU-kon, és támogatott SGLangban, vLLM-ben és TensorRT-LLM-ben. A kutatás és a közösségi integrációk lehetővé teszik, hogy a fejlesztői csapatok a meglévő inferencia keretrendszerek használatával próbálják ki és vezessék be a DFlash-t anélkül, hogy jelentős alkalmazás-refaktorálásra lenne szükség.

Összefoglalva: a DFlash blokkszintű, spekulatív dekódolása párhuzamosabb munkát ad a GPU-knak, és NVIDIA Blackwell architektúrán jelentős throughput- és interaktivitásjavulást mutatott több modellen és benchmarkon, miközben a kutatásból gyorsan válik elérhető eszköz a fejlesztők számára.