NVIDIA és a Nemotron csapata NVFP4 formátumban készített checkpointot a Nemotron 3 Ultra modellhez (550B) az NVIDIA Model Optimizer eszköz segítségével. A kvantizálás eredményeként a modell BF16 verzióról 1,121 GB-ról 352.3 GB-ra zsugorodott (3.2× csökkenés), és decode-heavy munkaterheléseken a throughput akár 5.9×-kel is magasabb lehet, összehasonlítva a GLM-5.1 754B FP4 modellel, miközben a BF16 pontosságot közel azonosan tartja több benchmarkon.
Mi az NVFP4 és miért fontos
Az NVFP4 egy 4-bites lebegőpontos kvantizációs formátum, amelyet az NVIDIA Blackwell architektúrához vezettek be. A hosszabb kontextusablakok és nagy modellek esetén a súlyok hatékony mozgatása kulcsfontosságú a teljesítmény szempontjából; a kvantizálás csökkenti a memória- és sávszéligényeket, ezáltal növeli az inferencia-throughputot és csökkenti a hardverlábat.
A Nemotron 3 Ultra NVFP4 checkpoint felépítése
Egy fontos tévhit, hogy az NVFP4-checkpoint minden rétege NVFP4-ben tárolódik. A gyakorlatban a különböző rétegeket a sensibilitiesüknek megfelelően különböző formátumokra kvantizálják. Példák a Nemotron 3 Ultra esetéből (eredeti BF16 állapotról):
- Embedding, Output classification layer, MTP rétegek: BF16 marad
- MoE routed experts: BF16 → NVFP4
- MoE shared experts: BF16 → FP8 per-tensor
- Mamba mixer linears: BF16 → FP8 per-tensor
- Attention linears, Latent MoE, Mamba conv1d: BF16 marad
- KV cache: BF16 → FP8
- Mamba SSM cache: FP32 → FP16 with stochastic rounding
Ez a keverék csökkentette a teljes modellméretet 1,121 GB-ról 352.3 GB-ra, ami ~3.2× méretcsökkenés és jelentős hardver-lábcsökkentést eredményez.
Több hardver egy checkpoint-tal
A Nemotron 3 Ultra NVFP4 checkpointja egyetlen fájlban képes futni NVIDIA Hopper és Blackwell architektúrákon is: a súlyformátum futásidőben illeszkedik a target hardverhez. Hopperen, amely nem rendelkezik natív FP4 tensor core-ral, a szolgáltató keretrendszer W4A16 módra vált; Blackwellön natív W4A4-et használ. A W4A16 (4-bit weight, 16-bit activation) a Hopperen található MTP-nek is elegendő helyet hagyott, míg W8A8 túl nagy lábnyomot eredményezne, ezért a W4A16 meglehetősen jó kompromisszumnak bizonyult.
A kvantizálás kihívásai és módszerei
FP4 kvantizálásnál egy súlyblokk pozitív értékeinek reprezentálhatósága 8 pontból áll: 0, 0.5, 1, 1.5, 2, 3, 4, 6. A skála (scale) megválasztása kritikus: ha rosszul választjuk, vagy a kis értékek vesznek el (zero-flush), vagy a nagyok lecsapódnak (clipping), ami rontja a pontosságot.
- Max scaling (absmax): a blokk legnagyobb abszolút értéke határozza meg a skálát. Egyszerű, de érzékeny az outlierekre, amelyek kiszűrik a többi értéket.
- MSE (mean squared error) scaling: a skálát úgy választja, hogy minimalizálja a blokk átalakításából adódó átlagos rekonstrukciós hibát. Model-optimizációs vizsgálatokban MSE csökkentette a per-tensor hibatömböt, de ez nem mindig fordult át következetes downstream pontosságnövekedésbe.
A korábbi Nemotron 3 Super munkánál a kombinált recept (MSE alapú blokk-skálázás a súlyoknál + per-tensor FP8 sweep + dinamikus max az aktivációknál) adta a legjobb kompromisszumot.
Four-over-six (négy-az-hat) skálázás
Az NVFP4 előre meghatározott gridje után 4 és 6 között nagy ugrás van; ennek hatására a 4–6 közé eső súlyok erősen lekerekítődnek, ami akár >13% hibát okozhat egyes értékeknél. A four-over-six megoldás lehetővé teszi, hogy minden blokk függetlenül válassza meg, M=4 vagy M=6 legyen-e a maximum, azaz melyik skála minimalizálja a rekonstrukciós hibát.
A Nemotron 3 Ultra routed-expert súlyainál four-over-six alkalmazása a globális per-tensor súlyskálát 1.75×-tel emelte, és a modell 48 MoE expert rétegében (49,152 projection weight) a medián rekonstrukciós MSE-t 16.4%-kal csökkentette a standard max kalibrációhoz képest. A downstream eredményekben a balanced 5.03 BPE beállításnál 98.5% medián recovery-t ért el BF16-hez viszonyítva (max: 96.8%, MSE: 98.4%).
Bits-per-element (BPE) és optimális pont
A BPE az effektív bitszám, amely átlagosan szükséges a modell súlyainak tárolásához. BF16 esetén ez 16, míg NVFP4 esetén a per-block és per-tensor skálázási overhead miatt a minimum körülbelül 4.5 BPE. Az optimális konfiguráció megtalálása rétegenként eltérő érzékenység miatt bonyolult: egyes rétegek magasabb preszíciót igényelnek.
Az NVIDIA Model Optimizer AutoQuantize (mtq.auto_quantize) megadott bit-büdzsé alapján (például auto_quantize_bits=4.8) és a jelölt formátumok listájával automatikusan megtalálja a rétegenkénti formátelosztást, hogy a megadott BPE alatt a legjobb pontosságot érje el.
A Nemotron 3 Ultra esetében öt üzempontra sweepelték a BPE-t 4.85–7.19 között; az AA-LCR benchmark alapján 5.03 BPE volt a „sweet spot”, ahol az AA-LCR javulása (62.25 → 64.69) volt a döntő jelző.
Hogyan történik a kvantizálás Model Optimizerral
A Nemotron 3 Ultra (550B) kvantizálásához párhuzamosított folyamatot alkalmaztak, mivel a nagy modell profitál a szétosztott kalibrációból. Két út támogatott: egy Hugging Face Transformers-alapú és egy Megatron-LM-alapú. A párhuzamos út esetén a checkpointot először Megatron-LM formátumba konvertálják, majd egy hívással (quantize.sh) quantizálnak, ahol Megatron-LM elosztja a modellt GPU-k között (például EP = DP = 16 on 16×B300), így a kalibrációs forward pass párhuzamosan fut.
Időadatok összehasonlítása (példa):
- Hugging Face Transformers út: teljes idő ~120 perc (betöltés 40 perc, kalibráció 85 perc, export 42 perc)
- Megatron-LM párhuzamos út: teljes idő ~45 perc (betöltés <2 perc, kalibráció 9 perc, export 33 perc)
A kalibráció a nemotron-post-training-dataset-v2 adathalmazon fut, és a preszócis szabályok konfiguráción keresztül vezérelhetők (beépített nevek vagy YAML recipe használatával).
Példa recept és konfiguráció
A nvfp4-4o6.yaml recept példát mutat arra, hogyan alkalmazzák a four-over-six súlyskálázást a routed-expert súlyokra NVFP4 W4A4-ben (16-os blokkméret, e4m3 skálák), míg a shared experts és Mamba projekciók FP8-at használnak, a KV cache szintén FP8. A teljes recept az NVIDIA Model Optimizer recipe könyvtárában elérhető.
Kényelmi eszközök és telepítés
- NVIDIA Model Optimizer 0.46: four-over-six támogatás érkezik a júliusi kiadásban.
- Model Optimizer launcher és egykattintásos workflow példák (Megatron-LM PTQ) segítik a skálázható futtatást, Slurm klaszteren több Blackwell GPU-val validálva.
- A pipeline reprodukálható bármely Hugging Face checkpointtal: betöltés, mtq.quantize() az általad választott konfigurációval, majd export_hf_checkpoint a kimeneti checkpointhoz.
Köszönetnyilvánítás
A munkát az NVIDIA Model Optimizer és a Nemotron csapat szorosan együttműködve végezte. Külön köszönet a Megatron-LM csapatnak a nagyszabású elosztott kvantizáció lehetővé tételéért, valamint Asma Kuriparambil Thekkumpate, Jenny Chen és Jinhang Choi vezető munkájáért az NVFP4 megvalósításában.
Hol található további információ
A teljes recept, dokumentációk és példák elérhetők az NVIDIA Model Optimizer GitHub tárházában, valamint a Nemotron 3 Ultra technikai jelentésében és NVFP4 checkpoint anyagokban.



