Nvidia közzétette a Nemotron 3 Ultra nevű nagy nyelvi modellt, amelyet hosszú kontextusú, agentikus feladatokra terveztek. A cég szerint ez az eddigi legnagyobb nyílt súlyú modelljük: a teljes paraméterszám 550 milliárd, egy időben aktív paraméterek száma pedig 55 milliárd tokenenként.
Mire képes és hogyan érhető el
- Bemenet/kimenet: a modell képes akár 1 millió token hosszúságú szöveg befogadására; kimeneti sebessége Nvidia és független mérések szerint nagyjából 183 token/másodperc.
- Elérhetőség: a súlyok, a tanító adatok és a kód szabadon elérhetők az OpenMDW-1.1 licenc alatt. Csevegés webes felületen Perplexity Pro előfizetéssel érhető, API-hozzáférés pedig az Nvidia és más szolgáltatók kínálatában lehetséges; a középárak bemeneti/kimeneti tokenre vonatkozóan körülbelül 0,60/2,60 USD per millió token.
Architektúra és képzés
A Nemotron 3 Ultra egy hibrid mamba–transformer (mamba-transformer) kevert szakértői (mixture-of-experts) architektúrán alapul, amely a kisebb Nemotron 3 Super terveit skálázza fel. A tervezés fő elemei:
- Mamba rétegek a hosszú szekvenciák hatékony feldolgozásához, kevesebb memóriával és számítási költséggel, valamint kisebb arányú attention rétegek a pontosabb visszaidézéshez.
- LatentMoE megvalósítás: minden tokenet tömörített reprezentációvá alakítanak, majd azt 10 szakértő egy részhalmazához irányítják. Több-tokenes predikciós rétegek egyszerre több token előállítására képesek.
- Képzés: az előtréning két fázisban zajlott, összesen 20 billió (20 trillion) tokennel — ebből 15 billió általános tudásra, további 5 billió pedig magasabb minőségű adatokra, köztük 173 milliárd GitHub-kód tokenre és szintetikus jogi és faktuális adathalmazokra. A modell betanításához a csapat a kvantált 4-bites NVFP4 formátumot használta a memória és a tokenfeldolgozás hatékonyságának növelésére.
- Finomhangolás: felügyelt finomhangolást követte megerősítéses tanulás több doménon és környezetben, továbbá több tanító modell alkalmazásával végzett többlépcsős distilláció (Multi-Teacher On-Policy Distillation). A distilláció során minden tanító specializált doménre értékelte és tokenenként jutalmazta a tanítvány kimeneteit; a folyamatot két iteratív körben futtatták, a tanítókat a fejlettebb tanulóból újraépítve.
Funkciók és jellemzők
- Három érvelési mód: off, regular és medium; érvelési költségkeret és eszközhasználat támogatás.
- Finomhangolva agent-harness-ekhez, például Hermes Agent és OpenClaw integrációra.
- Többnyelvű támogatás 12 nyelven.
Teljesítmény és független mérések
- Az Artificial Analysis független tesztjei szerint a Nemotron 3 Ultra a legmagasabb pontszámot érte el az Egyesült Államokból származó nyílt súlyú modellek között az Intelligence Indexen, ugyanakkor nem érte el a vezető nemzetközi modellek, például a Moonshot Kimi K2.6 teljesítményét.
- Intelligence Index: Nemotron 3 Ultra 47,7 pontot ért el NVFP4 csökkentett-precíziós súlyokkal, és 48,2 pontot teljes pontosság mellett. Összehasonlításként a Google Gemma 4 31B (reasoning beállítással) 39,2 pontot, az OpenAI gpt-oss-120b (high reasoning) 33,3 pontot ért el. Moonshot Kimi K2.6 ebben a mérésben 53,9 ponttal vezetett.
- IFBench (utasításkövetés): Nemotron 3 Ultra 81,4%-ot ért el, ami a harmadik helyre volt elég Grok 4.3 (83,3%) és Grok 4.20 0309 / MiniMax-M3 (mindkettő 82,9%) mögött.
- Hosszú kontextusú visszaidézés (Nvidia Ruler, 1 millió token): 95% teljesítmény. Agent productivity (PinchBench): 91%, ezzel megegyezett a Kimi K2.6-tal. Agentic kódolás (Terminal-Bench 2.0): 54%, ez elmaradt a Moonshot Kimi K2.6 (67%) és a Z.ai GLM 5.1 (64%) eredményétől.
- Sebesség: független mérések szerint több szolgáltatón futtatva a Nemotron 3 Ultra átlagosan mintegy háromszor gyorsabb volt (körülbelül 183 token/s) hasonló nyílt súlyú modelleknél, például a Moonshot Kimi K2.6-nál és a DeepSeek V4 Pro-nál.
Miért fontos ez?
Az elmúlt időszakban a legképessebb nyílt súlyú agent-alkalmazásokra alkalmas modelleket többnyire kínai fejlesztők adták (például Kimi K2.6, Qwen3.5, DeepSeek V4, GLM-5.2). A Nemotron 3 Ultra egy erős, gyors és részletesen dokumentált U.S. fejlesztésű alapot ad a fejlesztőknek, akik agentikus terhelésekre szeretnének modellalapú megoldásokat építeni.
Kontextus: kapcsolódó Nvidia fejlesztések
A Nemotron 3 Ultra megjelenése előtt az Nvidia több, agentikus teljesítményt célzó terméket is piacra vitt: a Vera CPU-t (agentikus feladatokra tervezett processzor), az RTX Sparkot (Windows PC chip on-device agentekhez) és a Cosmos 3 nyílt világmodellt, amelyet robotok, önvezető járművek és más a világban cselekvő ügynökök tanítása céljából hoztak létre.
Összegzés
A Nemotron 3 Ultra az Nvidia legnagyobb és legtöbbet dokumentált nyílt súlyú modellje, amely a hosszú kontextusú és agentikus feladatokra helyezi a hangsúlyt. Gyorsasága és a teljesen elérhető súlyok/adatok kombinációja új lehetőségeket ad a fejlesztőknek, miközben a csúcsmodell-teljesítmény terén még nem minden esetben veri a nemzetközi versenytársakat.



