Modellbevezetés

NVIDIA Nemotron 3 Ultra és ACE-RTL: jobb pontosság és kevesebb token az agentes RTL-fejlesztésben

A főszereplő az NVIDIA Nemotron 3 Ultra nyílt modell és az ACE-RTL agent, amelyek együtt kiemelkedő eredményt érnek el agentes register transfer level (RTL) feladatokban.

NVIDIA Nemotron 3 Ultra és ACE-RTL: jobb pontosság és kevesebb token az agentes RTL-fejlesztésben

Az integrált áramkörtervezés egyre inkább nem a szilicium, hanem a mérnöki idő korlátai miatt lassul: a register transfer level (RTL) fejlesztés és verifikáció speciális hardverismeretet, pontos gondolkodást és sokszor ismétlődő EDA‑eszközös interakciót igényel. A nagynyelvű modellek (LLM-ek) felgyorsították a kódkészítést, az AI‑agentek pedig tovább növelik a hatást azáltal, hogy a verifikációs visszajelzést felhasználva iteratívan javítják a hibákat — ez különösen fontos az RTL‑nél, ahol a helyesség nagyon pontos időbeni viselkedéstől függ, és sok hiba csak eszközös validáció során jelentkezik.

Ebben a cikkben bemutatjuk, hogyan működik együtt az ACE‑RTL agent és a Nemotron 3 Ultra a CVDP benchmarkon: az ACE‑RTL iteratív generate–test–reflect munkafolyamatot biztosít, míg a Nemotron 3 Ultra hosszú kontextusú következtetést és RTL‑specifikus képzésre hangolt viselkedést ad hozzá.

A CVDP benchmark

A Comprehensive Verilog Design Problems (CVDP) benchmark valósághű RTL generálási, módosítási, hibajavítási és verifikációs feladatokon méri az LLM‑eket. Nem rövid, önmagukban záró Verilog promptokra épül, hanem a gyakorlati hardvertervezési problémákra tükröződik visszajobban. A benchmark kategóriái között szerepelnek többek között:

  • cid002: RTL Code Completion
  • cid003: RTL Natural Language Spec to Code
  • cid004: RTL Code Modification
  • cid005: RTL Spec to RTL with Module Reuse
  • cid007: RTL Code Improvement (Linting/QoR)
  • cid012: Testbench Stimulus Generation
  • cid013: Testbench Checker Generation
  • cid014: Assertion Generation
  • cid016: Debugging / Bug Fixing

Miért igényel az RTL fejlesztés agentikus munkafolyamatot?

Az RTL‑kódírás nem egyszerűen „írj Verilogot egy promptból”. A gyakorlati asszisztensnek képesnek kell lennie elolvasni a specifikációt, megérteni meglévő modulokat, újrahasználni és módosítani kódot, értelmezni a szimulációs hibákat, diagnosztizálni eltéréseket és javasolni célzott javításokat. Mivel az mérnökök ritkán oldanak meg összetett RTL feladatokat egyetlen lépésben, az iterációs munka a fordítókkal, szimulátorokkal, lint‑eszközökkel, hullámforma‑ellenőrzéssel és verifikációs visszajelzéssel természetes igény.

Az ACE‑RTL agent felépítése

Az ACE‑RTL agent a generate → run checks → analyze feedback → refine ciklust valósítja meg. Három együttműködő komponensből áll:

  • Generator: előállítja vagy frissíti az RTL‑kódot.
  • Reflector: elemzi a szimulációs visszajelzést, azonosítja a gyökérokokat és magas szintű javítási iránymutatást ad.
  • Koordinátor: folyamatosan karbantart egy fejlődő hibakeresési kontextust, eldönti, hogy mely előzmények és visszajelzések vezessék a következő generálást.

Ez a szerkezet lehetővé teszi, hogy az agent a korábbi kudarcokra építsen ahelyett, hogy ismételten ugyanazokat a hibákat követné el.

Teljesítmény a CVDP debug kategóriájában (cid016)

Az ACE‑RTL agent használata lényegesen javítja a passz‑rátát az értékelt modellek esetén. Például a GLM 5.2 önállóan 44.0%‑ról 94.3%‑ra javul ACE‑RTL mellett, a Kimi K2.6 68.6%‑ról 97.1%‑re, míg a Nemotron 3 Ultra 65.7%‑ról 100.0%‑ra emelkedik. Ezek az eredmények hangsúlyozzák az iteratív eszközvisszajelzés és a kontextusfejlődés fontosságát a valós RTL feladatok megoldásában.

Amikor az ACE‑RTL agent fixed (azaz ugyanaz az agentikus folyamat), és csak az LLM változik, a Nemotron 3 Ultra átlagosan 97.1% passz‑rátát ér el kilenc CVDP kategória átlaga szerint. Összehasonlításképp Kimi K2.6 95.2%‑ot, GLM 5.2 pedig 92.1%‑ot ér el. Nemotron 3 Ultra több kategóriában is 100% passz‑rátát mutat.

Kevesebb token, magasabb hatékonyság

Fontos megjegyezni, hogy a Nemotron 3 Ultra ezen pontosságot jelentősen alacsonyabb token‑felhasználással éri el: iterációnként átlagosan 6,629 tokent használ, míg a GLM 5.2 9,156‑ot és a Kimi K2.6 22,579‑ot. Ez nagyjából 28%‑kal kevesebb tokent jelent a GLM 5.2‑hez képest és 71%‑kal a Kimi K2.6‑hoz viszonyítva, miközben a legjobb átlagos passz‑rátát tartja.

Az agentikus kódolásnál ez a kombináció — magasabb sikerarány mellett alacsonyabb tokenköltség — különösen értékes: több egyedi hardverprobléma oldható meg ugyanazon számítási költség mellett, és gyorsabb visszajelzést kaphatnak a mérnökök.

Miért alkalmas a Nemotron 3 Ultra hosszú agentikus gondolkodásra?

A Nemotron 3 Ultra egy 550 milliárd teljes paraméterű, 55 milliárd aktív paraméterű Mixture‑of‑Experts (MoE) Hybrid Mamba‑Attention modell, amelyet kifejezetten hosszú futamidejű agentekhez terveztek. A modellt 20 billió (20 trillion) szövegtokenre előtrénelték, és kiterjesztették 1 millió token hosszú kontextusra.

A hibrid Mamba‑Attention architektúra csökkenti a figyelemköltséget és a KV‑cache tárhelyigényét, míg az MoE dizájn javítja az aktív paramétereinek pontosságát. A publikált adatok szerint ez akár 5× magasabb throughputot és 30%‑kal alacsonyabb költséget eredményez más nyílt modellekhez képest. Az RTL munkafolyamatoknál az agentikus kontextus gyorsan nőhet (specifikáció, modulkód, generált RTL, szimulátor kimenete, assertion hibák, korábbi javítási próbálkozások), ezért az hatékony hosszú‑kontextusú inferencia gyakorlati szempontból döntő fontosságú.

RTL‑specifikus képzés: szintetikus adatok és adatcsővezeték

A Nemotron 3 Ultra RTL‑képességei az ACE‑RTL cikkben javasolt synthetic data generation (SDG) csővezetéken alapulnak. A cél magas minőségű, a mérnöki gyakorlatot tükröző RTL tréningadat előállítása: nem csak specifikációból kód generálása, hanem meglévő implementációk módosítása és hibajavítása.

A pipeline magas minőségű seed RTL‑tervekkel kezd a nyilvános tárházakból, majd nyílt LLM‑ek ezeket átalakítják instrukciós stílusú tréningmintákká. A minták formátumát és részletességét néhány in‑context példa határozza meg. Spec‑to‑RTL feladatoknál a LLM‑ek természetes nyelvű specifikációt szintetizálnak és párosítják azt arany (golden) RTL implementációval, amely a seedből származik.

A kulcs a feladatdiverzitás: a pipeline nem csak spec‑to‑RTL mintákat hoz létre, hanem kód‑szerkesztési és hibajavítási feladatokat is. Szerkesztésnél az eredeti seed szolgál arany implementációként, míg leegyszerűsített verzió a bemenet; a specifikáció leírja a szükséges funkcióbővítést vagy sarokesetet. Hibajavításnál valósághű RTL‑hibákat injektálnak (például FSM átmenetek, handshake vagy timing problémák), és a specifikáció diagnosztikai információt is tartalmaz, hogy a modell megtanulja a kód és a visszajelzés alapján javítani a hibákat.

Minden generált mintát adatfilteren engednek át: szintaxis‑ellenőrzés, benchmark‑dekontamináció és rubrikán alapuló pontozás egy LLM‑mintajátékos (LLM‑as‑judge) segítségével annak értékelésére, hogy a specifikáció és az RTL implementáció szemantikailag összhangban áll‑e. Ez a szűrési lépés biztosítja, hogy a végső szintetikus adathalmaz strukturálisan érvényes és hasznos legyen a tréninghez.

Ez a megközelítés kritikus az agentikus RTL munka során: a modellnek képesnek kell lennie az előző kód, hibás tesztek és eszközvisszajelzés feletti érvelésre, nem csupán tiszta specifikációból való generálásra. A kód‑szerkesztési és hibajavítási feladatokkal való tréning közelebb viszi a modellt a valós ügynöki problémákhoz.

Használat és integrációs lehetőségek

A Nemotron 3 Ultra nyílt modellként elérhető, és ma is használható azokban az mérnöki eszközökben, amelyekre a csapatok támaszkodnak. A cikk említése szerint a Nemotron 3 Ultra együttműködik partnerekkel az integrációkban, például:

  • Cadence: ahol a ChipStack AI SuperAgent találkozik a Nemotron 3 Ultra‑val a front‑end tervezés és verifikáció agentikus orkesztrációjában; emellett más SuperAgent portfóliókban is használható (InnoStack, ViraStack, AuraStack).
  • Siemens: a Nemotron 3 Ultra a Questa One Agentic Toolkit‑kel párosítva segíti a korábbi hibafelismerést és a gyorsabb, magasabb minőségű tervek elkészítését; integrálva van a Fuse EDA AI Agentbe, amely 5×–10× jobb tokenhatékonyságot ígér.
  • Synopsys AgentEngineer: multi‑agent rendszeren keresztül önálló verifikációs lezárást és folyamatos, nyomon követhető visszacsatolási hurkot támogat, csökkentve a manuális verifikációs erőfeszítést.

Következtetés

A Nemotron 3 Ultra és az ACE‑RTL agent kombinációja a CVDP benchmarkon jobb átlagos passz‑rátát és alacsonyabb tokenhasználatot mutat a vizsgált nyílt modellekhez képest. A modelldizájn (MoE hibrid Mamba‑Attention), a hosszú kontextus támogatás és az RTL‑specifikus szintetikus tréningadatok együtt teszik a Nemotron 3 Ultra‑t különösen alkalmassá az agentikus RTL fejlesztési munkafolyamatokra.

A fejlesztők és mérnökök számára a modell ma is elérhető integrációkra és eszközökbe illesztésre, amelyek a verifikációs és tervezési folyamatokat gyorsíthatják és hatékonyabbá tehetik.