Az atomisztikus szimuláció három összetevőt igényel: a mögöttes tudomány ismeretét, számításilag hatékony szimulációs implementációt és hozzáférhető felületeket a szimulációs stackhez. Az NVIDIA ALCHEMI Toolkit idén bevezetett, PyTorch-native, komponálható építőelemei jelentősen csökkentették a hatékonysági korlátot a gépi tanulás alapú interatomikus potenciálok (MLIP) használatánál. A harmadik korlát — az ekorendszerrel kompatibilis, könnyen használható interfészek hiánya — azonban továbbra is fennáll.
A megoldás: AI-kódoló ügynökök, amelyek természetes nyelvi leírásból generálnak és futtatnak kódot a kutató által használt szakmai terminológiában. Mivel azonban a általános célú ügynökök nem feltétlenül ismerik az ALCHEMI Toolkit API-patternjeit, az NVIDIA csapata „agent skills” és referenciafájlok gyűjteményét biztosítja, amelyek az API helyes használatát adják az ügynöknek, így a kutató szabadon a tudományos célokra koncentrálhat (anyag, körülmények, protokollkorlátok).
Módszer: végponttól végpontig workflow ügynökkel
A bemutatott vizsgálat egy végponttól végpontig ALCHEMI Toolkit workflow-ot követ: a kutató kezdeti kiindulópontját, az ügynöknek adott promptot, a generált kódot és a GPU-n való futtatás validálását NVIDIA H200 GPU-ken. Mindezt 45 automatikusan generált pipeline alapján tesztelték három különböző munkafolyamaton, öt prompt-szinten és három minta per szint.
Rendszer- és csomagkövetelmények
- Python ≥3.11, <3.14
- PyTorch ≥2.8
- CUDA 12 vagy CUDA 13, kompatibilis NVIDIA driver (570+ ajánlott)
- Operációs rendszer: Linux (elsődleges), macOS
- NVIDIA GPU (RTX 20xx vagy újabb), CUDA Compute Capability ≥7.0
- Minimum 4 GB RAM (nagy rendszerekhez 16 GB ajánlott)
Telepítés és környezet
Az ügynök futtatási környezetének kialakítása jelentősen befolyásolja a generált kód megbízhatóságát. Ajánlott a Toolkit telepítése futtatható Python környezetbe és engedélyezni, hogy az ügynök végrehajtsa a generált szkripteket. A 45-pipeline kampányban ez a beállítás elkerülte a törött importokat és a hiányzó API-hivatkozásokat.
Példa telepítési lépések (összefoglalva):
- Helyi Python környezet létrehozása és ALCHEMI Toolkit telepítése (például uv venv és uv pip install "nvalchemi-toolkit[mace,ase]==0.2.0", szükség esetén CUDA extra cu13).
- Ügynök-skill fájlok letöltése ugyanarról a release tagról (pl. .claude/skills#v0.2.0).
- Egy kódoló ügynök telepítése és indítása (a bemutatásban Claude Code-t használták).
Ha az ügynöknek engedélyezik a kód végrehajtását a projektkönyvtárban, az ügynök betölti a releváns skill-eket igény szerint, és a futtatás kiszűri a mechanikai hibákat, mielőtt a szkriptet felhasználóhoz juttatná.
Promptolási jó gyakorlatok (benchmark-alapú)
A benchmark öt prompt-szintet definiált (Sketch, Goal, Recipe, Spec, Contract). A fő megállapítások:
- Mindig nevezze meg a rendszer anyagát, módszerét és skáláját; ha a szkript futtatás nélküli, felügyelet nélküli használatra szánt, adjon CLI-szerződést is.
- Pontosan adja meg az anyag, a fázis és a referencia-konvenciót — az alulmegadott rendszer vezetett fizikailag hibás eredményekhez korábbi tesztekben.
- Adja meg a korlátot (mit kell a szkriptnek elérnie), ne az implementációt (API-osztályok neveit) — az API-patterneket a skill-ek és példák szolgáltatják.
- Kérjen kifejezetten önellenőrzést, premise-checkinget és bizonytalanságbecslést; az ügynökök maguktól nem vitatják meg, hogy a kért mennyiség fizikailag jól megfogalmazott-e.
Három demonstrált munkafolyamat és a benchmark eredményei
A három végrehajtott feladat: szilícium egyensúlyi állapota (equation of state, EOS), oxigén adszorpció Cu(111)-en, és lítium ön-diffúzió folyadékban. Mind a 45 generált szkript használta a Toolkit batched GPU végrehajtását; a részletes értékelés két lépcsőben történt: determinisztikus kód- és API-ellenőrzés, valamint tényleges futtatás NVIDIA H200 GPU-ken.
Diamond-kocka szilícium — egyensúlyi állapot
- Feladat: energia-térfogat görbe előállítása, amelyből a rácsállandó a0 és a térfogati modulus B0 kinyerhető.
- Módszer: 50–60 deformált térfogat egyidejű relaxálása egy GPU-batched futtatásban, majd Birch–Murnaghan illesztés.
- Eredmény: minden production-reprezentáns script egyezett az utolsó jegyig: a0 = 5.4661 Å és B0 = 88.15 GPa, amelyek a közzétett all-electron PBE referencia-ablakon belül vannak. A különbségek a NIST kísérleti rácsállapottól és McSkimin kísérleti B0-értéktől összhangban vannak a PBE ismert viselkedésével.
- Következtetés: a prompt részletessége változtatta a kód struktúráját és költségét, de nem a fizikai eredményt.
Oxigén adszorpció Cu(111)-en
- Feladat: az atomos oxigén adszorpciós helyeinek rangsorolása Cu(111) felületen.
- Módszer: alsó rétegek lefagyasztása, 24+ jelölt relaxálása a négy magas szimmetriás hely mentén egy GPU-batchben, majd E_ads = E_slab+ads − E_clean_slab − E_O számítása.
- Eredmény: minden production-reprezentáns a fcc mélyedőt találta legstabilabbnak, E_ads(fcc) = −4.799 ± 0.004 eV szinten a öt prompt-szinten belül; sorrend: fcc ≥ bridge > hcp >> top.
- Összehasonlítás: irodalmi referenciák −4.31 eV (0.25 monoréteg) és mikrokalorimetriai mérések −4.46–−4.60 eV között. A különbségek lefedettség- és modellhibákra vezethetők vissza; a millielektronvolt-szintű egyezés független szkriptek között a referencia-konvenció egyértelmű megadottságának eredménye.
Lítium ön-diffúzió (MD)
- Feladat: a folyékony lítium ön-diffúziós együtthatójának D becslése.
- Módszer: bcc lítium szupercella összeépítése, olvasztás és egyensúlyozás a lítium 454 K feletti hőmérsékletén, három hőmérséklet × három véletlen magindítás (9 replikum) egyetlen batched GPU-futtatásként, D kinyerése a középnégyzetes elmozdulás (MSD) idejében vett lejtőjéből (Einstein-reláció).
- Eredmények (termelési beállítások, táblázatosan):
- L1 (Sketch, Langevin): eredmény részlegesen hiányzik vagy elnyomott (példa: 600 K alatt 1.21×10^-4 cm^2/s hiányzó érték megjegyzéssel).
- L2 (Goal, Langevin): 600 K 0.80×10^-4, 800 K 1.03×10^-4, 1000 K 1.55×10^-4 cm^2/s.
- L3 (Recipe, NVE): 600 K 2.91×10^-4, 800 K 5.38×10^-4, 1000 K 7.22×10^-4 cm^2/s.
- L5 (Contract, NVE): 600 K 3.62×10^-4, 800 K 4.32×10^-4, 1000 K 6.49×10^-4 cm^2/s.
- Megfigyelés: Langevin termosztát 3–5× alacsonyabb diffúziós értékeket eredményezett, mivel a termikus súrlódás elnyomja a transzportot; az NVE futtatások közelebb vannak az kísérleti extrapolációkhoz (nagyjából két nagyságrend körüli eltérésen belül).
Technikai metaadatok a benchmarkról
- Kódoló ügynök: Claude (claude-opus-4-8)
- MLIP checkpoint: MACE-MPA-0 (medium-mpa-0)
- Toolkit verzió: 0.2.0
A generálási költség, token-felhasználás és szkript-hossz növekedett a prompt részletességével; a Contract (L5) promptok feldolgozása például ~10M token lett, és a generált kód ~1,168 sor (LOC) volt.
Tapasztalatok és korlátok
- Prompt specifikussága javítja a kód szerkezetét és az API-pattern lefedettségét; a tudományos mennyiségek lefedettsége már az első szinteken is jó volt.
- Az ügynökök hajlamosak a bemutatott és példákban szereplő algoritmusokat használni (például a FIRE algoritmust alkalmazták 38/45 scriptben, miközben a dokumentáció mellett a FIRE2 is elérhető volt).
- A futtatás GPU-n fedte fel azokat a hibákat, amelyeket a CPU-s önellenőrzés nem mutatott ki; a futtatható shell jelentősen csökkentette a törött importok számát, de nem helyettesítette a célhardveres validálást.
- A tudományos megítélés elengedhetetlen: az ügynökök nem kérdőjelezték meg, ha egy kért mennyiség fizikailag rosszul megfogalmazott volt; a generációs sandboxnak nincs web-hozzáférése, így az ügynök nem tudott külső hivatkozást ellenőrizni.
- Az MLIP alapmodellek pontossága nem univerzális: a MACE-MPA-0 pontossága a tanulási eloszláson kívül változó; minden új kémiai rendszert független DFT- vagy kísérleti referenciával kell validálni.
- Mindig független, numerikus összehasonlítást kell végezni: a statisztikailag konzisztens, de fizikailag torz eredmények (pl. termósztát elnyomás) csak referenciaellenőrzéssel derülnek ki.
Ökoszisztéma és gyakorlatba ültetés
Több vállalat vizsgálja ezeket a megközelítéseket. 2026 májusában a Matlantis (ALCHEMI partner) kiadott egy nyilvános Skills könyvtárat a GitHubon és bejelentette a Claude Code integrációt univerzális szimulátorához. A Dassault Systèmes – BIOVIA is NVIDIA ALCHEMI NIM-et használ MARIE virtuális segédban, hogy szélesebb körben hozzáférhetővé tegye a fejlett szimulációs képességeket.
Hogyan kezdjen hozzá
A szerzők az NVIDIA/nvalchemi-toolkit GitHub repóját és az NVIDIA ALCHEMI Toolkit dokumentációját ajánlják; a repó tartalmaz ügynök-skill-eket és több mint 30 workflow-t alap-, közép-, felsőfokú és elosztott esetekre.
Köszönetnyilvánítás
A közlemény készítői köszönettel tartoznak Nikita Fediknek, Susumu Ohno-nak (Matlantis Corporation) és James Wescott-nak (Dassault Systèmes – BIOVIA) a hozzájárulásukért.



