Eszközök

Mesterséges intelligenciával generált szöveg

AI-kódoló ügynökök felgyorsítják az anyagok atomisztikus szimulációját az NVIDIA ALCHEMI Toolkit segítségével

A főszereplő az NVIDIA ALCHEMI Toolkit és a kódoló ügynökök (például Claude Code), amelyek célja az atomisztikus anyagszimuláció harmadik akadályának — az elérhető, használható interfészek — lebontása.

AI-kódoló ügynökök felgyorsítják az anyagok atomisztikus szimulációját az NVIDIA ALCHEMI Toolkit segítségével

Az atomisztikus szimuláció három összetevőt igényel: a mögöttes tudomány ismeretét, számításilag hatékony szimulációs implementációt és hozzáférhető felületeket a szimulációs stackhez. Az NVIDIA ALCHEMI Toolkit idén bevezetett, PyTorch-native, komponálható építőelemei jelentősen csökkentették a hatékonysági korlátot a gépi tanulás alapú interatomikus potenciálok (MLIP) használatánál. A harmadik korlát — az eko­rendszerrel kompatibilis, könnyen használható interfészek hiánya — azonban továbbra is fennáll.

A megoldás: AI-kódoló ügynökök, amelyek természetes nyelvi leírásból generálnak és futtatnak kódot a kutató által használt szakmai terminológiában. Mivel azonban a általános célú ügynökök nem feltétlenül ismerik az ALCHEMI Toolkit API-patternjeit, az NVIDIA csapata „agent skills” és referenciafájlok gyűjteményét biztosítja, amelyek az API helyes használatát adják az ügynöknek, így a kutató szabadon a tudományos célokra koncentrálhat (anyag, körülmények, protokollkorlátok).

Módszer: végponttól végpontig workflow ügynökkel

A bemutatott vizsgálat egy végponttól végpontig ALCHEMI Toolkit workflow-ot követ: a kutató kezdeti kiindulópontját, az ügynöknek adott promptot, a generált kódot és a GPU-n való futtatás validálását NVIDIA H200 GPU-ken. Mindezt 45 automatikusan generált pipeline alapján tesztelték három különböző munkafolyamaton, öt prompt-szinten és három minta per szint.

Rendszer- és csomagkövetelmények

  • Python ≥3.11, <3.14
  • PyTorch ≥2.8
  • CUDA 12 vagy CUDA 13, kompatibilis NVIDIA driver (570+ ajánlott)
  • Operációs rendszer: Linux (elsődleges), macOS
  • NVIDIA GPU (RTX 20xx vagy újabb), CUDA Compute Capability ≥7.0
  • Minimum 4 GB RAM (nagy rendszerekhez 16 GB ajánlott)

Telepítés és környezet

Az ügynök futtatási környezetének kialakítása jelentősen befolyásolja a generált kód megbízhatóságát. Ajánlott a Toolkit telepítése futtatható Python környezetbe és engedélyezni, hogy az ügynök végrehajtsa a generált szkripteket. A 45-pipeline kampányban ez a beállítás elkerülte a törött importokat és a hiányzó API-hivatkozásokat.

Példa telepítési lépések (összefoglalva):

  1. Helyi Python környezet létrehozása és ALCHEMI Toolkit telepítése (például uv venv és uv pip install "nvalchemi-toolkit[mace,ase]==0.2.0", szükség esetén CUDA extra cu13).
  2. Ügynök-skill fájlok letöltése ugyanarról a release tagról (pl. .claude/skills#v0.2.0).
  3. Egy kódoló ügynök telepítése és indítása (a bemutatásban Claude Code-t használták).

Ha az ügynöknek engedélyezik a kód végrehajtását a projektkönyvtárban, az ügynök betölti a releváns skill-eket igény szerint, és a futtatás kiszűri a mechanikai hibákat, mielőtt a szkriptet felhasználóhoz juttatná.

Promptolási jó gyakorlatok (benchmark-alapú)

A benchmark öt prompt-szintet definiált (Sketch, Goal, Recipe, Spec, Contract). A fő megállapítások:

  • Mindig nevezze meg a rendszer anyagát, módszerét és skáláját; ha a szkript futtatás nélküli, felügyelet nélküli használatra szánt, adjon CLI-szerződést is.
  • Pontosan adja meg az anyag, a fázis és a referencia-konvenciót — az alulmegadott rendszer vezetett fizikailag hibás eredményekhez korábbi tesztekben.
  • Adja meg a korlátot (mit kell a szkriptnek elérnie), ne az implementációt (API-osztályok neveit) — az API-patterneket a skill-ek és példák szolgáltatják.
  • Kérjen kifejezetten önellenőrzést, premise-checkinget és bizonytalanságbecslést; az ügynökök maguktól nem vitatják meg, hogy a kért mennyiség fizikailag jól megfogalmazott-e.

Három demonstrált munkafolyamat és a benchmark eredményei

A három végrehajtott feladat: szilícium egyensúlyi állapota (equation of state, EOS), oxigén adszorpció Cu(111)-en, és lítium ön-diffúzió folyadékban. Mind a 45 generált szkript használta a Toolkit batched GPU végrehajtását; a részletes értékelés két lépcsőben történt: determinisztikus kód- és API-ellenőrzés, valamint tényleges futtatás NVIDIA H200 GPU-ken.

Diamond-kocka szilícium — egyensúlyi állapot

  • Feladat: energia-térfogat görbe előállítása, amelyből a rácsállandó a0 és a térfogati modulus B0 kinyerhető.
  • Módszer: 50–60 deformált térfogat egyidejű relaxálása egy GPU-batched futtatásban, majd Birch–Murnaghan illesztés.
  • Eredmény: minden production-reprezentáns script egyezett az utolsó jegyig: a0 = 5.4661 Å és B0 = 88.15 GPa, amelyek a közzétett all-electron PBE referencia-ablakon belül vannak. A különbségek a NIST kísérleti rácsállapottól és McSkimin kísérleti B0-értéktől összhangban vannak a PBE ismert viselkedésével.
  • Következtetés: a prompt részletessége változtatta a kód struktúráját és költségét, de nem a fizikai eredményt.

Oxigén adszorpció Cu(111)-en

  • Feladat: az atomos oxigén adszorpciós helyeinek rangsorolása Cu(111) felületen.
  • Módszer: alsó rétegek lefagyasztása, 24+ jelölt relaxálása a négy magas szimmetriás hely mentén egy GPU-batchben, majd E_ads = E_slab+ads − E_clean_slab − E_O számítása.
  • Eredmény: minden production-reprezentáns a fcc mélyedőt találta legstabilabbnak, E_ads(fcc) = −4.799 ± 0.004 eV szinten a öt prompt-szinten belül; sorrend: fcc ≥ bridge > hcp >> top.
  • Összehasonlítás: irodalmi referenciák −4.31 eV (0.25 monoréteg) és mikro­kalorimetriai mérések −4.46–−4.60 eV között. A különbségek lefedettség- és modellhibákra vezethetők vissza; a millielektronvolt-szintű egyezés független szkriptek között a referencia-konvenció egyértelmű megadottságának eredménye.

Lítium ön-diffúzió (MD)

  • Feladat: a folyékony lítium ön-diffúziós együtthatójának D becslése.
  • Módszer: bcc lítium szupercella összeépítése, olvasztás és egyensúlyozás a lítium 454 K feletti hőmérsékletén, három hőmérséklet × három véletlen magindítás (9 replikum) egyetlen batched GPU-futtatásként, D kinyerése a középnégyzetes elmozdulás (MSD) idejében vett lejtőjéből (Einstein-reláció).
  • Eredmények (termelési beállítások, táblázatosan):
    • L1 (Sketch, Langevin): eredmény részlegesen hiányzik vagy elnyomott (példa: 600 K alatt 1.21×10^-4 cm^2/s hiányzó érték megjegyzéssel).
    • L2 (Goal, Langevin): 600 K 0.80×10^-4, 800 K 1.03×10^-4, 1000 K 1.55×10^-4 cm^2/s.
    • L3 (Recipe, NVE): 600 K 2.91×10^-4, 800 K 5.38×10^-4, 1000 K 7.22×10^-4 cm^2/s.
    • L5 (Contract, NVE): 600 K 3.62×10^-4, 800 K 4.32×10^-4, 1000 K 6.49×10^-4 cm^2/s.
  • Megfigyelés: Langevin termosztát 3–5× alacsonyabb diffúziós értékeket eredményezett, mivel a termikus súrlódás elnyomja a transzportot; az NVE futtatások közelebb vannak az kísérleti extrapolációkhoz (nagyjából két nagyságrend körüli eltérésen belül).

Technikai metaadatok a benchmarkról

  • Kódoló ügynök: Claude (claude-opus-4-8)
  • MLIP checkpoint: MACE-MPA-0 (medium-mpa-0)
  • Toolkit verzió: 0.2.0

A generálási költség, token-felhasználás és szkript-hossz növekedett a prompt részletességével; a Contract (L5) promptok feldolgozása például ~10M token lett, és a generált kód ~1,168 sor (LOC) volt.

Tapasztalatok és korlátok

  • Prompt specifikussága javítja a kód szerkezetét és az API-pattern lefedettségét; a tudományos mennyiségek lefedettsége már az első szinteken is jó volt.
  • Az ügynökök hajlamosak a bemutatott és példákban szereplő algoritmusokat használni (például a FIRE algoritmust alkalmazták 38/45 scriptben, miközben a dokumentáció mellett a FIRE2 is elérhető volt).
  • A futtatás GPU-n fedte fel azokat a hibákat, amelyeket a CPU-s önellenőrzés nem mutatott ki; a futtatható shell jelentősen csökkentette a törött importok számát, de nem helyettesítette a célhardveres validálást.
  • A tudományos megítélés elengedhetetlen: az ügynökök nem kérdőjelezték meg, ha egy kért mennyiség fizikailag rosszul megfogalmazott volt; a generációs sandboxnak nincs web-hozzáférése, így az ügynök nem tudott külső hivatkozást ellenőrizni.
  • Az MLIP alapmodellek pontossága nem univerzális: a MACE-MPA-0 pontossága a tanulási eloszláson kívül változó; minden új kémiai rendszert független DFT- vagy kísérleti referenciával kell validálni.
  • Mindig független, numerikus összehasonlítást kell végezni: a statisztikailag konzisztens, de fizikailag torz eredmények (pl. termósztát elnyomás) csak referenciaellenőrzéssel derülnek ki.

Ökoszisztéma és gyakorlatba ültetés

Több vállalat vizsgálja ezeket a megközelítéseket. 2026 májusában a Matlantis (ALCHEMI partner) kiadott egy nyilvános Skills könyvtárat a GitHubon és bejelentette a Claude Code integrációt univerzális szimulátorához. A Dassault Systèmes – BIOVIA is NVIDIA ALCHEMI NIM-et használ MARIE virtuális segédban, hogy szélesebb körben hozzáférhetővé tegye a fejlett szimulációs képességeket.

Hogyan kezdjen hozzá

A szerzők az NVIDIA/nvalchemi-toolkit GitHub repóját és az NVIDIA ALCHEMI Toolkit dokumentációját ajánlják; a repó tartalmaz ügynök-skill-eket és több mint 30 workflow-t alap-, közép-, felsőfokú és elosztott esetekre.

Köszönetnyilvánítás

A közlemény készítői köszönettel tartoznak Nikita Fediknek, Susumu Ohno-nak (Matlantis Corporation) és James Wescott-nak (Dassault Systèmes – BIOVIA) a hozzájárulásukért.