Anthropic Claude Science környezetét integrálták az NVIDIA BioNeMo Agent Toolkit és a BioNeMo NIM (NVIDIA NIM) mikroszolgáltatásokkal, hogy MSA-alapú (multiple-sequence alignment) fehérjeszerkezet-elõrejelzést futtassanak és több hajtogatómodellt összehasonlítsanak. A bemutatott munkafolyamat egy GPU-val rendelkező gépen futtatható, és a teljes adat- és konténerigény körülbelül 700 GB tárolót igényel. A példában a Seh1 nukleáris pórusfehérjét (UniProt accession C1GY11, 384 aminosav) hasonlították össze egy előre jelzett Mio-családi partnerrel (C1HCX1, 976 aminosav) a gomba Paracoccidioides lutzii-ből.
Miért fontos ez
Agentikus AI-képes megoldások (agentic AI) automatikusan lekérhetnek adatokat, készíthetnek MSA-kat, elindíthatnak modelleket és rendszerezhetik az eredményeket — ez felgyorsítja a hipotézisalkotást és lehetővé teszi reprodukálható szerkezeti vizsgálatokat. Ugyanakkor a fehérje- és komplex-előrejelzés domain-specifikus eszközöket igényel, és az integrációk, konténer- és adatméretek miatt az operációs részletek kritikusak.
Rendszerkövetelmények és előkészítés
- Hardver: helyi GPU — például NVIDIA L40S vagy NVIDIA H100.
- Tároló: körülbelül 700 GB; ennek oka, hogy a msa-search NIM UniRef30 adatbázisa ~490 GB (UniRef30-only profil), a Boltz-2 és OpenFold3 konténerek együtt 30–40 GB.
- Claude Science alapértelmezésben sandbox módban fut; a BioNeMo NIM mikroszolgáltatások GPU-erőforrást igénylő végpontokat (Docker konténereket) használnak.
A beállítás lépései röviden:
- Claude Science-ban importálni kell a BioNeMo Agent Toolkit fogásait (skills) GitHubról, megadni az NVIDIA API-kulcsot és csatlakoztatni a lokális (host GPU-t használó) végpontokat.
- Letölteni és elindítani a msa-search, openfold3 és boltz2 NIM konténereket; msa-search esetén csak az UniRef30 adatbázist (≈490 GB) használjuk a teljes 1,4 TB helyett.
- Smoke tesztekkel ellenőrizni a mikroszolgáltatások állapotát, és jóváhagyni az endpointokat (Approve endpoint) Claude Science felületén.
Módszer — a munkafolyamat felépítése
A pipeline három szakaszból állt:
- MSA-készítés: GPU-gyorsított msa-search NIM-mel generáltak per-chain és species-paired A3M alignementeket.
- Szerkezet-előrejelzés OpenFold3-mal: mind monomer, mind heteromer feltételekkel mmCIF kimenettel, sablonok és ligandumok nélkül.
- Azonos körülmények Boltz-2-vel: Boltz-2 belső MSA-párosítást használ (nincs külön paired_msa mező), és a modellel is megismételték a monomer/heteromer futtatásokat.
A tesztpélda célja a szerkezeti kérdés megválaszolása: hogyan változik a Seh1 prediktált szerkezete, ha egy javasolt partner (C1HCX1) jelen van a modellben?
Stage 1 — MSA generálása
- A munkamenet UniProt-ból töltötte le a két szekvenciát és létrehozta a következő típusú alignmenteket: egyenkénti (unpaired) A3M minden láncra és species-paired A3M, ahol az azonos fajban talált ortológok párosításra kerülnek (greedy pairing). A keresés 202 találatot adott mindkét fehérjére.
- Rögzített metaadatok: Seh1 hossza 384 aminosav, C1HCX1 hossza 976 aminosav; a lekérések forrása, időpontja, accession, checksum és chain ID is elmentésre került (A = C1GY11, B = C1HCX1).
- A feltöltési paraméterek: Uniref30_2302-only profil, ColabFold search type, E-value 1e-4, maximum 500 szekvencia. A paired A3M létrehozása sikertelensége esetén a folyamat megállt volna és hiba lett rögzítve.
Stage 2 — OpenFold3 predikciók
- Két feltételt futtattak OpenFold3 NIM-mel: (1) Seh1 mint egyláncú (chain A) monomer az annak A3M-jával; (2) Seh1 (chain A) + C1HCX1 (chain B) heteromer az egy- és paired_msa használatával. Kimenet mmCIF formátum, nincsenek sablonok.
- Az OpenFold3 által visszaadott konfidencia-mezők: confidence_score, complex_plddt_score, complex_pde_score, ptm_score, iptm_score (plus format, name, source). A runtime_metrics mező jelen volt, de üres volt.
- Kiemelt eredmények (OpenFold3, MSA-val):
- Seh1 monomer: confidence_score 0.25, complex_plddt_score 82.3, complex_pde_score 0.58, ptm_score 0.82, iptm_score 0 (monomer esetén iptm=0 a konstrukció miatt).
- Seh1 + C1HCX1 komplex: confidence_score 0.87, complex_plddt_score 78.2, complex_pde_score 1.07, ptm_score 0.79, iptm_score 0.86.
- Megjegyzés: OpenFold3 composite confidence_score erősen súlyozza az interfészt, ezért egy jól rendezett monomer magas pLDDT/pTM értékekkel alacsony composite confidence_score-t kaphat.
Stage 3 — Boltz-2 predikciók
- Ugyanazokat a feltételeket ismételték Boltz-2 NIM-mel: monomer (C1GY11 mint chain A) és heteromer (C1GY11 + C1HCX1). Boltz-2 nem használ külön paired_msa mezőt; minden lánc kapta a saját A3M-ját és a Boltz-2 párosítást belül végzi.
- Boltz-2 gazdagabb konfidencia-készletet adott vissza, többek között confidence_scores, ptm_scores, iptm_scores, protein_iptm_scores, complex_plddt_scores, complex_iplddt_scores, complex_pde_scores, complex_ipde_scores, valamint per-chain és páronkénti tömböket és teljes PAE/PDE mátrixokat (a komplex esetén akár 1360×1360-ig). Egyetlen kért mező, a runtime metadata üres maradt (metrics: {}).
- Kiemelt Boltz-2 eredmények (MSA-val):
- Seh1 monomer: confidence 0.79, complex_plddt 0.79 (0–1 skálán), complex_pde 1.11, ptm 0.82, iptm nem értelmezett/hiányzott.
- Seh1 + C1HCX1: confidence 0.77, complex_plddt 0.75, complex_pde 1.33, ptm 0.76, iptm 0.82, protein_iptm 0.82.
Az MSA szerepe — egyszerűen nélkülözhetetlen
- A munkafolyamat összehasonlította MSA-val és MSA nélküli (single-sequence) predikciókat. Az interfész pTM (iPTM) értéke a heteromer esetén mindkét modellnél drámaian csökkent MSA hiányában.
- Heteromer iPTM értékek (átlag öt mintán, SD ≤ 0.006):
- OpenFold3: MSA-val 0.85 → MSA nélkül 0.14 (csökkenés 0.72).
- Boltz-2: MSA-val 0.82 → MSA nélkül 0.19 (csökkenés 0.63).
- Heteromer iPTM értékek (átlag öt mintán, SD ≤ 0.006):
- Két robosztussági ellenőrzés erősítette az eredményt:
- Nagyobb sampling-budget (OpenFold3 diffusion_samples=5; Boltz-2: 5 mintavétel, 6 recycling lépés és 200 sampling step) nem helyettesíti az evolúciós információt: az MSA-s feltétel magas interfészt adott, a no-MSA feltétel pedig alacsony interfészt, a változás eltérése ≤ 0.01 iPTM.
- Különböző modellarchitektúrák (és külön MSA-párosítási megközelítés Boltz-2 esetén) közel azonos iPTM-et adtak (<0.03 eltérés) MSA-val, ami jó keresztmodell-egyezést jelez.
- Monomer viselkedés: OpenFold3 erősen függ az alignmenttől (pLDDT 82 → 36 MSA nélkül), míg Boltz-2 jobban képes monomert hajtogatni szekvencia-alapból (0.79 → 0.73), de interfészt egyik sem tud megbízhatóan elhelyezni MSA nélkül.
Strukturális eredmények és biológiai értelmezés
- A munkamenet a Seh1 monomer és a heteromer Seh1-láncait egymásra illesztve a WD40 β-propeller régiót vizsgálta.
- Mindkét modell reprodukálta a korábbi irodalmi megfigyelést (Han et al., „AlphaFold Database expands to proteome-scale quaternary structures”): a partner nem átrendezi a Seh1 alapvázát, hanem kiegészíti a nyitott β-propellert.
- Core Cα-RMSD (monomer vs heteromer, Seh1 mag): OpenFold3 0.68 Å (313/384 residue), Boltz-2 0.65 Å (307/384 residue).
- A partner fehérje a propeller szélén lévő mintegy ~70 aminosavat mozgatja el, ami magyarázza a teljes láncra vonatkozó nagyobb RMSD-t.
- Mindkét modell ugyanahhoz a partner β-szál klaszterhez pozícionálta a C1HCX1 közel 305–391 maradékát — összhangban a cikkben említett „három β-szál” beillesztéssel.
- A beillesztés a WD40 velcro-lezárási pozícióján található: a partner kapcsolatba lép Seh1 N-terminális szálával (residues 1–29) és a C-terminális szálakkal (~331–384), azzal az élszegmenssel, ahol a WD40-propeller lezárul.
Fontos korlátozás: a modellek által előre jelzett C1GY11–C1HCX1 interakció hipotézis, nem kísérletileg igazolt biológiai tény. Két független modell egyezése erős hipotézist ad, de a végső megerősítést kísérleti vizsgálatok adhatják meg.
Következtetések és továbblépés
- A BioNeMo Agent Toolkit Claude Science-szal lehetővé teszi MSA-generálást, NIM-alapú szerkezet-előrejelzést és az eredmények reprodukálható mentését áttekintésre.
- Az MSA egyértelműen kritikus input a komplex interfész előrejelzéséhez; extra sampling önmagában nem pótolja az evolúciós információt.
- Az OpenFold3 és Boltz-2 független egyezése ugyanazt a helyi geometriát támogatja, ami jó jel egy vizsgálható hipotézis számára.
A BioNeMo Agent Toolkit GitHub-oldalán további példák és a fogások (skills) elérhetők, amelyekkel a munkafolyamat más monomerekre és komplexekre is alkalmazható.



