Eszközök

Mesterséges intelligenciával generált szöveg

Claude Science és NVIDIA BioNeMo NIM: MSA-alapú fehérjeszerkezet-előrejelzés és összehasonlítás OpenFold3-mal és Boltz-2-vel

A cikk főszereplője az NVIDIA BioNeMo Agent Toolkit és Anthropic Claude Science együttműködése, amely lehetővé teszi BioNeMo NIM mikroservice-ek indítását és hívását proteinstruktúra-előrejelzésre.

Claude Science és NVIDIA BioNeMo NIM: MSA-alapú fehérjeszerkezet-előrejelzés és összehasonlítás OpenFold3-mal és Boltz-2-vel

Anthropic Claude Science környezetét integrálták az NVIDIA BioNeMo Agent Toolkit és a BioNeMo NIM (NVIDIA NIM) mikroszolgáltatásokkal, hogy MSA-alapú (multiple-sequence alignment) fehérjeszerkezet-elõrejelzést futtassanak és több hajtogatómodellt összehasonlítsanak. A bemutatott munkafolyamat egy GPU-val rendelkező gépen futtatható, és a teljes adat- és konténerigény körülbelül 700 GB tárolót igényel. A példában a Seh1 nukleáris pórusfehérjét (UniProt accession C1GY11, 384 aminosav) hasonlították össze egy előre jelzett Mio-családi partnerrel (C1HCX1, 976 aminosav) a gomba Paracoccidioides lutzii-ből.

Miért fontos ez

Agentikus AI-képes megoldások (agentic AI) automatikusan lekérhetnek adatokat, készíthetnek MSA-kat, elindíthatnak modelleket és rendszerezhetik az eredményeket — ez felgyorsítja a hipotézisalkotást és lehetővé teszi reprodukálható szerkezeti vizsgálatokat. Ugyanakkor a fehérje- és komplex-előrejelzés domain-specifikus eszközöket igényel, és az integrációk, konténer- és adatméretek miatt az operációs részletek kritikusak.

Rendszerkövetelmények és előkészítés

  • Hardver: helyi GPU — például NVIDIA L40S vagy NVIDIA H100.
  • Tároló: körülbelül 700 GB; ennek oka, hogy a msa-search NIM UniRef30 adatbázisa ~490 GB (UniRef30-only profil), a Boltz-2 és OpenFold3 konténerek együtt 30–40 GB.
  • Claude Science alapértelmezésben sandbox módban fut; a BioNeMo NIM mikroszolgáltatások GPU-erőforrást igénylő végpontokat (Docker konténereket) használnak.

A beállítás lépései röviden:

  1. Claude Science-ban importálni kell a BioNeMo Agent Toolkit fogásait (skills) GitHubról, megadni az NVIDIA API-kulcsot és csatlakoztatni a lokális (host GPU-t használó) végpontokat.
  2. Letölteni és elindítani a msa-search, openfold3 és boltz2 NIM konténereket; msa-search esetén csak az UniRef30 adatbázist (≈490 GB) használjuk a teljes 1,4 TB helyett.
  3. Smoke tesztekkel ellenőrizni a mikroszolgáltatások állapotát, és jóváhagyni az endpointokat (Approve endpoint) Claude Science felületén.

Módszer — a munkafolyamat felépítése

A pipeline három szakaszból állt:

  1. MSA-készítés: GPU-gyorsított msa-search NIM-mel generáltak per-chain és species-paired A3M alignementeket.
  2. Szerkezet-előrejelzés OpenFold3-mal: mind monomer, mind heteromer feltételekkel mmCIF kimenettel, sablonok és ligandumok nélkül.
  3. Azonos körülmények Boltz-2-vel: Boltz-2 belső MSA-párosítást használ (nincs külön paired_msa mező), és a modellel is megismételték a monomer/heteromer futtatásokat.

A tesztpélda célja a szerkezeti kérdés megválaszolása: hogyan változik a Seh1 prediktált szerkezete, ha egy javasolt partner (C1HCX1) jelen van a modellben?

Stage 1 — MSA generálása

  • A munkamenet UniProt-ból töltötte le a két szekvenciát és létrehozta a következő típusú alignmenteket: egyenkénti (unpaired) A3M minden láncra és species-paired A3M, ahol az azonos fajban talált ortológok párosításra kerülnek (greedy pairing). A keresés 202 találatot adott mindkét fehérjére.
  • Rögzített metaadatok: Seh1 hossza 384 aminosav, C1HCX1 hossza 976 aminosav; a lekérések forrása, időpontja, accession, checksum és chain ID is elmentésre került (A = C1GY11, B = C1HCX1).
  • A feltöltési paraméterek: Uniref30_2302-only profil, ColabFold search type, E-value 1e-4, maximum 500 szekvencia. A paired A3M létrehozása sikertelensége esetén a folyamat megállt volna és hiba lett rögzítve.

Stage 2 — OpenFold3 predikciók

  • Két feltételt futtattak OpenFold3 NIM-mel: (1) Seh1 mint egyláncú (chain A) monomer az annak A3M-jával; (2) Seh1 (chain A) + C1HCX1 (chain B) heteromer az egy- és paired_msa használatával. Kimenet mmCIF formátum, nincsenek sablonok.
  • Az OpenFold3 által visszaadott konfidencia-mezők: confidence_score, complex_plddt_score, complex_pde_score, ptm_score, iptm_score (plus format, name, source). A runtime_metrics mező jelen volt, de üres volt.
  • Kiemelt eredmények (OpenFold3, MSA-val):
    • Seh1 monomer: confidence_score 0.25, complex_plddt_score 82.3, complex_pde_score 0.58, ptm_score 0.82, iptm_score 0 (monomer esetén iptm=0 a konstrukció miatt).
    • Seh1 + C1HCX1 komplex: confidence_score 0.87, complex_plddt_score 78.2, complex_pde_score 1.07, ptm_score 0.79, iptm_score 0.86.
  • Megjegyzés: OpenFold3 composite confidence_score erősen súlyozza az interfészt, ezért egy jól rendezett monomer magas pLDDT/pTM értékekkel alacsony composite confidence_score-t kaphat.

Stage 3 — Boltz-2 predikciók

  • Ugyanazokat a feltételeket ismételték Boltz-2 NIM-mel: monomer (C1GY11 mint chain A) és heteromer (C1GY11 + C1HCX1). Boltz-2 nem használ külön paired_msa mezőt; minden lánc kapta a saját A3M-ját és a Boltz-2 párosítást belül végzi.
  • Boltz-2 gazdagabb konfidencia-készletet adott vissza, többek között confidence_scores, ptm_scores, iptm_scores, protein_iptm_scores, complex_plddt_scores, complex_iplddt_scores, complex_pde_scores, complex_ipde_scores, valamint per-chain és páronkénti tömböket és teljes PAE/PDE mátrixokat (a komplex esetén akár 1360×1360-ig). Egyetlen kért mező, a runtime metadata üres maradt (metrics: {}).
  • Kiemelt Boltz-2 eredmények (MSA-val):
    • Seh1 monomer: confidence 0.79, complex_plddt 0.79 (0–1 skálán), complex_pde 1.11, ptm 0.82, iptm nem értelmezett/hiányzott.
    • Seh1 + C1HCX1: confidence 0.77, complex_plddt 0.75, complex_pde 1.33, ptm 0.76, iptm 0.82, protein_iptm 0.82.

Az MSA szerepe — egyszerűen nélkülözhetetlen

  • A munkafolyamat összehasonlította MSA-val és MSA nélküli (single-sequence) predikciókat. Az interfész pTM (iPTM) értéke a heteromer esetén mindkét modellnél drámaian csökkent MSA hiányában.
    • Heteromer iPTM értékek (átlag öt mintán, SD ≤ 0.006):
      • OpenFold3: MSA-val 0.85 → MSA nélkül 0.14 (csökkenés 0.72).
      • Boltz-2: MSA-val 0.82 → MSA nélkül 0.19 (csökkenés 0.63).
  • Két robosztussági ellenőrzés erősítette az eredményt:
    1. Nagyobb sampling-budget (OpenFold3 diffusion_samples=5; Boltz-2: 5 mintavétel, 6 recycling lépés és 200 sampling step) nem helyettesíti az evolúciós információt: az MSA-s feltétel magas interfészt adott, a no-MSA feltétel pedig alacsony interfészt, a változás eltérése ≤ 0.01 iPTM.
    2. Különböző modellarchitektúrák (és külön MSA-párosítási megközelítés Boltz-2 esetén) közel azonos iPTM-et adtak (<0.03 eltérés) MSA-val, ami jó keresztmodell-egyezést jelez.
  • Monomer viselkedés: OpenFold3 erősen függ az alignmenttől (pLDDT 82 → 36 MSA nélkül), míg Boltz-2 jobban képes monomert hajtogatni szekvencia-alapból (0.79 → 0.73), de interfészt egyik sem tud megbízhatóan elhelyezni MSA nélkül.

Strukturális eredmények és biológiai értelmezés

  • A munkamenet a Seh1 monomer és a heteromer Seh1-láncait egymásra illesztve a WD40 β-propeller régiót vizsgálta.
  • Mindkét modell reprodukálta a korábbi irodalmi megfigyelést (Han et al., „AlphaFold Database expands to proteome-scale quaternary structures”): a partner nem átrendezi a Seh1 alapvázát, hanem kiegészíti a nyitott β-propellert.
    • Core Cα-RMSD (monomer vs heteromer, Seh1 mag): OpenFold3 0.68 Å (313/384 residue), Boltz-2 0.65 Å (307/384 residue).
    • A partner fehérje a propeller szélén lévő mintegy ~70 aminosavat mozgatja el, ami magyarázza a teljes láncra vonatkozó nagyobb RMSD-t.
    • Mindkét modell ugyanahhoz a partner β-szál klaszterhez pozícionálta a C1HCX1 közel 305–391 maradékát — összhangban a cikkben említett „három β-szál” beillesztéssel.
    • A beillesztés a WD40 velcro-lezárási pozícióján található: a partner kapcsolatba lép Seh1 N-terminális szálával (residues 1–29) és a C-terminális szálakkal (~331–384), azzal az élszegmenssel, ahol a WD40-propeller lezárul.

Fontos korlátozás: a modellek által előre jelzett C1GY11–C1HCX1 interakció hipotézis, nem kísérletileg igazolt biológiai tény. Két független modell egyezése erős hipotézist ad, de a végső megerősítést kísérleti vizsgálatok adhatják meg.

Következtetések és továbblépés

  • A BioNeMo Agent Toolkit Claude Science-szal lehetővé teszi MSA-generálást, NIM-alapú szerkezet-előrejelzést és az eredmények reprodukálható mentését áttekintésre.
  • Az MSA egyértelműen kritikus input a komplex interfész előrejelzéséhez; extra sampling önmagában nem pótolja az evolúciós információt.
  • Az OpenFold3 és Boltz-2 független egyezése ugyanazt a helyi geometriát támogatja, ami jó jel egy vizsgálható hipotézis számára.

A BioNeMo Agent Toolkit GitHub-oldalán további példák és a fogások (skills) elérhetők, amelyekkel a munkafolyamat más monomerekre és komplexekre is alkalmazható.