A nemzetközi nonprofit biomedicinális kutatóintézet, a Biohub és az AI-for-biology labor, az EvolutionaryScale közösen publikálták az ESMFold2 nevű, nyílt forrású modellt, amely biológiailag aktív molekulák — köztük fehérjék, DNS, RNS és ezekhez kötődő kis molekulák — háromdimenziós szerkezetét jósolja úgy, hogy összetevőiket természetes nyelvszerű elemekként kezeli. A megközelítés alapgondolata, hogy egy transzformerrel előállított beágyazás (embedding) képes helyettesíteni a hagyományos többszörös szekvenciaillesztést (MSA), ami különösen hasznos, ha a kapcsolódó molekulákról kevés adat áll rendelkezésre.
Mire képes a rendszer
- Bemenetként fogad aminosav-szekvenciát (fehérjékhez), bázispárosorozatot (DNS/RNS-hez), standardizált szöveges leírást (SMILES) más bioaktív molekulákhoz, vagy több szekvenciaillesztést (MSA) kapcsolódó szekvenciákhoz.
- Kimenetként atomkoordinátákat (a molekula szerkezete) és ezek hibabecslését adja vissza.
- A modell „mixed” architektúrájú és körülbelül 6,2 milliárd paramétert tartalmaz.
- Elérhetőség: ingyenesen használható a projekt weboldalán, a súlyok letölthetők a HuggingFace-ről, és API is elérhető a Biohubon keresztül.
Működési elv röviden
Az ESMFold2 több lépésben dolgozza fel a bemenetet:
- Háromféle beágyazást készít: (a) a szekvencia beágyazása ESMC transzformerrel, (b) az atomok beágyazása egy külön transzformerrel, és (c) opcionálisan az MSA beágyazása egy pairmixer nevű modul segítségével.
- Egy másik pairmixer-modul ezekből előállítja a páronkénti (pairwise) távolságokat reprezentáló beágyazást. Ez a beágyazás kezdetben zajként indul, és a tanítás során legfeljebb 6 cikluson keresztül finomítják; az inferencia során 10 ciklust alkalmaztak, mert ez adta a legjobb eredményt.
- Egy diffúziós modell a távolságbeágyazás, a szekvencia- és atombeágyazások, valamint zajos pontfelhő alapján eltávolítja a zajt és meghatározza az atomok koordinátáit.
- Végül egy harmadik pairmixer különböző hibamérőket becsül, például a jósolt és a valós atompárok közötti távolságok eltérését.
Kulcskomponensek és adatok
- ESMC: a szekvencia-beágyazásért felelős transzformer, amelyet maszkolt tokenek kitöltésére tanítottak mintegy 2,8 milliárd szekvencián három fehérjedatabázisban.
- Külön transzformer felel az atomok beágyazásáért.
- Pairmixer: olyan modul, amely egy mátrix minden elemét a saját sorában és oszlopában lévő elemek alapján frissíti; ezt használják az MSA-k és a páronkénti távolságbeágyazások előállítására.
- A modellt két, szekvenciákat és leírásokat szerkezetekhez párosító adathalmazon tanították.
Teljesítmény (FoldBench tesztek)
- Ha csak fehérje-szekvenciát adnak meg MSA nélkül, az ESMFold2 felülmúlja a Chai-1 modellt (amely nem fogad MSA-t). Az lDDT (Local Distance Difference Test) mérőszámban ESMFold2 0,85öt ért el, míg Chai-1 0,81-et.
- Ha rendelkezésre áll MSA, az ESMFold2 0,89 lDDT értéket ért el, ami megegyezik az AlphaFold3 és a Protenix-v1 eredményével.
- DockQ pass rate (molekulák érintkezési pontjain mért pontosság): fehérje–DNS kötött komplex esetén MSA nélkül ESMFold2 80%-os pass rate-et ért el, míg Chai-1 71%-ot. Ugyanez MSA-val: ESMFold2 79%-ot ért el, megegyezve a Protenix-v1-gyel, de elmaradva az AlphaFold3 82%-ától.
Miben különbözik és miért fontos
Korábbi megközelítések, köztük az AlphaFold3, jellemzően megkövetelik a többszörös szekvenciaillesztést (MSA), amihez hasonló molekulák keresésére és pontos illesztésére van szükség a publikus adatbázisokban. ESMFold2 fő újdonsága, hogy egy transzformeralapú beágyazó (ESMC) képes egyedülállóan reprezentálni egyetlen molekulát — a nyelvi modellekhez hasonló módon —, így az MSA nélkül is jó szerkezetjóslást tesz lehetővé. Ez különösen fontos új vagy gyorsan változó molekulák (például vírusfehérjék) vagy szintetikus biológiai termékek vizsgálatánál, amikor kevés vagy semmilyen kapcsolódó szekvencia nem áll rendelkezésre.
További előny, hogy a rendszer nyílt súlyokkal rendelkezik, tehát kutatók széles köre fér hozzá függetlenül anyagi forrásaiktól vagy intézményi hátterüktől.
Háttér és összefoglalás
Az ESMFold2 a Biohub 2022-es ESMFold rendszerének továbbfejlesztett változata: nagyobb modell, több tanítóadat és olyan elemeket integrál, amelyek a legjobb eredményeket adó munkákból származnak — például az atomkoordináták diffúziós modell általi előrejelzése és az eredmények hibabecslését végző modulok, amelyeket az AlphaFold3 is alkalmazott. A teszteredmények szerint ESMFold2 különösen akkor előnyös, amikor nincs elérhető MSA, ugyanakkor MSA-val versenyképes a legjobb rendszerekkel.
A fejlesztők szerint a transzformerek és a nagy nyelvi modelleknél bevált többszöri feldolgozás (ciklusok inferencia közben) javítja a távolságbecslést: az ESMFold2 is ezen az elven finomítja beágyazásait az inferencia során.



