Modellbevezetés

Chan Zuckerberg Biohub nyílt forráskódra hozta az ESM Atlas és ESMFold2 fehérjegyűjteményt

A hír főszereplője a Chan Zuckerberg Biohub, amely elindította az ESM Atlas elnevezésű, 1,1 milliárd előre jelzett fehérjeszerkezetet tartalmazó nyílt adatbázist és az ESMFold2 modellt.

Chan Zuckerberg Biohub nyílt forráskódra hozta az ESM Atlas és ESMFold2 fehérjegyűjteményt

A Chan Zuckerberg Biohub (CZ Biohub) közzétette az ESM Atlas nevű adatbázist, amely 1,1 milliárdra becsült, előre jelzett fehérjestruktúrát tartalmaz, valamint az ESMFold2 modell forráskódját és súlyait — mindezt nyílt forráskódú feltételekkel és kereskedelmi korlátozások nélkül. A Biohub közlése szerint a publikáció és az adatkiadás ugyanazon a napon jelent meg a Nature-ben.

Mi ez és mekkora a készlet?

  • Az ESM Atlasban található struktúrák száma 1,1 milliárd. Ez a bemutatott viszonyítás szerint mintegy ötszöröse a DeepMind AlphaFold adatbázisának, amelyről a forrás 200 millió bejegyzést említ.
  • Az ESMFold2 mögötti modellt a CZ Biohub szerint "milliárdos nagyságrendű" metagenomikai szekvencián képezték, olyan adathalmazon, amelyről a közlemény szerint az AlphaFold nem rendelkezett.

Mire használható és milyen eredményekről számolnak be?

A CZ Biohub azt állítja, hogy az ESMFold2-vel készített in silico tervek laborvizsgálatokban jó találati arányt mutattak rá daganatos és immunológiai célpontokra. A szervezet hangsúlyozza, hogy a modell és az adatbázis szabadon felhasználható, így nincsenek kereskedelmi felhasználást korlátozó záradékok.

A nyílt vs. zárt megközelítés kontextusa

A cikk szerint a DeepMind korábbi munkája — AlphaFold — jelentős figyelmet kapott, és az azt követő fejlesztések egy részénél a súlyok vagy eszközök zárt forrásként maradtak. A forrás erre hivatkozva azt állítja, hogy például az AlphaFold3 súlyai zárt forrásúak. A Chan Zuckerberg Biohub lépése ezzel szemben azt demonstrálja, hogy egy nagy és teljesen elérhető strukturális adatbázis, valamint egy nyílt modell megváltoztathatja a terepet: ha az eszköz és az adat szabadon hozzáférhető, a verseny fókusza arra tevődik át, ki és hogyan épít szolgáltatásokat, alkalmazásokat és további kutatást a fölé.

Miért számít ez?

A nyílt hozzáférésű, nagy méretű fehérje-struktúraadatbázis gyorsíthatja a biológiai kutatást és azt, hogy gyógyszertervezési vagy biotechnológiai innovációk alapjai széles körben elérhetővé váljanak. A CZ Biohub bejelentése — az adatmennyiség és a nyílt licenc kombinációja — azt a kérdést veti fel, hogy a modellek és adatkészletek gazdasági értékének forrása ezután inkább az lesz, aki a szolgáltatásokra és termékekre épít, nem pedig maga az alapmodell.

Összegzés

A Chan Zuckerberg Biohub ESM Atlas és ESMFold2 kiadása 1,1 milliárd előre jelzett fehérjestruktúrát és egy nyílt forráskódú struktúra-előrejelző modellt tett elérhetővé kereskedelmi korlátozások nélkül. A fejlesztés a forrás szerint nagyobb adatmennyiséget és nyílt megközelítést hoz a strukturális biológiai modellezésbe, és ezzel potenciálisan befolyásolhatja a terület jövőbeni innovációs és üzleti dinamikáját.