Kutatás

Mesterséges intelligenciával generált szöveg

Startupok újragondolják a transzformerek korlátait a következő generációs LLM-ekért

A cikk főszereplői több feltörekvő startup, köztük Subquadratic, Manifest AI, Liquid AI, Inception és Pathway, amelyek új megközelítésekkel próbálják feloldani a transzformer alapú nagy nyelvi modellek (LLM) korlátait.

Startupok újragondolják a transzformerek korlátait a következő generációs LLM-ekért

2017 nyarán a Google kutatói megjelentették az "Attention Is All You Need" című tanulmányukat, amely bemutatta a transzformerek nevű neurális hálózati architektúrát. Ez különösen hatékonynak bizonyult hosszú szekvenciák — elsősorban szövegek — feldolgozásában, és azóta minden nagyobb nagy nyelvi modell (LLM) mögött ez az alaptechnológia áll. A Subquadratic társalapító és vezérigazgatója, Justin Dangel szerint „az egész AI-ipar a transzformerekre épül".

Ugyanakkor a transzformerek korlátai egyre látványosabbá válnak. Sok új fejlesztés — például a speciális következtetési modellek vagy a nagy bemenetek kezelésére kitalált megoldások — nem a transzformerek természetes kiterjesztései, hanem inkább megoldások a technológia alapvető hiányosságaira. A kérdés egyre több kutató és mérnök számára az, hogy mi jöhet a transzformerek után: az LLM-ek nem fognak eltűnni, de a felépítésük módja változhat. (A MIT Technology Review az új generációt LLMs+ névvel említette a 2024-es listáján.)

A probléma magja: a sűrű attention számítási költségei

A transzformerek erőssége a sűrű attention mechanizmusban rejlik, amely egy szövegrész jelentését számok sorozataként kódolja úgy, hogy minden token páron elvégez egy összehasonlításhoz hasonló műveletet. Ez nagyon pontos jelentésleképezést tesz lehetővé, de a számítási igény gyorsan nő a bemenet hosszával: egy 10 000 szavas dokumentum feldolgozása például körülbelül 50 millió szorzást igényelhet. Ez az egyik fő oka annak, hogy az LLM-ek nagy energiát és számítási kapacitást fogyasztanak.

A költségek jelentősek: Greg Brockman, az OpenAI elnöke szerint a vállalat idén körülbelül 50 milliárd dollárt költ számítástechnikára. Az International Energy Agency (IEA) előrejelzése szerint a 2030-ra a szerverközpontok által fogyasztott villamosenergia mennyisége megduplázódhat.

Továbbá a transzformerek gyengén kezelik a nagyon nagy mennyiségű információ egyidejű követését — azaz a kontextusablakok bővítése nehéz. Pedig ha az LLM-eknek összetettebb feladatokat kell végrehajtaniuk, nagyobb bemeneteket kell feldolgozniuk (például egész dokumentumtárakat, teljes kódalapokat, vagy más LLM-ek kimenetét). A következtetési modellek is növelik a feldolgozandó adat mennyiségét azáltal, hogy „saját maguknak írnak jegyzeteket" (chain of thought), majd ezeket újra feldolgozzák.

A transzformerek tehát mára szűk keresztmetszetté váltak: erősségük egyben korlát is.

Négy új megközelítés a transzformerek korlátainak leküzdésére

Az alábbiakban négy, startupok által képviselt megközelítést mutatunk be, amelyek gyorsabb, hatékonyabb és bizonyos esetekben képességekben eltérő LLM-ekhez vezethetnek.

1) Az attention újragondolása: sparse attention és retention

Az egyik nyilvánvaló irány az attention mechanizmus megváltoztatása. A sűrű attention helyett alkalmazott sparse attention csak egy részének számítását végzi a tokenpároknak, ezzel radikálisan csökkentve a számításigényt. Bár az elmúlt években sok sparse attention megoldás született, egyik sem ért fel a sűrű attentiont jellemző jelentésleképezéshez — eddig.

A Miami székhelyű Subquadratic azt állítja, hogy megalkotta az első olyan sparse attention megoldást, amely bizonyos feladatokban — például keresés és kódolás — versenyképes a vezető LLM-ekkel. A cég SubQ nevű modellje a bemenet alapján dinamikusan dönt arról, mely szavak fontosak. A vállalat szerint több ezren iratkoztak fel várólistájukra, és hamarosan szélesebb körben elérhetővé teszik a modellt; iparági szereplők között azonban van szkepticizmus.

A San Francisco-i Manifest AI más irányból közelít: nem csak az attentiont ritkítja, hanem teljesen más mechanizmust vezet be, amit power retentionnek neveznek. Ez a technika csak a legrelevánsabb információkat tárolja egy adott feladathoz, és gördülő összegzést ad a kontextusból, így ahogy új információ érkezik, a kevésbé fontos adatok kiesnek. A retention elve nem újkeletű, de a Manifest AI szerint ők frissítették és skálázhatóvá tették az ötletet, minimális utóképzéssel átalakítható meglévő transzformer alapú modellekhez. Demonstrációként a cég a nyílt forráskódú StarCoder kódoló LLM-et PowerCoderre alakította, és kiadtak egy Brumby nevű modellt, amelyről azt állítják, hogy vetekszik egyes Alibaba Qwen verziókkal.

A Manifest AI célja, hogy a power retention legyen az alapértelmezett megoldás, amikor nagyon nagy mennyiségű adat feldolgozására van szükség — például hosszú videók elemzése vagy több hétig működő ágensek esetén.

2) Modellek kisebbre és rugalmasabbra tervezése: liquid neural networks

A Liquid AI, amely az MIT-ből kivált spinout és Cambridge, Massachusetts székhelyű cég, nem vált meg teljesen a transzformerektől, hanem azokat saját fejlesztésű liquid neural hálózatokkal kombinálja, és ezt a hibridet LFMs-nek (liquid foundation models) nevezi.

A Liquid AI modellei lényegesen kisebbek és energiahatékonyabbak a tipikus LLM-eknél: olyan autógyártóknak építenek modelleket (például Mercedes), amelyek a járműben található kis chipeken futnak. Legújabb modelljeik Raspberry Pi-n is képesek futni. A cég modelljei ingyenesen elérhetőek minden olyan szervezet számára, amelynek éves árbevétele kevesebb mint 10 millió dollár; Ramin Hasani vezérigazgató szerint a letöltések száma közel 34 millió.

A liquid neural hálózatokat féregagyak inspirálták; ez a megközelítés lehetővé teszi, hogy a modell dinamikusan alkalmazkodjon új információkhoz — azaz tanulhasson működés közben, ellentétben a transzformerekkel, amelyek viselkedése a betanítás után rögzített. A Liquid AI legújabb LFMs-ei hibrid struktúrák: körülbelül 20% transzformer és 80% liquid hálózat. A cég egy másik AI-ja segít optimalizálni az ilyen architektúrák arányát és konfigurációját.

Hasani szerint a transzformerek csak a kezdetet jelentik: az emberi agy 20 wattal működik, és ennél sokkal energiatakarékosabb, innovatívabb megoldások felé lehet elmozdulni.

3) Egy menetben generált szöveg: diffúziós LLM-ek

A legtöbb LLM szó vagy token alapon, egymás után generálja a kimenetet, ami emberi nyelvhasználat szempontjából logikus, de számítógépes szempontból nem hatékony. Gyorsabb és olcsóbb lenne az egész mondat vagy bekezdés egyszerre történő előállítása.

Az Inception, a Palo Alto-i startup, erre a megközelítésre épít: diffúziós technikát alkalmaz LLM-ekhez. A diffúziót eddig főleg képek és videók generálására használták, ahol a modell egy véletlenszerű pixelrácsból indulva egyszerre dolgozik az összes pixelen, hogy képpé alakítsa azt. Hasonló elvet alkalmazva Inception modelljei véletlenszerű szósorozatból hoznak létre koherens mondatokat: a transzformereket továbbra is használják a jelentés kódolására, de a szövegblokk egyszerre való előállítása sokkal több token előrejelzését teszi lehetővé egyidejűleg, így gyorsabb és költséghatékonyabb működést eredményez.

Az áttörés matematikai kihívása az volt, hogy a képeknél működő folyamathoz képest a szóválasztások között nincs „köztes állapot” (például a "cat" és a "dog" között nincs fokozatos átmenet). Stefano Ermon, az Inception társalapítója és vezérigazgatója, aki a Stanford kutatója is, 2024-ben munkatársaival kidolgozta a matematikai alapokat, és egy diffúziós modellt tanítottak, amely megegyezett a GPT-2 teljesítményével, de tízszer gyorsabb volt. Inception szerint legújabb modelljük, Mercury 2, egyes 2023-as GPT-4 verziókkal vetekszik teljesítményben, miközben ismét tízszer gyorsabb.

Ermon szerint a releváns mérőszám az „intelligencia dolláronként”: a sebesség és a költség számítanak, és a diffúziós megközelítés skálázhatósága ígéretes. Google is kísérletezik hasonló irányokkal (Diffusion Gemma), de Inception szerint ez inkább megerősítés, mint verseny.

4) Túl a szavakon: állapottér-modellek

A Pathway, szintén Palo Altóból, radikálisabb megoldást kínál: célja, hogy felszabadítsa az LLM-eket a nyelvi megkötések alól. A cég Dragon Hatchling nevű modellje a transzformerek attention mechanizmusát állapottér-matematikára cseréli. Az állapottér-infrastruktúra ahelyett, hogy tokenenként kódolna, absztraháltabb reprezentációkba sűríti az információt, ami lehetővé teszi nem-szöveges típusú következtetések utánzását.

Pathway legfigyelemreméltóbb eredménye eddig, hogy a Dragon Hatchling kiváló teljesítményt ért el egy több mint 250 000 nagyon nehéz sudoku feladványt tartalmazó benchmarkon — a modellel több mint 97%-ot megoldottak, míg számos vezető LLM a top laboroktól egyiket sem tudta megoldani. A cég szerint ez azt mutatja, hogy a nyelvalapú reprezentációk nem feltétlenül alkalmasak bizonyos típusú problémákra, például a sudokura, sakkra vagy matematikai következtetésekre.

A Pathway társalapító-vezérigazgatója, Zuzanna Stamirowska szerint a transzformerek „mérnöki kényelmet” jelentettek, amely köré vallás épült, de nem érdemes úgy gondolni, hogy nem jöhet új áttörés. Bár egy hagyományos LLM elolvashatna könyveket a sudoku megoldásáról és kódot írhatna rá, a cél olyan modellek építése, amelyek többek a „könyvtudásnál” — azért, hogy olyan problémákat is meg tudjanak oldani, amelyekre nincs kész recept.

Mit jelent mindez a jövőre nézve?

Egyes startupok és kutatói csapatok más-más utat választanak: a sparse attention dinamikus alkalmazásától a retention alapú emlékezeten át a hibrid folyékony hálózatokig és az egyszerre generáló diffúziós modellekig — valamint a nyelvet meghaladó állapottér-alapú megközelítésekig. Mindegyik célja ugyanaz: csökkenteni a számítási és energiaigényt, bővíteni a feldolgozható kontextust és lehetővé tenni olyan következtetéseket, amelyeket a hagyományos transzformerek kevésbé hatékonyan tudnak elvégezni.

Némelyik megoldás ígéretes eredményeket mutat, de a kísérletek közben sok szereplő elbukhat. A tét azonban magas: ha egy vagy több ilyen megközelítés beválik, jelentősen megváltoztathatja az LLM-ek építésének gazdaságosságát és képességeit a következő években.