Modellbevezetés

Mesterséges intelligenciával generált szöveg

PrismML kicsinyített LLM-je lehetővé teszi az erős mesterséges intelligencia helyi futtatását

A főszereplő a PrismML nevű startup, amelyet kaliforniai kutatók alapítottak és Babak Hassibi vezeti, célja pedig a képességes, érvelő nagy nyelvi modellek radikális tömörítése.

PrismML kicsinyített LLM-je lehetővé teszi az erős mesterséges intelligencia helyi futtatását

A Caltech-kutatókból alakult PrismML egyre nagyobb figyelmet érdemel a mesterséges intelligencia közösségben — nem elsősorban a befektetések miatt (eddig egy 22,25 millió dolláros seed-körük volt), hanem a technikai csapat és az általuk fejlesztett megoldások miatt. A vállalat azon a tézisen dolgozik, hogy a magas teljesítményű, következtetni képes nagy nyelvi modellek (LLM-ek) nem feltétlenül kell, hogy óriásiak legyenek.

A PrismML célja olyan érvelő LLM-ek létrehozása, amelyek elférnek személyi számítógépeken és akár csúcskategóriás okostelefonokon is. A cég csütörtökön bemutatta a Bonsai 2 27B modellt, amely az Alibaba széles körben használt, nyílt forráskódú Qwen3.8 27B modelljét tömöríti le 5,9 GB-ra — ez a forráshoz képest körülbelül 9–10-szeres memóriacsökkenést jelent. A PrismML vezérigazgatója, Babak Hassibi azt nyilatkozta, hogy a vállalat nem kívánta kommentálni a sajtóban felmerült tárgyalási pletykákat az Apple-lel kapcsolatban.

A PrismML-t Caltech-kutatók alapították; a cég vezetője Babak Hassibi, aki a Caltech professzora és a tömörítés technológiák szakértője. Tanácsadóként csatlakozott Ion Stoica is, aki a Databricks társalapítója és a Berkeley Sky Computing Lab igazgatója. A startupot olyan befektetők támogatják, mint a Khosla Ventures, a Cerberus Capital és maga a Caltech.

A tömörítés és teljesítmény

A PrismML állítása szerint a Bonsai 2 modell teljesítménye nagyon közel áll az eredetihez: a cég közlése szerint a Bonsai 2 az aggregate benchmarkokban a Qwen-modell teljesítményének 98%-át éri el. Ez javulás a márciusi első Bonsai kiadáshoz képest, amely 95%-ot ért el. A korábbi, nagyobb modell letöltéseit a vállalat szerint több mint 11 millió alkalommal hajtották végre, míg a PrismML még kisebb modellei további 2,6 millió letöltést gyűjtöttek.

Hassibi szerint a tömörítésnek valószínűleg mindig lesz némi hatása a modellek teljesítményére, de a 2–5 százalék körüli különbség a benchmarkokban a gyakorlati felhasználásban nem feltétlenül jelent jelentős romlást. Emellett a modellt futtató szoftveres keret (a „harness”) is jelentősen befolyásolja a pontosságot.

A technika: ternáris súlyok

A PrismML megközelítése a modell „súlyainak” — azaz a betanulás során tárolt információnak — a drasztikus megkicsinyítése. Míg tipikusan minden súly 16 bitet igényel, a PrismML ternáris súlyokat alkalmaz, amelyek csak három lehetséges értéket vesznek fel: +1, −1 vagy 0. A súlyok tárolásához szükséges értékek egyszerűsítésével a modell fájlmérete jelentősen csökken; a projekt részleteit a cég Hugging Face-oldalán is publikálta.

Továbblépés nagyobb modellek felé

A PrismML következő célja, hogy a tömörítési eljárást még jóval nagyobb modellekre alkalmazza. Hassibi azt mondta, hogy a következő néhány hónapban reményeik szerint több száz milliárd paraméteres nagyságrendű modelleket fognak kiadni, és szerinte ilyen modelleknél könnyebb megőrizni az intelligenciát tömörítés után, mert a nagyobb méretben több „tartalék” van a tömörítésre.

Verseny és piaci hatás

A PrismML nem az egyetlen cég, amely LLM-tömörítéssel foglalkozik; például a Multiverse Computing is ilyen irányban dolgozik, és több tőkét gyűjtött be. A PrismML azonban azt hangsúlyozza, hogy az ő módszerével a teljesítményveszteség minimális.

Ion Stoica szerint az ilyen technológiák fontos változást hoznak: lehetővé teszik, hogy fejlett modellek helyben, a felhasználó eszközén fussanak, ami egyszerre jelent alacsonyabb költséget és jobb adatvédelmet, mivel a számítás nem a felhőbe kerül továbbításra.

Összegzés

A PrismML Bonsai 2 27B megjelenése fontos lépésnek tűnik az LLM-ek helyi futtatásának irányába: a Qwen3.8 27B 5,9 GB-osra zsugorítása és a benchmarkteljesítmény közel 98%-os megőrzése azt mutatja, hogy a modellek jelentős csökkentése még használható pontosság mellett is lehetséges. A következő hónapokban kiderül, hogy a módszer hogyan skálázódik a több száz milliárd paraméteres modellekre, és milyen hatása lesz a felhasználói privátra és a számítási költségekre, ha egyre több modellt lehet helyben futtatni.