Eszközök

Mesterséges intelligenciával generált szöveg

Kog szoftveres optimalizációval gyorsítaná a GPU-alapú AI inferenciát

A francia Kog startup és vezérigazgatója, Gaël Delalleau azt állítja, hogy hagyományos datacenter GPU-król — például AMD MI300X és Nvidia H200 — szoftveres trükkökkel jelentősen kihozható több inferencia teljesítmény.

Kog szoftveres optimalizációval gyorsítaná a GPU-alapú AI inferenciát

A gyorsabb AI-inferencia iránti verseny erősödik: míg például a Cerebras célhardvereit a piac jó fogadtatásban részesítette az idei májusi tőzsdei debütáláskor, a francia startup Kog arra fogad, hogy a hagyományos adatközponti GPU-król még jelentős teljesítményt lehet kicsikarni szoftveres optimalizációval.

Mit mutatott a demo és milyen hardverrel?

Kog májusban került a Hacker News főoldalára egy technikai előnézettel, amely azt demonstrálta, hogy „rendkívül gyors egy-kéréssel történő dekódolás lehetséges a vállalatok által már használt szabványos adatközponti GPU-kon.” A bemutatóhoz AMD MI300X és Nvidia H200 GPU-kat használtak. A demonstráció során a cég 3 000 per-kérés token/s (tokens per second, TPS) teljesítményt ért el egy célspecifikus, most nyílt forrásúvá tett Laneformer 2B nevű modellen — amely nagyjából 2 milliárd paraméterrel rendelkezik.

A startup ígérete: szoftverrel új képességeket lehet elérni a meglévő hardveren anélkül, hogy minden ügyfélnek új eszközöket kellene vásárolnia. Ez különös vonzerőt jelent azoknak a vállalati ügyfeleknek, akiknél az inferencia sebessége és költsége kritikus szűk keresztmetszet.

Üzleti érdeklődés és célcsoportok

Gaël Delalleau, a Kog vezérigazgatója szerint a bemutatót követően több mint 200 konkrét üzleti érdeklődést regisztráltak. Elsődlegesen olyan ügyfeleket céloznak, akiket a késlekedések taszítanak el — jellemzően szakmai munkafolyamatokra épülő használati eseteknél fontos a gyors válaszidő. Delalleau szerint vannak tervezőpartnerek is, amelyek promptal generált játékokat és alkalmazásokat készítenek; számukra a gyorsabb inferencia közvetlen bevételnövelést jelentene a Kog Inference Engine (KIE) használatával.

Mi a technológiai kihívás és a cél?

A Kog azt is felmérte, hogy a piac nincs teljesen kiforrott: a potenciális ügyfelek nem állnak készen kis modellek finomhangolására. Ezért a startup az indulás óta elsősorban nagyobb modellek gyorsítására fókuszál, hogy megfeleljen a tapasztalt keresletnek. A cég középtávú célja a „30× gyorsabb LLM-inferencia” ígéretének teljesítése, de a jelenlegi, small-model demó még nagy ugrást jelent ahhoz képest, hogy a megkövetelt teljesítményt nagy nyelvi modellekre bevethessék.

Delalleau azt állítja, hogy a megközelítés működhet nagyobb LLM-ekkel is; szerinte a modern GPU-k memóriaszélessége és egyéb adottságai kinyithatók alacsony szintű optimalizációval, és a GPU-knak „fényes jövőjük” van a dekódolásban.

Módszer, csapat és korlátok

A Kog könyörtelenül alacsony szintű, hardverközeli mérnöki munkára épít: a módszer a GPU-k „fizikájának” és belső működésének megértésén alapul, valamint a bináris és assembly-szintű visszafejtésen. Delalleau saját múltja — École Polytechnique-on szerzett szilárdtestfizikai tanulmányok és korábbi, fehérkalapos (offenzív) kiberbiztonsági tapasztalatok, valamint DEFCON CTF négyes finalistaként szerzett rutinhoz — formálta ezt a megközelítést.

Ez a módszer viszont időigényes és kézi munkát igényel: Delalleau szerint minden új GPU esetén heteket vagy akár hónapokat is rászánnak, hogy részletes GPU-mérnöki kutatást végezzenek rajta. A cég jelenlegi létszáma 11 fő, ami korlátozza, hogy hányféle chipet tudnak párhuzamosan támogatni rövid távon. Hosszabb távon a Kog azt tervezi, hogy a módszertanát ügynégalapú (agent-based) folyamatokba táplálja, így több chipet és modellt tud majd automatizáltan támogatni.

Versenytársak és támogatók

A szoftveres GPU-optimalizációs ötlet nem egyedülálló: a francia ZML például hardverfüggetlen szoftvert adott ki, amely megkerüli az Nvidia CUDA-t és gyors inferenciát tesz lehetővé különböző chipeken. Delalleau szerint a Kog inkább a Stanford University laborja, a Hazy Research munkájához hasonlítható, mivel még mélyebb, GPU-gyorsításra irányuló kutatással foglalkozik.

A vállalatot a Scaleway támogatja, és a finanszírozásban részt vett Franciaország állami befektetője, a Bpifrance, valamint a French Tech 2030 program. A seed-kör egyik társkirovója a Varsity VC volt — a korábbi Stribe társalapító Kamel Zeroual kockázati befektetőként vett részt a körben.

Következő lépések és finanszírozás

A Kognak demonstrálnia kell, hogy a megközelítése érdemben működik nagyobb LLM-eken. Delalleau azt mondta, hogy a cég első nagy modelljének 10× gyorsítását szeptemberre várja; ha ezt teljesítik és meg tudják mutatni az ügyfél-trakciót, az segíthet a Series A kör megszervezésében.

Összességében a Kog pragmatikus, hardverközeli szoftvermérnökségre építve kívánja gyorsabbá tenni a GPU-alapú inferenciát — a megközelítésnek vannak korlátai és sok kézi munka szükséges hozzá, de ha a módszer nagy LLM-ekre is skálázható, az jelentős költség- és sebességelőnyt hozhat a vállalati ügyfelek számára.