A Weka bejelentette a NeuralMesh 6 szoftverplatformot és saját tervezésű hardverét, a Wekapod 3-at, amelyek együttesen azt a célt szolgálják, hogy a drága GPU-memória korlátját olcsóbb NAND-flash tárolóval enyhítsék. A vállalat Augmented Memory Gridnek nevezett megközelítése szerint a NAND-flash aggregálva GPU-memória-szerűen viselkedhet, jóval alacsonyabb költségen.
Miért számít ez?
A GPU-memória a legdrágább és leggyorsabban fogytán lévő erőforrás a termelési AI-rendszerekben. Hosszú kontextusablakok és többszörös beszélgetési fordulók esetén a modellek gyakran újraszámolják azt az információt, amelyet korábban már feldolgoztak, ami szükségtelenül növeli a GPU-memória és a számítási kapacitás igényét. Weka megközelítése azt az ötletet képviseli, hogy a GPU-memória helyett kiegészítő, olcsóbb tárolási réteget használjanak.
Mely szervezeteknek lehet haszna?
A megoldás különösen releváns azoknak a szervezeteknek, amelyek már méretes AI-működtetéssel rendelkeznek vagy gyors használatbeli növekedésre számítanak: vállalati copilotok, ügyfélszolgálati ügynökök, szoftvermérnöki asszisztensek és hosszú kontextusú visszakereső rendszerek. Kisebb telepítések esetén a rövidtávú előny kevésbé lehet látványos, ha a GPU-k kihasználtsága még nem jelent korlátot.
Újdonságok a NeuralMesh 6-ban
NeuralMesh 6 négy, kifejezetten a Weka szerint versenypályán hátrányt okozó hiányosságot célzó képességet ad hozzá:
-
Komponálható és virtuális multi-tenancy. Komponálható klaszterek (composable clusters) hardver-szintű izolációt biztosítanak anchor bérlőknek (dedikált CPU, memória és tároló). A virtuális multi-tenancy a Weka RDMA-hálóján keresztül hálózati szintű izolációt kínál, több mint 1 000 bérlőig klaszterenként, és a szolgáltatás előkészítése 30 percnél rövidebb idő alatt megtörténhet. Egyetlen klaszter, amely 50 komponálható klasztert futtat, elvileg akár 50 000 bérlőt is képes kiszolgálni.
-
Egységes fájl- és objektumtárolás. A hagyományos rendszerek általában külön pályákat tartanak fenn fájl- és objektum-hozzáférésre (a fájlútvonalat például edzés- és finomhangolási csövek használják, az objektumútvonalat pedig az S3-kompatibilis inference és felhőnatív eszközök). Ennek tipikus következménye a dupla adattárhely és a fordítóréteg. Weka szerint a NeuralMesh 6 ugyanazon fizikai adaton egyszerre teszi lehetővé a fájl- és objektum-hozzáférést fordító réteg nélkül, tehát nincs második másolat. Liran Zvibel, a Weka társalapító-vezérigazgatója a nem-AWS GPU-felhőket célozza különösen, neveket említve: Lambda, Nebius, G42 és CoreWeave, és szerinte az ilyen szférában nagyjából két nagyságrenddel jobb teljesítményt nyújt a hagyományos S3-hoz képest, valamint kapacitás-alapú árazást alkalmaz API-alapú díjazás helyett.
-
Metaadat-első replikáció. A célkörnyezetek böngészhetők lesznek még az előtt, hogy a teljes adatmásolat megérkezne; az adatok csak akkor töltődnek be (hydrate), amikor ténylegesen hozzáférnek hozzájuk. Zvibel szerint korábban a teljes adatátvitel napokig vagy hetekig tartott, szélsőséges esetben akár egy hónapot is, míg a NeuralMesh 6 segítségével az ügyfelek új GPU-erőforrást kapva nagyjából egy órán belül működésbe állhatnak.
-
AlloyFlash és Always-On adatredukció. A rendszer keveri a TLC és QLC típusú NAND-t egy klaszteren belül: a rövidebb késleltetésre és tartósságra érzékeny munkaterheléseket automatikusan a TLC-re irányítja, míg a tömegtárolási feladatokat a költséghatékony QLC-re helyezi, csökkentve a terabájtköltséget teljesítményveszteség nélkül a kritikus munkák esetén. Emellett az adatredukció (data reduction) most alapértelmezettként fut, nem opcionális szolgáltatásként.
Az Augmented Memory Grid és a kontextus-probléma
A multi-turn és hosszú kontextusú interakciók során a költség fő forrása a prefill fázis újraszámolása: minden kérés kettő szakaszra bontódik. A prefill kiszámítja az attention mechanikát, ami számításigényes; a decode pedig viszonylag könnyű. Többszörös fordulókban (például chat vagy kódolási munkameneteknél) minden új forduló újraindíthatja a prefill-t a korábbi bemenetekre, hacsak azt nem cache-elik.
Zvibel példájával élve: ha 10 forduló van, előfordulhat, hogy egymásra íródva százszor számolnak túl; 20 forduló esetén ez négyszázszoros átszámolást eredményezhet. Weka állítása szerint két nagyságrenddel több NAND-ot lehet alkalmazni, mint amit meg lehetne engedni megosztott memóriaformában, és így képesek 100%-ban cache-elni a pre-calculated tokeneket — így a rendszernek nem kell újraszámolnia azokat.
Versenykörnyezet és értékelési tanácsok
Az elmúlt másfél évben több nagy tárhelyszállító (Dell, NetApp, Pure Storage, VAST) is az AI-infrastruktúra felé pozícionálta magát. NAND Research vezető elemzője, Steve McDowell szerint a Weka (és VAST) azon kevés, AI-native adatcégek közé tartozik, amelyek már a kezdetektől e problémákat célozzák. McDowell külön kiemelte az Augmented Memory Gridet Weka technikai előnyeként, valamint azt, hogy Weka szerződéses garanciát vállal az adatredukciós állításaira — ezt kevesen értékelik eléggé.
McDowell tanácsa a vevőknek az volt, hogy vizsgálják meg alaposan, mire képesek a beszállítók valós környezetben: aki konkrét, hasonló terhelésekkel és mérettel működő referenciákat tud felmutatni, annál érthetőbb az ajánlat valódi értéke. Ha egy szállító nem tud ehhez példákat adni, az figyelmeztető jel lehet.
Összegzés
A Weka NeuralMesh 6 és a Wekapod 3 együtt egy olyan megközelítést kínál, amely olcsó NAND-flashre építve próbálja csökkenteni az AI-inferencia költségeit és gyorsítani az új munkaterhelések bevezetését. A megoldás előnyei különösen azoknál a vállalatoknál érvényesülnek, ahol a GPU-memória kihasználtsága már korlátot jelent, illetve ahol hosszú kontextusú és többszörös fordulós interakciók jellemzők.



