A General Intuition vezetője, Pim de Witte azt állítja, hogy a robotika területén hamarosan hasonló átalakulás következik be, mint amit a nyelvi alapmodellek, például az OpenAI GPT‑sorozata, Claude vagy Llama hozott a természetes nyelvfeldolgozásban. Míg korábban sok cég egyedi, feladatspecifikus modelleket épített és nagy mennyiségű tényleges adaton tanította azokat, ma a legtöbben általános célú alapmodellekből indulnak ki, és azokat finomhangolják vagy promptolással igazítják saját igényeikhez.
De Witte a TechCrunchnak egy Equity podcastban elmondta, hogy szerinte az „embodied AI” — azaz a térben mozgó és fizikai környezettel kölcsönhatásba lépő mesterséges intelligencia — hasonló pályát fog bejárni. Ahelyett, hogy óriási mennyiségű valós, robotikus adatot gyűjtenének különféle testfelépítésekhez és környezetekhez, szerinte jobb minőségű, általánosítható adatkészletekre érdemes támaszkodni, amelyekből olyan alapmodellek születhetnek, amelyek átviszik a mozgásra és kölcsönhatásra vonatkozó intuíciót különböző helyzetekbe.
„Most sok vállalat nagyon specializált munkát végez, egyedi megtestesülésekre, egyedi környezetekre és egyedi robotokra koncentrálva” — mondta de Witte. Szerinte ezek a projektek hamarosan részben feleslegessé válnak majd az általános modellek megjelenésével. A General Intuition saját fejlesztése már olyan szintű általánosítást kínál, amely alapfokú tér‑időbeli következtetést tesz lehetővé, és ennek köszönhetően a valós adatok gyűjtésének mennyisége drasztikusan csökkenhet: „a valóságban valójában csak néhány percre van szükség” — fogalmazott.
A cég saját alapmodelljét milliónyi órányi videojáték‑adaton képezte, amelyek között nyomon követték például, hogy a játékos mikor és melyik gombot nyomta meg egy kontrolleren. De Witte és a vezető befektetőjük, Vinod Khosla szerint ezek az akcióadatok kulcsfontosságúak ahhoz, hogy a modell emberhez hasonló, tér‑időbeli intuíciót fejlesszen ki.
A General Intuition a vállalati elmélet mögé tette a pénzt is: a startup a múlt hónapban 320 millió dollárt gyűjtött be, miközben a cégértékelése 2,3 milliárd dollárra emelkedett. A cég demonstrálta, hogy a modell képes hosszú időn keresztül videojátékokat játszani, és egyúttal képes egy négylábú robotot is meghajtani — utóbbit mindössze nyolc percnyi valós robotikai adattal történő finomhangolás után.
De Witte szerint különösen figyelemre méltó volt, hogy a robot a frontkamera képe alapján „zero‑shot” módon működött az irodai környezetben, egyéb szenzorok nélkül, miközben dinamikusan mozgó tárgyak és emberek is megjelentek a térben. Ez a váratlan teljesítmény szerinte előrevetíti, hogy milyen irányba halad a terület.
A General Intuition végső célja nem az, hogy saját robotokat építsen, hanem hogy fizikai AI‑hoz készült alapmodellként szolgáljon más robotikai cégek számára. Ahogy de Witte fogalmazott: „nem fogunk önvezető autó‑vállalatot építeni. Inkább tízszer könnyebbé tesszük a következőnek, hogy önvezető autó‑vállalatot építsen.”
Miért számít ez?
Ha a megközelítés sikeres, kevesebb szükség lesz hatalmas mennyiségű valós robotikai adat gyűjtésére minden egyes új platformhoz. Ez gyorsíthatja a fejlesztést, csökkentheti a költségeket, és lehetővé teheti, hogy több szereplő építsen komplex mozgást és interakciót igénylő alkalmazásokat általános alapmodellekre támaszkodva.



