Modellbevezetés

Egy startup szerint a robotika hamarosan megkapja a ChatGPT-jelenséget

A hír főszereplője a General Intuition és ügyvezetője, Pim de Witte, aki azt állítja, hogy az embodied AI a nagy nyelvi modellekhez hasonló alapmodell-forradalmat fog megélni.

Egy startup szerint a robotika hamarosan megkapja a ChatGPT-jelenséget

A General Intuition vezetője, Pim de Witte azt állítja, hogy a robotika területén hamarosan hasonló átalakulás következik be, mint amit a nyelvi alapmodellek, például az OpenAI GPT‑sorozata, Claude vagy Llama hozott a természetes nyelvfeldolgozásban. Míg korábban sok cég egyedi, feladatspecifikus modelleket épített és nagy mennyiségű tényleges adaton tanította azokat, ma a legtöbben általános célú alapmodellekből indulnak ki, és azokat finomhangolják vagy promptolással igazítják saját igényeikhez.

De Witte a TechCrunchnak egy Equity podcastban elmondta, hogy szerinte az „embodied AI” — azaz a térben mozgó és fizikai környezettel kölcsönhatásba lépő mesterséges intelligencia — hasonló pályát fog bejárni. Ahelyett, hogy óriási mennyiségű valós, robotikus adatot gyűjtenének különféle testfelépítésekhez és környezetekhez, szerinte jobb minőségű, általánosítható adatkészletekre érdemes támaszkodni, amelyekből olyan alapmodellek születhetnek, amelyek átviszik a mozgásra és kölcsönhatásra vonatkozó intuíciót különböző helyzetekbe.

„Most sok vállalat nagyon specializált munkát végez, egyedi megtestesülésekre, egyedi környezetekre és egyedi robotokra koncentrálva” — mondta de Witte. Szerinte ezek a projektek hamarosan részben feleslegessé válnak majd az általános modellek megjelenésével. A General Intuition saját fejlesztése már olyan szintű általánosítást kínál, amely alapfokú tér‑időbeli következtetést tesz lehetővé, és ennek köszönhetően a valós adatok gyűjtésének mennyisége drasztikusan csökkenhet: „a valóságban valójában csak néhány percre van szükség” — fogalmazott.

A cég saját alapmodelljét milliónyi órányi videojáték‑adaton képezte, amelyek között nyomon követték például, hogy a játékos mikor és melyik gombot nyomta meg egy kontrolleren. De Witte és a vezető befektetőjük, Vinod Khosla szerint ezek az akcióadatok kulcsfontosságúak ahhoz, hogy a modell emberhez hasonló, tér‑időbeli intuíciót fejlesszen ki.

A General Intuition a vállalati elmélet mögé tette a pénzt is: a startup a múlt hónapban 320 millió dollárt gyűjtött be, miközben a cégértékelése 2,3 milliárd dollárra emelkedett. A cég demonstrálta, hogy a modell képes hosszú időn keresztül videojátékokat játszani, és egyúttal képes egy négylábú robotot is meghajtani — utóbbit mindössze nyolc percnyi valós robotikai adattal történő finomhangolás után.

De Witte szerint különösen figyelemre méltó volt, hogy a robot a frontkamera képe alapján „zero‑shot” módon működött az irodai környezetben, egyéb szenzorok nélkül, miközben dinamikusan mozgó tárgyak és emberek is megjelentek a térben. Ez a váratlan teljesítmény szerinte előrevetíti, hogy milyen irányba halad a terület.

A General Intuition végső célja nem az, hogy saját robotokat építsen, hanem hogy fizikai AI‑hoz készült alapmodellként szolgáljon más robotikai cégek számára. Ahogy de Witte fogalmazott: „nem fogunk önvezető autó‑vállalatot építeni. Inkább tízszer könnyebbé tesszük a következőnek, hogy önvezető autó‑vállalatot építsen.”

Miért számít ez?

Ha a megközelítés sikeres, kevesebb szükség lesz hatalmas mennyiségű valós robotikai adat gyűjtésére minden egyes új platformhoz. Ez gyorsíthatja a fejlesztést, csökkentheti a költségeket, és lehetővé teheti, hogy több szereplő építsen komplex mozgást és interakciót igénylő alkalmazásokat általános alapmodellekre támaszkodva.