Google bejelentette a Gemini Robotics 2‑t, amely a vállalat szerint az új generációs, adaptív fizikai intelligencia rétege: multimodális modellek sorát, amelyek látás és nyelv alapján motoros vezérléssé alakítják az utasításokat. A rendszer teljes testű irányítást, fejlettebb finommozgásokat és többrobotos együttműködést célzó képességeket kínál.
Mire képes a rendszer?
A Gemini Robotics 2 célja, hogy a robotok minden mozdulatot végiggondoljanak, és ezzel széles feladatkört hajtsanak végre. A bemutatott példák szerint humanoidokkal egyes háztartási feladatok — például egy szobában rendrakás — elvégezhetők úgy, hogy a robot jár, lehajol, nyújtózik és tárgyakat mozgat. A rendszer képes több robot együttműködésére is, hogy a feladatokat gyorsabban vagy hatékonyabban oldják meg.
A három modell
Google három, különböző célokra fejlesztett modellt emel ki:
-
Gemini Robotics 2: a cég legfejlettebb vision–language–action (VLA) modellje, amely látás- és nyelvi bemeneteket alakít motoros vezérléssé. Állítása szerint képes teljes humanoidok (lábaktól az ujjakig) és kétkarú robotok irányítására, valamint fejlettebb fogási és manipulációs képességekre kezetek és gripperek esetén.
-
Gemini Robotics ER 2: a legképzettebb embodied reasoning (ER) modell, egy vision–language modell, amely ügynökként működik: kommunikál az emberekkel, megérti a fizikai környezetet és többlépéses, percekig tartó feladatokat tervez és követ. Ez a modell mostantól támogatja a robotok közötti csapatmunkát is.
-
Gemini Robotics On‑Device 2: a hatékonyságra optimalizált VLA, amely helyben, hálózati kapcsolattól függetlenül fut a robot eszközén. A modell natívan több testfelépítést támogat, és a Gemini Robotics 1.5‑ből örökölt „motion transfer” technikák révén néhány óra alatt — tipikusan kevesebb mint 200 példával — képes adaptálódni új robottestekhez.
Humanoidok teljes testű mozgása
A fejlesztés kiterjeszti a korábbi, felsőtestre fókuszáló képességeket: a Gemini Robotics 2 immár az egész humanoid testet képes vezérelni. A példában az Apptronik Apollo 2 humanoid robotnak megadott utasítás — „tedd a locsolókannát a zöld kosárba az alsó polcon” — feldolgozásától a járáson át a pontos elhelyezésig a rendszer végigvezeti a robotot. A vállalat megjegyzi, hogy a mozgássebességben további javulásra van szükség, de a teljes testű koordináció fontos előrelépés a komplex, valós feladatok felé.
Fejlett ujj‑ és gripper‑dexteritás
A Gemini Robotics 2 a finom manipulációban is előrelépést hoz: a SharpaWave ötujjas, 22 szabadságfokú kéz vezérlésére is képes az Apollo 2‑n, olyan finom műveletekhez, mint csomók kötése vagy egy ziplock zacskó lezárása. Ugyanakkor kétujjas párhuzamos grippereken, például a Franka Duo platformon is tud bonyolult, precíz feladatokat végezni (például szoros csomagolás). A cég továbbra is dolgozik a pontosság és sebesség további javításán.
Többlépéses feladatok és többrobotos együttműködés
A Gemini Robotics ER 2 a magas szintű „agyként” működik: feldolgozza a felhasználói utasításokat, megfigyeli a terepet, megtervezi a szükséges lépéseket, koordinálja a VLA‑t a végrehajtáshoz, és nyomon követi a haladást. A frissítés lehetővé teszi, hogy robotok megbízhatóbban hajtsanak végre percekig tartó, több száz döntést igénylő feladatsorokat; a modell most jobban felismeri, mikor kezdődik és zárul egy feladat, és képes kulcsesemények pontos időzítésére.
Ezen túlmenően bevezetnek többrobotos együttműködést: különböző típusú robotok képesek kommunikálni és együttműködni olyan munkafolyamatok megoldásában, amelyeket egyedül egy robot nem tudna ellátni.
Helyi modellek gyors adaptációja
A Gemini Robotics On‑Device 2‑t kifejezetten hálózat nélküli környezetre optimalizálták. A modell többféle robottesthez alkalmazható rövid adaptációs idővel: a bemutatott esetekben új kétkarú robottestekhez általában néhány óra és kevesebb mint 200 példa elegendő volt. A példák között szerepelnek a Dexmate, SO101 és Trossen platformok különböző feladatokon.
Biztonság és felelős fejlesztés
A Google hangsúlyozza, hogy a biztonság alapvető elv a robotikai kutatásban. A Gemini Robotics 2 új biztonsági képességeket tartalmaz a valós világ bizonytalanságával és az emberrel való közeli együttműködéssel kapcsolatban. Bevezetik az ASIMOV‑Agentic benchmarkot, amely az ügynöki biztonsági koordinációt és a bizonytalanság kezelését méri — például hogy az embodied reasoning ügynök képes‑e visszautasítani egy veszélyes eszközhívást a VLA részéről, vagy képes‑e előre jelezni, hogy egy feladat végrehajtható‑e, és mikor kell emberi beavatkozást kérni.
A Gemini Robotics ER 2 állítólagos teljesítménye a biztonsági korlátok és az emberi közelség felismerése terén a cég szerint a legjobb eddig; képes észlelni embereket a közelben, meghívni biztonsági eszközöket és vészleállást kezdeményezni, ha valaki túl közel kerül.
Hozzáférés és további információk
A Gemini Robotics ER 2 elérhető a Google AI Studio felületén és privát előnézetben a Gemini Enterprise Agent Platformon. A VLA és On‑Device modellek korai hozzáférést kapó partnerek számára érhetők el. A Google fejlesztői blogján részletes útmutatót írtak arról, hogyan lehet ezeket a modelleket saját hardverre vinni. További technikai részletek a Gemini Robotics 2: Safety Technical Reportban találhatók.
Mit jelent ez a jövőre nézve?
A Google szerint a Gemini Robotics 2 mérföldkő a fizikai világban működő, általános célú mesterséges intelligencia felé vezető úton: a cél a többfeladatos, emberrel együttműködő robotika támogatása, amely komplex problémákat tud megoldani a valós környezetben.



