A Google bemutatta a Gemini Robotics ER 2-t, a cég legújabb „embodied reasoning” (testhez kötött érvelés) modelljét, amelyet fizikai környezetben dolgozó robotok magas szintű irányítójának szánnak. A modell célja, hogy a robotok ne csak térbeli következtetésre legyenek képesek, hanem valós időben, a fizikai világhoz illeszkedő ütemben hozhassanak döntéseket és reagálhassanak.
Mire használható a modell?
Gemini Robotics ER 2 magas szintű tervezést és párbeszédet tesz lehetővé: a robot képes kommunikálni emberrel, értelmezni a fizikai környezetet és többlépéses feladatokat megtervezni, majd az alsó szintű motoros végrehajtást (Vision-Language-Action, VLA modellek vagy más vezérlő API-k) átadja a megfelelő végrehajtó rétegnek. A modell natívan képes külső eszközök hívására, például Google Search-re vagy tetszőleges felhasználó által definiált függvényekre.
A tervezés lehetővé teszi, hogy a modell egyszerre „gondolkodjon” a következő lépéseken és közben folyamatosan végrehajtsa a feladatot, így elkerülve a megszakításokat.
Fejlesztések az ER 1.6-hoz képest
A Gemini Robotics ER 2 lényeges előrelépés az ER 1.6-hoz viszonyítva. A modell folytonos videófolyamok figyelésével képes nyomon követni a saját előrehaladását, alkalmazkodni váratlan eseményekhez, és tudni, mikor kell továbblépni a következő lépésre. Emellett támogatja a többrobotos együttműködést is, így különböző képességű robotok közösen végezhetnek el komplex feladatokat.
Elérhetőség és fejlesztői eszközök
A Gemini Robotics ER 2 elérhető fejlesztők számára a Gemini API-n és a Google AI Studio-ban, továbbá magán előnézetben a Gemini Enterprise Agent Platformon. A Google példakódokat és konfigurációs útmutatókat is megoszt a modellel való kezdéshez.
Agentikus képességek és eszkör-orchesztráció
A modell fizikai ügynökként lép fel: lépéseket szervez, képes önjavításra és általánosítani új helyzetekre. A fejlesztők alsó szintű vezérlő interfészeket (például VLA modelleket vagy navigációs API-kat) deklarálhatnak eszközökként, és multimodális videót, hangot vagy szöveget streamelhetnek közvetlenül a modellbe. A Gemini Robotics ER 2 javítja az eszközöket koordináló munkafolyamatot, és teljesítményét szimulációban, valós robotvezérléssel és emberi távvezérléssel egyaránt értékelik.
A fejlesztések eredményeként a Gemini Robotics ER 2 következetesen felülmúlja az ER 1.6-ot három vezérlési módban: valós VLA, szimulált VLA és emberi tele-op.
Valós idejű integráció és latencia
A magas szintű érvelés robotikában a végrehajtás sebességétől függ. Ennek érdekében a Gemini Robotics ER 2 integrálódik a Gemini Live API-val egy kétirányú, alacsony késleltetésre optimalizált streaming végponttal. Ennek hatása a folyékony orchesztráció: a modell anélkül irányítja az akciómodelleket és robotikai API-kat, hogy jellegzetes „meáll és gondolkodik” megszakítások lennének.
Példaként a Google és partnere, a Boston Dynamics Spot nevű robotjára épített demót említik, ahol a Gemini Robotics ER 2 a Spot API-kat (navigáció, manipulátor-mozgatás) használva olyan interaktív rendszert hoz létre, amely természetes nyelvi utasításra tárgyakat hoz be. A megvalósításhoz elérhető kód megtalálható a GitHubon.
Időbeli intelligencia és feladat-előrehaladás követés
Az egyik legnehezebb kihívás a robotikában annak felismerése, hogy egy feladat mikor tekinthető befejezettnek. A Gemini Robotics ER 2 jelentősen javítja a videóértést és az előrehaladás követését, így komplex műveleteknél — például izzó meghúzása vagy szemeteszsák bekötése — megbízhatóan ellenőrizhető a feladat specifikációnak megfelelő befejezése.
Két kulcsfontosságú képesség fejlesztéséről számolnak be:
-
Folytonos progresszió-osztályozás: a modell képes minden videóképkockát öt előrehaladási szintbe sorolni (0–20%, 20–40%, 40–60%, 60–80%, 80–100%), ami valós idejű helyzetismeretet biztosít és lehetővé teszi a lépések finomhangolását vagy sikertelen lépések újbóli próbálkozását a teljes munkafolyamat újraindítása nélkül. A Gemini Robotics ER 2 57,4% pontosságot ér el ezen progressziós osztályozási feladatokon, felülmúlva az előző generációt és versenytárs modelleket.
-
Precíz „moment-finding”: a modell képes azonosítani azt a pontos képkockát, ahol egy kritikus esemény bekövetkezik (például mikor kell abbahagyni a kávé öntését). Moment-finding feladatokban a Gemini Robotics ER 2 91,3% pontosságot és 0,96 másodperces átlagos abszolút eltérést (MAD) ért el. A cég hangsúlyozza, hogy ez a pontosság kisebb számítási költséggel és négyszeres végrehajtási sebességgel párosul, azaz alacsony késleltetésű működést tesz lehetővé.
Többrobotos együttműködés
A Gemini Robotics ER 2 támogatja a többrobotos együttműködést: különböző típusú robotok oszthatják meg szemantikus megértésüket, átadhatják egymásnak a feladatokat és közösen fejezhetnek be olyan munkafolyamatokat, amelyeket egyetlen robot nem tudna ellátni. A közleményben példaként említik, hogy az Apptronik Apollo 2 és a Franka F3 Duo hogyan tud együttműködni a rendszerrel.
Térbeli intelligencia és általánosíthatóság
A modell előrelépéseket hoz a térbeli következtetésben több, szabványos benchmark alapján is:
- Siker/sikertelenség detektálása: a modell most már nyers videófolyamokon dolgozik, nem csak statikus pillanatképeken, így közbeeső hibákat is képes észlelni (pl. kiömlések, elcsúszások, rossz illesztések).
- Általános műszerolvasás: kiterjeszti a képességeket a körműszeres kijelzőktől a digitális kijelzőkig, lineáris skálákig, vonalzókig és folyadékhőmérőkig, összesen 10 különböző műszertípust tesztelve.
- Javított vizuális VQA: jobb vizuális kérdés-válasz képességeket hoz a multimodális megértés fejlesztése révén.
A Gemini Robotics ER 2 következetesen a legmagasabb pontosságot éri el a magmag képességekben, beleértve a sikerdetektálást (kép/videó), a kérdés-válasz teljesítményt (ERQA) és a műszerolvasást.
Biztonság és ember-közelség kezelése
A Google szerint a Gemini Robotics ER 2 a legbiztonságosabb modelljük: jelentős javulást mutat a Safety Instruction Following és a Human Proximity benchmarkokon, amelyek azt mérik, hogy a modell milyen mértékben tartja be a fizikai korlátokat és észleli az embereket a környezetben. A modell képes megállítani egy humanoid robotot, amikor ember közelében van, és csak akkor folytatja autonóm módon a munkát, ha a terület tisztává válik.
A cég bevezet egy új benchmarkot is, amely alapmodellek VLA-orchesztrátori biztonsági viselkedését értékeli: képes-e betartatni biztonsági korlátokat, figyelni a környezetet, felmérni a fizikai megvalósíthatóságot és szükség esetén emberi tisztázást kérni. A Gemini Robotics ER 2 ezen a területen is felülmúlja az ER 1.6-ot és más élvonalbeli modelleket.
Kilátások
A Google tervei szerint a modelleket tovább fejlesztik, hogy még összetettebb feladatokat támogassanak és felgyorsítsák a hasznos robotok kifejlesztését, valamint további támogatást nyújtsanak a robotikai közösség számára.



