poniedziałek, 7 września 2026

Nowości

Google DeepMind pokazuje model AI sterujący całym ciałem robota

Agenty AIPatryk Raba
Google DeepMind pokazuje model AI sterujący całym ciałem robota
Fot. Alex Knight, Pexels (Pexels License)
Spis treści
  1. Od górnej połowy ciała do całego szkieletu
  2. Trzy modele w jednym systemie
  3. Liczby, które pokazują ograniczenia
  4. Bezpieczeństwo agentowych robotów
  5. Co to oznacza dla branży

Google DeepMind udostępnił 30 lipca 2026 roku Gemini Robotics 2, model wizja-język-akcja, który po raz pierwszy koordynuje ruch całego szkieletu humanoidalnego robota, a nie tylko jego górnej części ciała jak poprzednie generacje. Firma pokazała, jak działa on w praktyce na robocie Apollo 2 od Apptronik.

Od górnej połowy ciała do całego szkieletu

Wcześniejsze wersje modeli Gemini Robotics potrafiły sterować wyłącznie ramionami i dłońmi robota, zakładając stabilną, nieruchomą podstawę. Gemini Robotics 2 zmienia to podejście: model przetwarza obraz z kamer i polecenia w języku naturalnym na komendy silnikowe obejmujące chodzenie, kucanie, schylanie się w pasie i precyzyjne ruchy dłoni z wieloma stopniami swobody.

W materiałach demonstracyjnych humanoid Apollo 2 firmy Apptronik chwyta przedmioty leżące na podłodze, skanuje półki sklepowe w poszukiwaniu konkretnego produktu na głosowe polecenie i wykonuje wieloetapowe zadania trwające po kilka minut. Model obsługuje też dłonie o 22 stopniach swobody, co pozwala na czynności takie jak wykręcanie żarówki czy zawiązywanie worka na śmieci.

Trzy modele w jednym systemie

Gemini Robotics 2 to główny model kontrolujący ruch, ale DeepMind wprowadził razem z nim dwa uzupełniające narzędzia. Gemini Robotics ER 2 odpowiada za planowanie wieloetapowych zadań i koordynację pracy kilku robotów naraz, a Gemini Robotics On-Device 2 działa lokalnie na sprzęcie robota bez połączenia z chmurą, co ma znaczenie w miejscach bez stabilnego internetu, na przykład w magazynach czy fabrykach.

ER 2 trafił już do Google AI Studio oraz w wersji prywatnego podglądu do Gemini Enterprise Agent Platform. Dostęp do pełnego modelu VLA i wersji On-Device pozostaje ograniczony do zaufanych partnerów testowych, w tym Apptronik, Sharpa Robotics i integratorów pracujących z platformą Nvidia Isaac GR00T.

Liczby, które pokazują ograniczenia

DeepMind opublikował konkretne wskaźniki skuteczności, które pokazują, że system wciąż daleki jest od niezawodności zbliżonej do człowieka. Przy zadaniach całego ciała na robocie Apollo 2 z dłońmi Inspire skuteczność wynosi 68,4 procent przy podnoszeniu ze stołu, 76,3 procent z półki i tylko 45,7 procent przy sięganiu po przedmioty z podłogi. Przy manipulacji wielopalczastej dłonią SharpaWave wykręcenie żarówki udaje się w 92 procentach prób, ale pozostałe zadania, takie jak wkręcanie żarówki, zawiązywanie worka czy układanie narzędzi, mieszczą się w przedziale 32-44 procent.

Na chwytaku Franka Duo, czyli klasycznym ramieniu przemysłowym bez nóg, wyniki są wyraźnie wyższe: 74,2 procent przy ogólnym podnoszeniu i odkładaniu, 89,6 procent przy precyzyjnym wkładaniu elementów i 78,9 procent przy sortowaniu narzędzi. Rozstrzał pokazuje, że im bardziej złożona i całościowa koordynacja ciała, tym trudniejsze zadanie dla obecnej generacji modelu.

Bezpieczeństwo agentowych robotów

Razem z modelami DeepMind wprowadził nowy benchmark ASIMOV-Agentic, który ma mierzyć bezpieczeństwo robotów działających autonomicznie, w tym zdolność do odmowy wykonania niebezpiecznego polecenia i wykrywania bliskości człowieka podczas pracy. To odpowiedź na rosnące obawy, że roboty sterowane dużymi modelami językowymi mogą wykonywać ryzykowne akcje bez odpowiedniego nadzoru.

Aby rozwiązać najtrudniejsze problemy na dużą skalę, roboty każdego kształtu i rozmiaru potrzebują modeli AI dających im zdolność myślenia, działania i inteligentnej interakcji, by bezpiecznie wykonywać zadania - Carolina Parada, szefowa robotyki w Google DeepMind

Co to oznacza dla branży

Gemini Robotics 2 wpisuje się w wyścig dużych firm technologicznych o dominację w robotyce humanoidalnej, gdzie oprócz Google DeepMind rywalizują między innymi Nvidia z platformą Isaac GR00T oraz producenci samych robotów, tacy jak Apptronik czy Boston Dynamics. Model, który ma działać na wielu różnych konstrukcjach mechanicznych po krótkim dotrenowaniu, może obniżyć koszt wdrożenia robotów w magazynach i fabrykach, bo nie wymaga budowania oprogramowania sterującego od zera dla każdego nowego modelu sprzętu.

Na razie dostęp pozostaje ograniczony do wąskiego grona partnerów testowych, więc na masowe wdrożenia w polskich firmach logistycznych czy produkcyjnych trzeba będzie poczekać. Sama architektura, w której jeden model AI ma obsługiwać roboty różnych producentów, jest jednak sygnałem, w którą stronę zmierza automatyzacja fizycznej pracy w najbliższych latach.

Udostępnij: