Компания Google DeepMind показала Gemini Robotics 2 — VLA-модель для управления всем телом робота, а также решение ER 2 для комплексного планирования и координации нескольких устройств.
https://www.youtube.com/watch?v=4lSQnrMC6nY
Gemini Robotics 2 переводит текст и визуальные данные в моторные действия. Модель рассчитана на роботов разного форм-фактора — от настольных манипуляторов до полноразмерных гуманоидов.
В отличие от прошлой версии, ИИ управляет не только верхней частью тела. Благодаря ей роботы научились ходить, приседать, наклоняться, тянуться и поднимать предметы в узком пространстве.
В демонстрациях гуманоид Apptronik Apollo 2 под управлением Gemini Robotics 2 подбирал лейку, снимал бейсбольную перчатку с полки и находил нужные предметы.
Показатели ловкости Apollo 2. Источник: Google DeepMind.
Google DeepMind также заявила об улучшенной моторике: модель поддерживает сложные кисти с 22 степенями свободы и способна выполнять задачи вроде завязывания узлов, закрытия пакета или выкручивания лампочки.
Обновление коснулось и модели ER 2, которую DeepMind называет «высокоуровневым мозгом» для роботов. Решение планирует многоступенчатые задачи, отслеживает, завершено ли действие или его нужно повторить, и распределяет работу между несколькими роботами.
В одном из роликов Apollo 2 поручает двурукому роботу Google складывать инструменты в контейнер во время уборки гаража.
Компания дополнительно показала локальную модель Gemini Robotics On-Device 2. Она работает без подключения к интернету и адаптируется к новым роботам менее чем по 200 примерам за несколько часов обучения.
Сейчас Gemini Robotics 2 доступна в режиме частного просмотра, а ER 2 — через Gemini API и Google AI Studio. On-Device 2 тестируют доверенные партнеры.
Напомним, в июле компания Humanoid представила подход к обучению роботов на реальных производственных задачах.