Протягом кількох років головним символом штучного інтелекту був чат: людина ставить запитання, модель відповідає текстом, зображенням або кодом. Робототехніка змінює цю логіку. Тут відповідь повинна перетворитися на фізичну дію, а помилка може означати не невдалий абзац, а розлиту рідину, зламаний предмет або небезпечний рух поруч із людиною.
Саме для цього Google DeepMind представила Gemini Robotics ER 2 — модель embodied reasoning, яку компанія описує як високорівневий «мозок» для роботів. Вона не керує кожним двигуном безпосередньо, а розуміє ситуацію, планує послідовність кроків, викликає нижчі системи керування й перевіряє, чи виконано завдання правильно.
Чим «мозок» відрізняється від звичайного контролера
Традиційний промисловий робот надзвичайно точний, якщо середовище передбачуване. Він може тисячі разів повторити одну операцію на конвеєрі. Але варто змінити положення предмета, дати незнайоме словесне завдання або додати непередбачену перешкоду — і класичній системі потрібне перепрограмування.
Gemini Robotics ER 2 має працювати на іншому рівні. Модель отримує відео, аудіо або текст, розуміє просторову ситуацію й може використовувати різні інструменти: навігаційний API, vision-language-action модель, пошук або спеціально створені функції. Вона планує, що робити далі, поки робот уже виконує попередню дію.
Робот повинен розуміти, коли задача завершена
Одна з найбільш неочевидних проблем робототехніки — визначити момент завершення. Для людини очевидно, коли чашка вже наповнена або лампочка докручена. Для машини це окрема задача комп’ютерного зору й причинного аналізу.
Google тестує ER 2 на класифікації прогресу, де кожен кадр відео потрібно віднести до одного з п’яти етапів виконання — від 0–20% до 80–100%. Модель досягла 57,4% точності на таких тестах і перевершила попередню версію та інші порівнювані системи.
Ще важливіше — знайти точну мить для наступної дії
Інший тест називається moment finding. Система повинна визначити конкретний кадр, коли сталася ключова подія: наприклад, коли потрібно припинити наливати каву або коли предмет уже зафіксований маніпулятором.
Gemini Robotics ER 2 показала 91,3% точності й середню похибку близько 0,96 секунди. Google також заявляє про приблизно чотириразове прискорення виконання порівняно з більшими класами моделей, що важливо для реального світу: робот не може завмирати на кілька секунд перед кожним рухом.
Машини вчаться працювати командою
Нова модель підтримує координацію кількох роботів. Це може бути важливішим, ніж створення одного універсального гуманоїда. Різні машини добре виконують різні задачі: колісний робот швидко рухається по складу, маніпулятор точно працює за столом, гуманоїдна платформа краще використовує середовище, побудоване для людей.
ER 2 може створювати спільний семантичний контекст і передавати частини роботи від однієї машини до іншої. У перспективі це відкриває шлях до «команд» роботів, де одна система планує процес, а спеціалізовані машини виконують свої етапи.
Приклад із Boston Dynamics показує нову модель взаємодії
Google продемонструвала інтеграцію ER 2 із роботом Spot від Boston Dynamics. Людина може дати природну команду, а модель сама розкладе її на навігацію, пошук предмета, позиціонування й використання маніпулятора.
Ключова відмінність — не в самому русі Spot. Ці можливості в робота були й раніше. Новизна полягає в тому, що високорівнева модель може оркеструвати різні API та модулі, перетворюючи людську мету на послідовність машинних дій.
Безпека у фізичному світі має інші правила
Google окремо тестує модель на виконанні інструкцій безпеки та на виявленні людей поблизу. У демонстраціях гуманоїд зупиняє роботу, коли людина входить у небезпечну зону, і продовжує лише після того, як простір звільняється.
Це принципово важливо. У чатбота можна скасувати відповідь. У фізичного агента дія може бути незворотною, тому система повинна оцінювати не лише «чи можна виконати задачу», а й «чи безпечно її виконувати зараз».
Де такі системи з’являться першими
Найреалістичніші сфери — склади, виробництво, лабораторії, лікарні, сервісні центри та логістика. Там середовище відносно контрольоване, а економічний ефект від автоматизації повторюваних багатокрокових процесів найбільший.
Домашні роботи складніші: квартира містить набагато більше нестандартних предметів, людей, тварин і непередбачуваних ситуацій. Але саме прогрес у просторовому reasoning, відеоаналізі та самокорекції поступово наближає робототехніку до такого рівня.
Фізичний ШІ може стати наступним великим ринком
Gemini Robotics ER 2 не означає появу універсального робота, здатного робити все. Це швидше новий шар програмного забезпечення між людською командою та механічним виконанням. І саме цей шар може виявитися ключовим.
Якщо мовні моделі навчили комп’ютери краще працювати з інформацією, embodied AI намагається навчити їх діяти в реальному просторі. Наступний великий етап ШІ може визначатися вже не тим, наскільки переконливо машина відповідає, а тим, наскільки надійно вона розуміє світ, планує рух і безпечно взаємодіє з людьми.



