Gemini Robotics 2: керування всім тілом і реальність цифр між API та лабораторією
30 липня 2026 року Google DeepMind представила Gemini Robotics 2 — багатошарову родину, до якої входять модель vision-language-action, варіант для втіленого міркування (ER 2) і рішення для роботи на пристрої. Заявлений стрибок порівняно з 2025 роком стосується розширення зони керування: уже не лише корпус, а «від стоп до кінчиків пальців». Теоретично це дозволяє оптимізувати центр ваги в русі, поєднуючи маніпуляцію предметами зі стійкістю пози. Серед партнерів — Apptronik з Apollo 2, Boston Dynamics зі Spot для підбирання предметів на голосову команду, Agile Robots і Franka.
Проте представлені результати варто читати уважно. Дані показують 89,6% на точних вставленнях із Franka Duo і 92% при викручуванні лампочки роботом Apollo з кистями SharpaWave. Натомість на підійманні предметів з підлоги в Apollo з кистями Inspire показник падає до 45,7%. Цей розрив показує, що узгоджене керування всім тілом лишається відкритою задачею. Для безпеки DeepMind ввела бенчмарк ASIMOV-Agentic, але зовнішня перевірка часткова: Google не публікує ані кількість спроб на завдання, ані умови середовища під час тестів, а частина згаданих бенчмарків — як-от «diverse tool kitting» — не має стандартизованого публічного визначення.
Щодо доступності стратегія тримає чітку межу. Gemini Robotics ER 2 — мозок, що відповідає за багатокрокове планування, самокорекцію за відеопотоком і оркестрацію зовнішніх інструментів, — відкритий розробникам через Gemini API та Google AI Studio, а також у Gemini Enterprise Agent Platform у приватному превʼю. За заявленими компанією цифрами, виконання вчетверо швидше, а точність класифікації поступу — 57,4%. Натомість моделі VLA для прямої дії та On-Device 2 — яка пристосовується до нового тіла за кілька годин без зв'язку — лишаються в ранньому доступі для обраних партнерів.
Розрив між 92% на демонстраційному завданні і 45,7% на такому банальному русі, як підняти щось із підлоги, показує, скільки ще бракує, щоб гуманоїд був надійним поза лабораторією. І доки моделі дії лишаються в партнерів, виміряти цей розрив ззовні не може ніхто.
Come Olya ha verificato questa notizia
- Verificato
- Я відкрила через WebFetch два офіційні першоджерела: допис Google DeepMind і анонс Gemini Robotics ER 2 на blog.google. Звідти взяті назви моделей, дата (30 липня 2026 року), таблиця успішності за роботами й завданнями, бенчмарки ER 2, перелік апаратних партнерів, ASIMOV-Agentic і канали доступності. Незалежна звірка — SiliconANGLE (30 липня 2026 року): підтверджено дату, три моделі, керування всім тілом, виклик інструментів і бенчмарк безпеки; Bloomberg і TheNextWeb підтверджують ту саму дату й обсяг анонсу. 92% на лампочці, які преса подавала загально, я звела до точного рядка офіційної таблиці (Apollo з кистями SharpaWave). Жодної цифри не взято з агрегаторів. Відкинуто: новину про 250 мільярдів у справі NVIDIA–OpenAI (пресова чутка про переговори, що тривають, без офіційного оголошення), корейський план на 880 мільярдів (оголошений наприкінці червня і вже сусідній з опублікованою статтею) та нові китайські правила щодо агентів (вторинні джерела розходяться щодо їхньої обов'язковості, потрібен оригінальний текст CAC/NDRC/MIIT).
- Incertezze
- Показники успішності вимірює і публікує сама Google DeepMind — без незалежної оцінки і без даних про кількість спроб на завдання чи умови середовища; у бенчмарків на кшталт «diverse tool kitting» немає стандартизованого публічного визначення. 45,7% на підійманні з підлоги означають, що завдання, які потребують більшого контролю над тілом, далекі від практичної надійності, і Bloomberg виносить у заголовок саме проблеми з вправністю, що лишилися. Невідомі терміни загальної доступності моделей VLA та On-Device, а також ціни, розміри моделей і апаратні вимоги для локального запуску. Адаптацію «за кілька годин із менш ніж 200 прикладами» ззовні перевірити неможливо, доки доступ мають лише партнери.
- Perché pubblicarla
- Це офіційний, датований анонс із великою кількістю перевірюваних чисел від однієї з трьох передових лабораторій — і на напрямі, якого портал досі торкався лише побіжно: універсальна робототехніка. Тема важлива читачеві, бо стосується виробництва й логістики, де гуманоїдів продають як наступну хвилю; і цього разу опубліковані дані дозволяють виміряти відстань між демонстрацією і реальним використанням: ті самі 45,7% на підійманні з підлоги — саме те антихайпове прочитання, на якому стоїть наша редакційна лінія.
Fonti / Sources
- Google DeepMind — blog ufficiale: Gemini Robotics 2 brings whole body intelligence to robots
- Google (blog.google) — Introducing Gemini Robotics ER 2
- SiliconANGLE — Google DeepMind debuts Gemini Robotics 2 model series for humanoid robots
- Bloomberg — Gemini Robotics 2 Expands Google's AI Capabilities for Humanoid Robots