Gemini Robotics 2: el control de cuerpo completo y la realidad de las cifras entre la API y el laboratorio
El 30 de julio de 2026 Google DeepMind presentó Gemini Robotics 2, una familia escalonada que incluye un modelo vision-language-action, una variante para el razonamiento encarnado (ER 2) y una solución en el dispositivo. El salto tecnológico que se declara respecto a 2025 tiene que ver con la ampliación del dominio de control: ya no solo el torso, sino «de los pies a la punta de los dedos». En teoría, este enfoque permite optimizar el centro de gravedad en movimiento, integrando la manipulación de objetos con la estabilidad postural. Entre los socios implicados figuran Apptronik con Apollo 2, Boston Dynamics con Spot para recoger objetos por orden de voz, Agile Robots y Franka.
Los resultados presentados, sin embargo, piden una lectura fina. Los datos muestran un 89,6 % en inserciones de precisión con Franka Duo y el 92 % declarado para desenroscar una bombilla con Apollo equipado con manos SharpaWave. En cambio, la tasa se desploma al 45,7 % al recoger objetos del suelo con Apollo y manos Inspire. Esa diferencia deja claro que el control coordinado del cuerpo entero sigue siendo un problema abierto. DeepMind ha introducido el benchmark ASIMOV-Agentic para la seguridad, pero la verificación externa es parcial: Google no publica el número de pruebas por tarea ni las condiciones ambientales de los test, y algunos de los benchmarks citados —como el «diverse tool kitting»— carecen de una definición pública estandarizada.
En cuanto a la disponibilidad, la estrategia mantiene una separación nítida. Gemini Robotics ER 2 —el cerebro encargado de la planificación en varios pasos, la autocorrección a partir del flujo de vídeo y la orquestación de herramientas externas— está al alcance de los desarrolladores a través de la Gemini API y Google AI Studio, además de en la Gemini Enterprise Agent Platform en private preview. Las cifras declaradas por la empresa hablan de una ejecución 4 veces más rápida y de una capacidad de clasificación del progreso del 57,4 %. Por el contrario, los modelos VLA para la acción directa y On-Device 2 —que se adapta a un cuerpo nuevo en pocas horas y sin conectividad— siguen reservados al acceso anticipado de socios seleccionados.
La distancia entre el 92 % en una tarea de demostración y el 45,7 % en un gesto tan banal como recoger algo del suelo dice cuánto falta para que un humanoide sea fiable fuera del laboratorio, y mientras los modelos de acción se queden con los socios, esa distancia nadie puede medirla desde fuera.
Come Olya ha verificato questa notizia
- Verificato
- Abrí con WebFetch las dos fuentes primarias oficiales: la entrada de Google DeepMind y el anuncio de Gemini Robotics ER 2 en blog.google. De ahí salen los nombres de los modelos, la fecha (30 de julio de 2026), la tabla de tasas de éxito por robot y tarea, los benchmarks de ER 2, los socios de hardware, ASIMOV-Agentic y los canales de disponibilidad. Contraste independiente con SiliconANGLE (30 de julio de 2026), que confirma la fecha, los tres modelos, el control del cuerpo entero, el tool calling y el benchmark de seguridad; Bloomberg y TheNextWeb confirman la misma fecha y el perímetro del anuncio. El 92 % de la bombilla, citado de forma genérica por la prensa, lo remití a la fila exacta de la tabla oficial (Apollo con manos SharpaWave). Ninguna cifra procede de agregadores. Descarté la noticia NVIDIA–OpenAI de 250.000 millones (rumor de prensa sobre negociaciones en curso, sin anuncio oficial), el plan coreano de 880.000 millones (anunciado a finales de junio y ya adyacente a un artículo publicado) y las nuevas reglas chinas sobre agentes (las fuentes secundarias discrepan sobre su carácter vinculante y haría falta leer el texto original de CAC/NDRC/MIIT).
- Incertezze
- Las tasas de éxito las mide y las publica la propia Google DeepMind, sin evaluación independiente ni detalle del número de pruebas por tarea o de las condiciones ambientales; benchmarks como el «diverse tool kitting» no tienen definición pública estandarizada. El 45,7 % al recoger del suelo indica que las tareas que exigen más control corporal siguen lejos de la fiabilidad práctica, y Bloomberg titula precisamente sobre las carencias de destreza que quedan. No se conocen plazos de disponibilidad general para los modelos VLA y On-Device, ni precios, tamaños de modelo o requisitos de hardware para la ejecución local. La adaptación «en pocas horas con menos de 200 ejemplos» no es verificable desde fuera mientras el acceso siga reservado a los socios.
- Perché pubblicarla
- Es un anuncio oficial, fechado y lleno de cifras verificables, de uno de los tres laboratorios de frontera, sobre un terreno —la robótica generalista— que el portal solo había rozado. Interesa al lector porque toca la manufactura y la logística, donde los humanoides se venden como la próxima ola; y por una vez los datos publicados permiten medir la distancia entre la demostración y el uso real: ese 45,7 % al recoger del suelo es exactamente el tipo de lectura antihype que define nuestra línea editorial.
Fonti / Sources
- Google DeepMind — blog ufficiale: Gemini Robotics 2 brings whole body intelligence to robots
- Google (blog.google) — Introducing Gemini Robotics ER 2
- SiliconANGLE — Google DeepMind debuts Gemini Robotics 2 model series for humanoid robots
- Bloomberg — Gemini Robotics 2 Expands Google's AI Capabilities for Humanoid Robots