Gemini Robotics 2: qué cambia el control corporal completo para producto
Gemini Robotics 2 amplía la arquitectura robótica de Google DeepMind desde la manipulación del torso hasta un control coordinado desde los pies hasta los dedos. La consecuencia comercial va más allá de enseñar un truco nuevo a un humanoide. El robot puede combinar desplazamiento, equilibrio, alcance y manipulación mientras un modelo de razonamiento separado planifica una tarea de varios pasos y comprueba el resultado.
Eso no convierte el despliegue de humanoides en una solución lista para comprar. Google comunica un 92 % de éxito al desenroscar una bombilla, pero solo un 36 % al enroscarla y entre un 32 % y un 44 % en otras tareas con varios dedos. Los modelos de control directo siguen reservados a socios seleccionados. La pregunta práctica no es «¿podemos comprar ya un trabajador robótico generalista?». Es qué parte de esta arquitectura podemos probar hoy, para qué flujo y dentro de qué límite de seguridad.
Esta guía responde a esa decisión. Separa los tres modelos, analiza el benchmark completo, aclara el acceso actual y propone un piloto acotado. Para el método general de despliegue, combínala con nuestro plan de piloto de agentes de IA en 30/60/90 días.
¿Quieres convertir una idea de IA física en un piloto medible de software y robótica?
Define tu piloto de IA física¿Qué es Gemini Robotics 2?
Gemini Robotics 2 es una familia de tres modelos de IA física conectados, no un único cerebro robótico monolítico. La publicación oficial de Gemini Robotics 2 distribuye percepción, planificación y acción entre modelos con perfiles de despliegue diferentes.
| Modelo | Función | Acceso actual |
|---|---|---|
| Gemini Robotics 2 | Modelo visión-lenguaje-acción que convierte imágenes e instrucciones en acciones motoras para humanoides completos y robots de dos brazos | Socios de acceso anticipado |
| Gemini Robotics ER 2 | VLM de razonamiento encarnado para entender vídeo, planificar tareas, invocar herramientas y seguir el progreso | Gemini API, Google AI Studio y vista previa empresarial privada |
| Gemini Robotics On-Device 2 | VLA eficiente para inferencia local cuando la latencia de red o la conectividad no son aceptables | Evaluadores de confianza |
La separación importa. El modelo de razonamiento puede ser el orquestador de alto nivel mientras un VLA, una API de navegación o un controlador convencional ejecuta una acción acotada. Un equipo puede cambiar una capa sin entregar a un solo modelo cada articulación, parada de seguridad y decisión de negocio.
Por qué el control corporal completo es el salto real
La generación anterior controlaba sobre todo la parte superior del humanoide para tareas sobre una mesa. Gemini Robotics 2 amplía la política de acción aprendida a todo el cuerpo. En la demostración con Apollo 2, una instrucción hace que el robot camine hasta una mesa, recoja una regadera, se acerque a una estantería y la coloque en una caja inferior. Cada fase cambia su alcance, equilibrio y siguiente punto de vista.
Esa coordinación es el cuello de botella en espacios diseñados para personas. Un brazo fijo puede rendir muy bien dentro de una célula planificada. Un humanoide en almacén, laboratorio o mantenimiento debe cambiar de superficie, corregir su postura, evitar a personas y recuperarse cuando el objeto no está donde esperaba. El control corporal reduce los traspasos entre rutinas separadas de locomoción y manipulación.
No elimina el resto de la robótica. Los controladores específicos del hardware siguen gestionando movimiento sin colisiones, equilibrio, fuerza y emergencias. El modelo fundacional amplía los objetivos que el sistema entiende y los movimientos que compone. No debe ser la única capa de seguridad.
¿Qué demuestra realmente el 92 % de la bombilla?
Demuestra destreza relevante para una tarea concreta, no fiabilidad general de la mano. La evaluación publica cinco resultados individuales con Apollo 2 y una mano de 22 grados de libertad.
| Tarea | Éxito comunicado | Lectura para un comprador |
|---|---|---|
| Desenroscar una bombilla | 92% | Buen resultado en la mejor tarea multifinger mostrada |
| Enroscar una bombilla | 36% | La acción inversa no está resuelta al mismo nivel |
| Atar una bolsa de basura | 44% | Los objetos deformables siguen siendo difíciles |
| Cerrar una bolsa zip | 40% | La alineación fina y la fuerza aún fallan con frecuencia |
| Usar un recogedor | 32% | El uso coordinado de herramientas no permite trabajo desatendido |
Otros gráficos muestran un 45,7 % al recoger un objeto del suelo con una configuración de Apollo, frente a un 68,4 % desde una mesa y un 76,3 % desde una balda. Por eso un piloto necesita una distribución representativa, no una selección de éxitos. Hay que medir ángulos incómodos, objetos caídos, desorden, cambios de luz, personas que entran y recuperación tras fallos parciales.
¿Cómo colaboran los tres modelos?
Gemini Robotics ER 2 actúa como agente de alto nivel. Consume vídeo continuo e instrucciones, define pasos, invoca herramientas, observa el progreso y decide si continuar, reintentar o pedir ayuda. La publicación para desarrolladores de Gemini Robotics ER 2 indica que se pueden declarar modelos VLA o APIs de navegación como herramientas y transmitir vídeo, audio o texto mediante Gemini Live API.
Una ruta orientada a producción debería seguir estas capas:
- Observar: cámaras, estado del robot y contexto entran en un flujo con marcas de tiempo.
- Razonar: ER 2 elige el siguiente paso acotado, comprueba restricciones y detecta ambigüedad.
- Ejecutar: un VLA o una API determinista realiza la acción aprobada.
- Proteger: controladores de bajo nivel, sensores certificados y enclavamientos pueden detener el movimiento de forma independiente.
- Verificar: vídeo y señales deterministas confirman el resultado.
- Escalar: incertidumbre, fallos repetidos o una persona en la zona devuelven el control a un humano.
Es una arquitectura de agentes con consecuencias físicas. El registro debe conservar instrucción, observaciones, herramienta propuesta, decisión de restricciones, movimiento, paradas y verificación. Sin esa traza no se explica un fallo ni se comparan versiones.
¿Puede una empresa usar Gemini Robotics 2 hoy?
Sí para experimentar con razonamiento encarnado; normalmente todavía no para el modelo corporal directo. La ficha de modelo de Gemini Robotics ER 2 incluye Gemini API y AI Studio. También exige prudencia en entornos productivos, comerciales o públicos y excluye aplicaciones críticas para la seguridad.
| Punto de partida | Qué hacer ahora | Qué no asumir |
|---|---|---|
| Sin hardware robótico | Probar comprensión de vídeo, orquestación y progreso con simulación o grabaciones | El éxito simulado se transfiere intacto al hardware |
| Robot existente con APIs | Colocar ER 2 sobre habilidades estrechas y mantener aprobación humana del movimiento | El razonamiento sustituye la seguridad certificada |
| Plataforma de dos brazos | Solicitar acceso y preparar demostraciones, telemetría y líneas base | Menos de 200 ejemplos garantizan un éxito objetivo |
| Plan de humanoide | Hacer discovery de flujo y seguridad antes de comprar hardware | Una demo de Apollo equivale a disponibilidad general |
Si decides entre integración propia, plataforma empaquetada o esperar, consulta nuestra guía de software a medida frente a software estándar. En robótica hay que añadir disponibilidad de hardware, datos de adaptación, responsabilidad de seguridad y acceso del proveedor.
Por qué la transferencia local puede ser la clave comercial
El razonamiento en la nube sirve cuando red y respuesta encajan. El control de movimiento no siempre acepta esa dependencia. Gemini Robotics On-Device 2 está diseñado para ejecutarse localmente. DeepMind afirma que se adapta a un robot de dos brazos nuevo con unas horas de datos, normalmente menos de 200 ejemplos.
La ficha de On-Device 2 añade el límite que falta en los titulares: solo está disponible para evaluadores de confianza, presenta límites fuera de distribución y en robots con muchos grados de libertad, y se evaluó principalmente en manipulación estacionaria con dos brazos. Los riesgos móviles y de cuerpo completo quedan fuera de su alcance de evaluación.
«Menos de 200 ejemplos» es un punto de partida de eficiencia, no una cotización de despliegue. El comprador aún debe saber cómo se recogen ejemplos, quién etiqueta el éxito, qué fallos se incluyen, qué sensores cambian, qué hardware ejecuta el modelo y qué ocurre fuera del conjunto de adaptación.
La seguridad exige capas, no autonomía total
El informe de seguridad de Gemini Robotics 2 resulta útil porque muestra compromisos reales. En la prueba de proximidad humana, ningún modelo consiguió a la vez casi cero peligros omitidos y casi cero paradas innecesarias. Los modelos ajustados para interrumpir menos podían ignorar más peligros. El informe recomienda barreras deterministas de bajo nivel junto a la percepción del modelo.
Antes del primer movimiento real, un piloto comercial necesita cuatro controles independientes:
- Límite físico: velocidad, fuerza, espacio y carga se imponen por debajo del modelo.
- Límite semántico: tareas prohibidas, lista de herramientas y aclaración obligatoria ante instrucciones ambiguas.
- Límite humano: autoridad visible de parada y aprobación para tareas, herramientas o zonas nuevas.
- Límite de evidencia: éxito, colisión, intervención, parada falsa y recuperación medidos por ejecución.
Que un modelo detecte una persona cercana ayuda. No sustituye sensores certificados ni una evaluación de riesgos de maquinaria.
Plan de 90 días para un piloto
- Días 0 a 30, elegir el flujo. Escoge una tarea repetitiva donde escenas variables hagan cara la automatización fija. Registra línea base humana, frecuencia, coste de intervención y fallos inaceptables. Mapea riesgos y decide si el piloto queda en simulación.
- Días 31 a 60, construir el límite digital. Integra ER 2 con herramientas simuladas o aisladas. Usa vídeo representativo, llamadas estructuradas, pruebas de ambigüedad y registro de progreso. Ejecuta una evaluación fija antes del control real.
- Días 61 a 90, supervisar movimiento limitado. Si el caso de seguridad lo permite, conecta solo habilidades revisadas, a velocidad reducida y en zona controlada. Un humano aprueba acciones. Mide finalización, recuperación, intervención, paradas falsas, latencia y coste por tarea aceptada.
En el día 90 se amplía, rediseña o detiene. No escales porque la mejor demo funcionó una vez. Escala cuando la distribución medida supera un umbral acordado y el equipo puede explicar y recuperar cada fallo relevante.
Qué preguntar a un socio de IA robótica
- ¿Qué modelo está disponible hoy, ER 2 por API o un VLA por programa de socios?
- ¿Qué tarea del benchmark se parece a la nuestra y cuál es la distribución completa?
- ¿Qué queda determinista por debajo del modelo: equilibrio, colisiones, fuerza y parada?
- ¿Cómo se recogen, versionan y aprueban los ejemplos de adaptación?
- ¿Qué datos salen de las instalaciones y qué inferencia permanece local?
- ¿Cómo se reproducen fallos y se comparan modelos, prompts o controladores?
- ¿Quién posee integración, datos, telemetría y reversión si cambia el acceso?
El servicio de ingeniería de productos de IA de Wavect puede convertir razonamiento, integración y evaluación en un piloto acotado que tu equipo controla. Nuestro caso de Twinsoft AI muestra la disciplina necesaria para llevar IA a un flujo fiable. Para decidir viabilidad antes de invertir en hardware, reserva una sesión de discovery de IA física.
Preguntas frecuentes
¿Qué es Gemini Robotics 2?
¿Qué significa control corporal completo?
¿Gemini Robotics 2 está disponible para desarrolladores?
¿Gemini Robotics 2 logró un 92 % de éxito?
¿Bastan menos de 200 ejemplos para un robot nuevo?
¿Es seguro Gemini Robotics 2 para producción?
¿Cuál es el mejor primer uso comercial de ER 2?
Fuentes primarias y límite de la investigación
- Google DeepMind, lanzamiento de Gemini Robotics 2; familia, acceso, demostraciones, benchmarks y adaptación.
- Google, lanzamiento para desarrolladores de ER 2; API, herramientas, streaming y evaluación de progreso.
- Google DeepMind, ficha de ER 2; distribución, uso previsto y límites de producción.
- Google DeepMind, ficha de On-Device 2; acceso, alcance de evaluación y límites conocidos.
- Google DeepMind, informe de seguridad; proximidad humana, incertidumbre y seguridad por capas.
Estado comprobado el 7 de agosto de 2026. Usamos material público, fichas e informes de seguridad. No recibimos acceso al modelo, no operamos Apollo 2 ni reproducimos los benchmarks. Las tasas son evaluaciones del proveedor, no resultados de Wavect.
Reflexiones finales
Gemini Robotics 2 importa porque la parte más dinámica de la robótica pasa de manipulaciones aisladas a un sistema por capas que razona, se mueve y verifica una tarea completa. La coordinación corporal y la transferencia rápida pueden reducir la programación específica para cada robot y flujo.
El lanzamiento también demuestra por qué una compra necesita el benchmark entero. Un 92 % puede convivir con un 32 % a 44 % en tareas cercanas, el acceso público al razonamiento con acceso restringido a la acción, y una mejor seguridad semántica con la necesidad de barreras deterministas. Prueba un flujo estrecho, mide la distribución completa y deja que la evidencia justifique cada aumento de autonomía física.
