Google de EE. UU. lanza el modelo de robot humanoide Gemini Robotics 2
2026-07-31 14:24
Favoritos

es.wedoany.com Noticia: El laboratorio de investigación de inteligencia artificial DeepMind de Alphabet Inc. (Google DeepMind) presentó hoy la serie de modelos Gemini Robotics 2. Esta serie está diseñada para robots humanoides y puede admitir que múltiples robots autónomos colaboren para completar una tarea, así como ejecutar automáticamente tareas domésticas que implican cientos de pasos.

Actualmente, los robots humanoides convencionales adoptan una arquitectura de IA de doble sistema: el modelo de razonamiento encarnado se encarga de formular el plan de alto nivel para la ejecución de tareas, mientras que el modelo VLA convierte el plan en instrucciones de bajo nivel para los motores del robot. El núcleo de la serie Gemini Robotics 2 es un modelo de razonamiento encarnado llamado Gemini Robotics ER 2, con el que los usuarios pueden describir en lenguaje natural las tareas que el robot debe ejecutar. Según Google, ER 2 puede admitir tareas que implican cientos de pasos y que duran varios minutos.

ER 2 puede dividir tareas largas entre múltiples robots diferentes para acelerar su finalización, y su función de llamada a herramientas permite que el modelo acceda a servicios en la nube externos, como usar la búsqueda de Google para aclarar partes del mensaje que no puede comprender.

Ante la necesidad de que los robots humanoides reintenten tareas fallidas, los ingenieros han equipado a ER 2 con dos funciones. Primero, el modelo puede usar las imágenes capturadas por las propias cámaras del robot para realizar un seguimiento del progreso de la tarea; cuando se produce un error, identifica el último paso completado correctamente y continúa desde donde se interrumpió, evitando tener que rehacer todo desde el principio. Segundo, ER 2 es superior a los modelos anteriores a la hora de determinar cuándo se completa una tarea; cuanto antes confirme el robot que una tarea ha terminado, más rápido podrá pasar a la siguiente, y esta función también ayuda a simplificar procesos como la identificación y corrección de errores.

Los ingenieros de Google, Steven Hansen y Peng Xu, explicaron en el blog de la empresa que, al observar flujos de video continuos, el robot puede rastrear su propio progreso, ajustarse cuando surgen problemas y determinar con claridad cuándo pasar al siguiente paso.

Después de que ER 2 formula el plan de acción, puede enviar instrucciones a uno de los otros dos modelos VLA de la serie Gemini Robotics 2. El primer modelo, llamado Gemini Robotics 2, puede controlar todas las partes del cuerpo del robot humanoide, no solo las manos, y optimiza el centro de gravedad del robot anfitrión reduciendo el riesgo de caídas, al tiempo que admite una mayor variedad de manos robóticas que el software anterior de DeepMind.

El segundo modelo VLA, llamado Gemini Robotics On-Device 2, está diseñado para ejecutarse directamente en la computadora integrada del robot humanoide y puede adaptarse a un robot nuevo con solo unas horas de entrenamiento. Los desarrolladores pueden acceder a ER 2 a través de Google Cloud, la API de Gemini y Google AI Studio.

Junto con el lanzamiento del modelo, Google también presentó un nuevo punto de referencia de seguridad para IA encarnada, el ASIMOV-Agentic Benchmark, para evaluar la capacidad de los robots humanoides de evitar riesgos como colisiones.

Este boletín es una compilación y reproducción de información de Internet global y socios estratégicos, y está destinado únicamente a proporcionar a los lectores la comunicación. Si hay infracción u otros problemas, por favor infórmenos a tiempo, este sitio será modificado o eliminado. Toda reproducción de este artículo sin autorización formal está estrictamente prohibida. Correo electrónico: news@wedoany.com