es.wedoany.com Noticia: Danfei Xu, de China, ha lanzado una iniciativa llamada EgoVerse, un ecosistema y estándar de datos de operaciones humanas en primera persona, cuyo objetivo es catalizar el aprendizaje robótico de manera similar a como ImageNet impulsó la visión artificial. Danfei Xu es actualmente profesor asistente en la Facultad de Computación Interactiva del Instituto de Tecnología de Georgia (Georgia Institute of Technology) y director del Laboratorio de Aprendizaje y Razonamiento Robótico (RL2). Durante su doctorado en la Universidad de Stanford (Stanford University), fue co-supervisado por Fei-Fei Li y Silvio Savarese. EgoVerse es una infraestructura de datos de crecimiento sostenible, cuyos socios de la alianza incluyen el Instituto de Tecnología de Georgia, la Universidad de Stanford, el Instituto Federal Suizo de Tecnología de Zúrich (ETH Zurich), la Universidad de California en San Diego (University of California San Diego), así como empresas como Meta, Scale AI, Guanglun Intelligence, Mecka AI, MicroAGI y Trace Labs. Guanglun Intelligence es la única empresa china que participa en esta iniciativa.
El aprendizaje robótico ha enfrentado durante mucho tiempo un cuello de botella en la adquisición de datos. El entrenamiento actual aún depende de la teleoperación con robots reales, donde cada demostración adicional requiere hardware, personal y espacio, lo que resulta en costos elevados y escenarios de tareas limitados. El comportamiento humano contiene naturalmente información visual y de movimiento rica, lo que lo convierte en una fuente de entrenamiento más ideal. Sin embargo, los conjuntos de datos humanos anteriores eran en su mayoría proyectos únicos, con equipos de recolección, sistemas de coordenadas y definiciones de tareas no uniformes, lo que dificultaba el entrenamiento combinado. EgoVerse está diseñado como un marco de colaboración "vivo" para superar esta limitación, permitiendo que los datos encarnados globales fluyan bajo un mismo "sistema lingüístico".
La versión pública actual de EgoVerse contiene 1362 horas de datos de demostración humana, aproximadamente 80,000 episodios, 1965 tareas, 240 escenarios y 2087 recolectores. Los datos abarcan videos en primera persona, poses de cámara, información tridimensional de manos y descripciones lingüísticas detalladas, y se ha verificado el efecto de transferencia en diferentes laboratorios, robots y morfologías.

EgoVerse reúne a múltiples instituciones líderes para su avance conjunto. El Instituto de Tecnología de Georgia actúa como centro organizativo y marco de investigación, y el equipo de Danfei Xu es responsable de la verificación de tareas representativas. El equipo del profesor Shuran Song de la Universidad de Stanford, a través de su UMI (Interfaz de Manipulación Universal), permite que los datos de operación humana se transfieran a diferentes plataformas robóticas. Meta proporciona al proyecto sus gafas especializadas de recolección de datos, Project Aria. Mecka AI impulsa el uso de iPhones y dispositivos portátiles ligeros para la recolección en primera persona, reduciendo la barrera de hardware. Scale AI se encarga de la limpieza, anotación y gestión de calidad de los datos. MicroAGI explora la recolección distribuida mediante crowdsourcing. Trace Labs también participa en la iniciativa. La contribución de Guanglun Intelligence es establecer un sistema de control de calidad que abarca la recolección en el extremo del dispositivo, el procesamiento en la nube y la verificación en simulación.
Guanglun Intelligence descompone la calidad de los datos humanos en tres etapas. Primero, mediante un agente que impulsa la monitorización en tiempo real del proceso de recolección, se controla la integridad de la tarea, la efectividad de las acciones y la distribución de los datos, y se corrigen desviaciones en el sitio de recolección. En segundo lugar, a través de una plataforma en la nube compatible con múltiples hardware de recolección, se logra un estándar de datos unificado, manejando la odometría visual-inercial (VIO), anotaciones tridimensionales de manos y cuerpo, y anotaciones semánticas de acciones de nivel V7; la solución de datos humanos de Guanglun Intelligence, EgoSuite, puede proporcionar estas anotaciones a escala de producción. Finalmente, utilizando la plataforma de simulación SimFoundry y la plataforma de evaluación RoboFinals, se verifica si los datos son realmente valiosos para el aprendizaje robótico, y los resultados de la evaluación se retroalimentan para guiar la siguiente ronda de recolección, formando un ciclo cerrado de calidad de datos.
Guanglun Intelligence también participa en otro proyecto global de infraestructura de IA física, Newton. Este proyecto es co-iniciado por NVIDIA, Google DeepMind y Disney Research, y su comité directivo técnico está compuesto por NVIDIA, Google DeepMind, Disney Research, Guanglun Intelligence y el Instituto de Investigación de Toyota (TRI), con el objetivo de definir la hoja de ruta técnica para la simulación robótica y el modelado físico. Guanglun Intelligence es actualmente la única empresa china que participa simultáneamente en los dos sistemas de estándares internacionales, EgoVerse y Newton, pasando de ser un usuario de estándares a un co-definidor de los mismos.










