For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/es/articles/gpt-6-astra-unitree-g1-homebody-kitchen-r-56df14d6.md.
El proyecto HomeBody, desarrollado por Stanford y Caltech, conecta GPT Astra con un humanoide Unitree G1 para explorar una cocina desconocid...

El último avance de la IA incorporada no es otra demostración de un brazo robótico sobre una mesa.
Ahora se ha mostrado un humanoide Unitree G1 explorando una cocina desconocida, recordando dónde están los objetos, recogiendo elementos de distintas zonas, abriendo cajones, recuperando medicamentos que ya no están visibles y entregándoselos a una persona.
El proyecto se llama HomeBody y procede de investigadores de Stanford University y Caltech.
Su idea central es sorprendentemente sencilla:
Permitir que un modelo de visión y lenguaje de frontera trate las habilidades robóticas como herramientas.
En lugar de pedir al modelo que genere cada comando de las articulaciones, HomeBody permite que GPT Astra comprenda la tarea, decida qué debe ocurrir a continuación y ejecute habilidades reutilizables de navegación, recogida, colocación, apertura de cajones y recuperación de objetos.
Esto convierte al modelo en un planificador de alto nivel, en lugar de un controlador motor de bajo nivel.
El resultado es un flujo de trabajo robótico con un horizonte más largo que la configuración habitual de “ver un objeto, recogerlo y detenerse”.
En la demostración en la cocina, el robot primero explora el entorno y crea una memoria espacial persistente. Después reconstruye un gemelo digital, alinea esa representación con la habitación real y utiliza las observaciones recordadas para completar instrucciones posteriores.
Por ejemplo, el usuario puede decir:
“Ordena la cocina. Pon las bolsas de café en la isla y tira los envases estropeados.”
A continuación, el G1 se desplaza entre distintas ubicaciones, recoge las bolsas de café y desecha los envases indicados.
Una segunda tarea resulta todavía más reveladora:
“He olvidado mi medicamento, ¿puedes traérmelo? Y tira también el envase en mal estado mientras estás allí.”
El medicamento no está visible cuando se formula la petición.
HomeBody busca en su memoria espacial almacenada, recuerda el cajón donde se observó anteriormente el medicamento, navega hasta allí, abre el cajón, recupera el medicamento, se lo entrega a la persona y completa la tarea de desechar el envase.
Ese es el cambio importante.
El robot ya no reacciona únicamente a lo que tiene delante de su cámara en ese momento. Combina la percepción actual, las observaciones recordadas, la geometría de la habitación, la navegación, la manipulación y la secuenciación de tareas en todo el espacio.

El diseño central de HomeBody puede resumirse en una frase:
GPT Astra selecciona y secuencia habilidades robóticas mediante llamadas estructuradas a herramientas.
El modelo se encarga de comprender el objetivo del usuario y decidir qué debe suceder a continuación.
La pila robótica gestiona los detalles físicos.
Una vista simplificada sería la siguiente:
Instrucción del usuario
↓
GPT Astra / System 2
↓
Elegir habilidad + objetivo
↓
Navegar / Recoger / Colocar / Abrir cajón / Recoger del cajón
↓
Percepción + planificación del movimiento + control de bajo nivel
↓
Resultado de la ejecución
↓
Devolver el resultado a GPT Astra
↓
Elegir la siguiente acción
Sin embargo, antes de que el robot pueda recoger algo de una cocina desconocida, necesita más que una biblioteca de habilidades.
Debe saber cómo es la cocina y dónde se encuentran los objetos recordados.
HomeBody crea ese contexto en tres etapas.
La primera instrucción es deliberadamente sencilla:
Eres un robot de cocina; ¡explora el espacio!
A continuación, GPT Astra selecciona puntos de observación útiles y guía al G1 por la habitación.
Durante la exploración, HomeBody recopila varias formas de datos, entre ellas:
La cámara muestra el contenido de la habitación.
El LiDAR y otros sensores proporcionan la estructura espacial medida.
SLAM —localización y mapeo simultáneos— ayuda al robot a construir un mapa mientras estima su propia posición dentro de él.
La parte crucial es la persistencia.
Cuando el G1 se aleja de un objeto, la información no desaparece junto con la vista de la cámara.
HomeBody almacena las observaciones y las asocia con ubicaciones para que las tareas posteriores puedan recuperarlas.
Así es como una petición como “tráeme mi medicamento” puede funcionar aunque el medicamento esté oculto dentro de un cajón o fuera del campo de visión del robot.
La exploración por sí sola no es suficiente.
A continuación, HomeBody utiliza GPT Astra como un agente Real2Sim para crear una reconstrucción digital del entorno en NVIDIA Isaac Sim.

El gemelo digital funciona como un modelo espacial de la cocina.
Proporciona al sistema una representación estructurada de:
Es importante destacar que la reconstrucción no se basa únicamente en la apariencia.
HomeBody también incorpora la geometría SLAM medida al proceso Real2Sim.
Esto proporciona a la reconstrucción restricciones dimensionales del mundo real.
Es importante porque una reconstrucción visual atractiva no basta para la robótica.
El robot debe saber si un pasillo es realmente lo bastante ancho para atravesarlo, si el cuerpo puede situarse lo suficientemente cerca de un cajón y si un brazo puede alcanzar un objetivo sin colisionar con el entorno.
Después, el sistema alinea el mapa SLAM del mundo real con la simulación reconstruida en un sistema de coordenadas compartido.
Las observaciones de cámara almacenadas, las descripciones semánticas y las ubicaciones del robot pueden conectarse entonces con lugares físicos de la habitación.
Por tanto, en lugar de recordar únicamente:
Vi un frasco de medicamento.
HomeBody puede conservar algo más parecido a esto:
Vi el medicamento en este cajón,
en esta ubicación recordada,
dentro del sistema de coordenadas compartido de la habitación.
Eso es lo que hace posible la recuperación posterior.
Después de la exploración y la reconstrucción, el usuario puede emitir una tarea cotidiana.
Por ejemplo:
Ordena la cocina.
Pon las bolsas de café en la isla
y tira los envases estropeados.

En cada etapa, GPT Astra puede tener en cuenta:
A continuación, selecciona la siguiente habilidad y el objetivo.
La demostración del medicamento muestra por qué esto resulta útil.
El usuario no especifica el cajón.
El modelo puede recordar una observación anterior, volver a navegar hasta la zona correcta, abrir el cajón, recuperar el frasco, entregarlo y continuar con la instrucción de limpieza restante.
La tarea es lo bastante larga como para que ningún fotograma individual de la cámara contenga toda la información necesaria para completarla.
Ese es precisamente el contexto en el que la memoria espacial persistente resulta valiosa.
Este es el detalle arquitectónico más importante de HomeBody.
Es fácil escuchar que “GPT controla un robot humanoide” e imaginar que el modelo de lenguaje genera directamente cada ángulo de las articulaciones.
Eso no es lo que hace el sistema.
Trabajos anteriores, como RoboCurve, demostraron que modelos de frontera pueden controlar tareas de brazos robóticos observando imágenes de cámaras y el estado del robot, y utilizando herramientas que especifican la posición, la orientación y el estado de apertura o cierre de la pinza.
HomeBody opera en un nivel de abstracción superior.
El modelo ejecuta habilidades reutilizables completas.
El proyecto explica la pila humanoide habitual mediante tres niveles conceptuales:
Una arquitectura de acción aprendida convencional puede tener este aspecto:
VLM System 2
↓
VLA System 1
↓
Controlador de cuerpo completo System 0
HomeBody cambia la parte intermedia de esa canalización.
En lugar de exigir que un VLA aprendido traduzca la intención de alto nivel en acciones, el VLM ejecuta directamente una biblioteca de habilidades componibles.

La estructura resultante se acerca más a esta:
VLM System 2
↓
Biblioteca de habilidades
↓
Planificación del movimiento + percepción
↓
Control de cuerpo completo System 0
El vocabulario actual de habilidades de HomeBody incluye:
| Habilidad | Qué proporciona el modelo de alto nivel | Qué gestiona la habilidad |
|---|---|---|
| Navegar | Ubicación y orientación objetivo | Planificación de la ruta y ejecución de la locomoción |
| Recoger | Punto de imagen y elección de la mano | Segmentación, profundidad, pose de agarre, trayectoria del brazo y reintentos |
| Colocar | Mano y objetivo de liberación 3D | Mover el objeto sostenido hasta el objetivo y soltarlo |
| Abrir cajón | Objetivo del cajón o tirador | Alineación, postura de enganche y secuencia de tracción hacia atrás |
| Recoger del cajón | Objetivo del objeto dentro del cajón abierto | Alcance, agarre, elevación y lógica de reintento local |
Todas las habilidades comparten una interfaz para objetivos y resultados de ejecución.
El modelo no necesita comprender la implementación interna de bajo nivel de cada habilidad.
Solo debe decidir qué habilidad debe ejecutarse y cuál es su objetivo.
Para una acción de recogida, GPT Astra selecciona un punto en la imagen de la cámara subjetiva y elige qué mano utilizar.
A partir de ahí, la pila de habilidades toma el control.
Según la implementación de HomeBody:

En otras palabras:
GPT decide qué recoger
y qué mano utilizar.
La habilidad robótica decide
cómo llega físicamente la mano hasta allí.
Esta separación mantiene al modelo de frontera centrado en el razonamiento y la secuenciación de tareas, en lugar de hacerlo responsable del control motor en tiempo real.
El mundo físico es ruidoso.
Un objeto puede desplazarse en la imagen de la cámara mientras el robot se aproxima.
Un agarre puede cerrarse sin entrar en contacto.
El robot puede necesitar ajustar su postura.
Por ello, HomeBody no exige una nueva decisión de GPT para cada pequeña corrección.
El proyecto utiliza segmentación y seguimiento SAM 2.1 con selección de memoria de estilo SAMURAI para seguir los objetivos entre fotogramas.
A continuación, el servo visual puede corregir localmente la alineación.
Si un agarre falla, la habilidad puede probar otro candidato de agarre o reposicionar el robot y volver a planificar.
Estos reintentos locales están acotados.
Cuando la habilidad local ya no puede recuperarse, envía el motivo del fallo a GPT Astra.
El VLM puede entonces elegir un objetivo diferente, reposicionar el robot o cambiar el plan de alto nivel.
El ciclo es el siguiente:
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Decidir
↓
Ejecutar la habilidad
↓
Observar el resultado
↓
Reintento local si es posible
↓
Devolver el resultado a GPT Astra
↓
Volver a planificar si es necesario
Así se pueden encadenar varias habilidades en una secuencia más larga, como:
Navegar hasta el cajón
→ Abrir el cajón
→ Recoger el medicamento
→ Navegar hasta la persona
→ Entregar el medicamento
→ Encontrar el envase
→ Tirar el envase
Aunque el planificador de alto nivel seleccione la habilidad correcta, un humanoide todavía debe mantener el equilibrio al caminar y alcanzar objetos.
HomeBody utiliza AMO (Adaptive Motion Optimization), previamente entrenado, para el control de la parte inferior del cuerpo teniendo en cuenta la parte superior.
El controlador considera los objetivos de la parte superior del cuerpo mientras coordina la locomoción.
Según la página del proyecto, los comandos de brazos y manos se ejecutan a 250 Hz, mientras que la política AMO se actualiza en cada quinto ciclo de control, a 50 Hz.
Esta es otra razón por la que la expresión “sin entrenamiento adicional” necesita contexto.
La nueva cocina no requiere una política de acción entrenada de nuevo y específica para ese entorno.
Pero el sistema sigue dependiendo de componentes previamente entrenados y diseñados bajo el VLM.
Una de las afirmaciones más importantes de HomeBody es que puede trasladarse a una cocina no vista previamente sin recopilar datos de entrenamiento específicos del entorno ni aprender una nueva política de acción para esa habitación.
Esto es significativo.
La implementación tradicional de robots suele requerir demostraciones, entrenamiento de políticas o ajustes específicos del entorno antes de que el robot pueda actuar de forma fiable.
HomeBody combina, en cambio:
Esto desplaza parte de la carga de adaptación del reentrenamiento hacia el razonamiento + mapeo + herramientas reutilizables.
El flujo completo de HomeBody puede resumirse así:

Explorar una habitación desconocida
↓
Recopilar observaciones subjetivas + SLAM + posiciones
↓
Crear un gemelo digital con Real2Sim
↓
Alinear los sistemas de coordenadas real y simulado
↓
Almacenar las observaciones espaciales
↓
Recibir una instrucción cotidiana
↓
GPT Astra elige la habilidad + el objetivo
↓
La pila robótica local ejecuta la acción
↓
Devolver el resultado
↓
Continuar hasta completar la tarea
La demostración de investigación es impresionante, pero no equivale a comprar un G1, introducir una clave de API y obtener un robot doméstico.
La pila actual de HomeBody todavía necesita una infraestructura robótica considerable.
Los investigadores informan de que la percepción, la planificación del movimiento y la ejecución de habilidades se ejecutan en un único portátil Razer Blade con una GPU RTX 4090.
GPT Astra se ejecuta de forma remota y envía solicitudes de habilidades y objetivos a la máquina local.
Esto significa que la arquitectura se divide entre dos entornos de computación:
Modelo de frontera remoto
→ razonamiento de alto nivel y selección de habilidades
Sistema local con RTX 4090
→ percepción, geometría, planificación, habilidades y ejecución
El proyecto también enumera varios costes y limitaciones prácticas.
El gemelo digital debe crearse antes de que el flujo de trabajo completo pueda utilizar su representación espacial.
Esto añade tiempo de preparación.
El modelo de frontera remoto se consulta durante la planificación y el trabajo Real2Sim.
Esto añade un coste de API.
Astra no responde de forma instantánea.
Los investigadores señalan que existen pausas entre habilidades mientras se completa el razonamiento de alto nivel.
En las tareas domésticas, esas pausas importan porque las tareas físicas ya requieren mucho más tiempo que las tareas puramente digitales.
La manipulación humanoide prolongada también se enfrenta a límites mecánicos.
La página de HomeBody menciona específicamente el sobrecalentamiento de los servos de los dedos durante operaciones prolongadas.
El robot solo puede realizar tareas compatibles con sus manos, alcance, equilibrio, percepción y conjunto de habilidades implementadas.
Por tanto, el proyecto es una demostración de investigación sobre autonomía de larga duración, no un asistente doméstico general que ya pueda encargarse de cualquier tarea.
HomeBody forma parte de una ola más amplia de trabajos que conectan modelos de frontera con robots físicos.
El artículo de referencia destaca tres enfoques cada vez más habituales.
En una configuración al estilo de RoboCurve, el modelo recibe imágenes y el estado del robot y después ejecuta herramientas que especifican objetivos como:
Una pila de cinemática inversa o de control de bajo nivel convierte esos objetivos en movimiento robótico.
El modelo permanece en un ciclo frecuente de observar-decidir-actuar.
Un segundo enfoque utiliza un modelo de lenguaje y visión de frontera para el razonamiento lento de alto nivel y un VLA aprendido para generar acciones.
Conceptualmente:
Planificador VLM
→ Modelo de acción VLA
→ Controlador de bajo nivel
Esto mantiene al modelo de frontera por encima de la capa motora, pero sigue utilizando una política aprendida para convertir los planes en acciones físicas.
HomeBody adopta una ruta diferente.
Elimina la necesidad de un VLA aprendido en la parte intermedia y permite que el VLM de frontera invoque directamente habilidades reutilizables.
Esas habilidades pueden ser algoritmos clásicos, políticas aprendidas u otros controladores.
El proyecto HomeBody permite explícitamente añadir nuevas habilidades mediante la interfaz compartida.
Esto hace que la arquitectura sea modular:
Sustituir el VLM
o
añadir una nueva habilidad
sin rediseñar todo el sistema robótico
La idea más profunda no consiste simplemente en “añadir otra capa System 0”.
Se trata de una conexión diferente entre el razonamiento y la ejecución física.
Combinada con la memoria espacial, esa conexión permite al robot trabajar por toda una habitación en lugar de limitarse a una única mesa.
El artículo de referencia termina examinando los resultados de evaluación del control robótico de terceros de RoboCurve.
Estos resultados deben interpretarse como mediciones específicas de benchmarks robóticos, no como afirmaciones universales sobre la inteligencia general de los modelos.
En el resultado de RoboCurve compartido por Jay Chooi, GPT-6 Sol obtuvo, según se informa, una puntuación aproximadamente 1,6 veces superior a GPT-5.6 Sol en el conjunto de tareas robóticas, con un coste por prueba aproximadamente un 47 % menor.

El mismo gráfico situó a GPT-6 Sol por debajo de la frontera de Pareto preliminar establecida por configuraciones más potentes de Opus 5.5 en esa evaluación.
Esto aporta evidencia útil de que el coste y el rendimiento del control robótico no siempre evolucionan juntos.
Un modelo más barato puede ser una opción operativa mejor, aunque otro modelo siga alcanzando una puntuación superior.
Otro resultado de RoboCurve cubrió 360 pruebas robóticas.
El promedio comunicado mostró que Opus 5.5 obtuvo una puntuación aproximadamente 1,8 veces superior a Opus 5, con cerca de la mitad del coste, y que igualó aproximadamente la puntuación media de Astra con un coste alrededor de un 21 % inferior.

De nuevo, esto no es un benchmark general de Anthropic u OpenAI.
Se trata de una evaluación de control robótico de terceros sobre un conjunto específico de tareas, hardware, instrucciones y condiciones de prueba.
La distinción es importante porque el rendimiento de la IA incorporada depende del sistema completo:
Modelo
×
Instrucciones
×
Hardware robótico
×
Percepción
×
Pila de control
×
Diseño de habilidades
×
Definición de la tarea
Un modelo que obtiene el mejor resultado en un benchmark de programación no tiene por qué ser el modelo con la mejor relación coste/rendimiento al controlar un robot.
La parte más interesante de HomeBody no es que un humanoide haya movido una bolsa de café.
Los robots llevan años manipulando objetos.
El cambio importante es arquitectónico.
HomeBody muestra una forma práctica de combinar:
El modelo de frontera no necesita aprender todos los detalles motores.
El robot tampoco necesita una nueva política integral entrenada específicamente para cada cocina.
En su lugar, un modelo general razona sobre un entorno estructurado y coordina capacidades reutilizables.
Esto se parece a la forma en que funcionan cada vez más los agentes de software:
El modelo razona
→ ejecuta herramientas
→ lee los resultados
→ elige la siguiente herramienta
HomeBody lleva el mismo patrón al mundo físico.
Las herramientas ya no son la búsqueda web, Python o una base de datos.
Son:
Navegar
Recoger
Colocar
Abrir cajón
Recoger del cajón
Por eso el proyecto parece un paso importante para los agentes incorporados.
HomeBody es un sistema de investigación de Stanford y Caltech que proporciona a un robot humanoide memoria espacial persistente y una biblioteca de habilidades motoras componibles. Un modelo de visión y lenguaje de frontera planifica tareas de larga duración y ejecuta esas habilidades mediante interfaces estructuradas de herramientas.
No. La página del proyecto HomeBody identifica al planificador como GPT Astra y lo utiliza como un modelo System 2 de alto nivel. La navegación, la manipulación, la percepción, la planificación del movimiento, los reintentos y el control de todo el cuerpo son gestionados por módulos robóticos de bajo nivel y controladores previamente entrenados.
Los investigadores afirman que la cocina desconocida mostrada no requiere datos de entrenamiento específicos del entorno ni aprendizaje adicional de la política. El sistema sigue dependiendo de modelos de percepción previamente entrenados, habilidades reutilizables, SLAM, software de planificación y un controlador AMO de cuerpo completo previamente entrenado.
Durante la exploración, HomeBody almacena observaciones de la cámara subjetiva junto con el contenido semántico y las posiciones en un sistema de coordenadas espaciales compartido. Cuando una petición posterior se refiere a un objeto fuera de la vista, GPT Astra puede recuperar un fotograma clave almacenado y navegar de vuelta a la ubicación recordada.
La etapa Real2Sim proporciona al planificador de alto nivel un modelo espacial estructurado de la habitación. HomeBody también fundamenta la reconstrucción en la geometría SLAM medida, de modo que las decisiones de navegación y manipulación se vinculan a dimensiones reales y no solo a la apariencia visual.
El proyecto informa de que las habilidades locales, la percepción y la planificación del movimiento se ejecutan en un portátil Razer Blade con una GPU RTX 4090, mientras que GPT Astra se ejecuta de forma remota. La configuración actual también requiere el hardware humanoide, cámaras, componentes LiDAR/SLAM, conectividad de red y la pila de software robótico del proyecto.
No. El proyecto demuestra una autonomía significativa de larga duración, pero sus propias limitaciones incluyen el tiempo de configuración de Real2Sim, el coste de la API, la latencia del razonamiento, los límites de manipulación y problemas de resistencia del hardware, como el sobrecalentamiento de los servos de los dedos.
No. Las cifras analizadas en la fuente proceden de RoboCurve, un evaluador independiente de terceros, y se aplican a sus conjuntos de tareas robóticas y condiciones de prueba. No deben generalizarse como clasificaciones generales de modelos fuera de ese contexto.
HomeBody muestra cómo un modelo de frontera puede convertirse en el planificador de alto nivel de un humanoide sin generar directamente cada comando motor de bajo nivel. GPT Astra explora una habitación desconocida, utiliza una reconstrucción Real2Sim y una memoria espacial persistente, y después compone habilidades de navegación y manipulación para completar tareas de cocina de larga duración.
La decisión de diseño clave es la modularidad. El modelo decide qué debe ocurrir a continuación, mientras que la percepción, la geometría, la planificación del movimiento, los reintentos locales y el control de todo el cuerpo deciden cómo ejecutarlo físicamente. Esto permite al sistema entrar en una cocina nueva sin entrenar una política de acción específica para ese entorno, aunque siga dependiendo de una infraestructura robótica considerable, previamente entrenada y diseñada.
La implementación actual sigue siendo un sistema de investigación y no un robot doméstico listo para usar: necesita una máquina local de una clase equivalente a RTX 4090, inferencia remota del modelo, configuración de simulación, acceso a la API y hardware robótico robusto. Los investigadores también documentan límites de latencia y resistencia que siguen siendo relevantes en tareas reales prolongadas.
El paso importante no es simplemente que “GPT pueda controlar un robot”, sino que un modelo de propósito general ahora puede utilizar memoria espacial y habilidades físicas reutilizables de forma parecida a como un agente de software utiliza herramientas.
Empieza con una sola frase y obtén un sitio completo en minutos.