For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/fr/articles/gpt-6-astra-unitree-g1-homebody-kitchen-r-56df14d6.md.
Le projet HomeBody de Stanford et Caltech relie GPT Astra à un humanoïde Unitree G1 afin d’explorer une cuisine inconnue, de construire une ...

La dernière avancée de l’IA incarnée n’est pas une nouvelle démonstration avec un bras robotique posé sur une table.
Un humanoïde Unitree G1 a désormais été montré en train d’explorer une cuisine inconnue, de mémoriser l’emplacement d’objets, de ranger des éléments situés à différents endroits, d’ouvrir des tiroirs, de récupérer un médicament qui n’est plus visible et de le remettre à une personne.
Le projet s’appelle HomeBody et est mené par des chercheurs de Stanford University et de Caltech.
Son idée centrale est étonnamment simple :
Laisser un modèle de vision et de langage de pointe traiter les compétences robotiques comme des outils.
Au lieu de demander au modèle de produire chaque commande articulaire, HomeBody permet à GPT Astra de comprendre la tâche, de décider de l’étape suivante et d’appeler des compétences réutilisables pour naviguer, saisir, déposer, ouvrir un tiroir et récupérer un objet.
Le modèle devient ainsi un planificateur de haut niveau plutôt qu’un contrôleur moteur bas niveau.
Le résultat est un workflow robotique à plus long horizon que le scénario habituel « voir un objet, le saisir, s’arrêter ».
Dans la démonstration en cuisine, le robot commence par explorer l’environnement et construit une mémoire spatiale persistante. Il reconstitue ensuite un jumeau numérique, aligne cette représentation sur la pièce réelle et utilise les observations mémorisées pour exécuter des instructions ultérieures.
Par exemple, l’utilisateur peut dire :
« Range la cuisine. Mets les sachets de café sur l’îlot et jette les cartons périmés. »
Le G1 se déplace alors entre différents endroits, récupère les sachets de café et jette les cartons indiqués.
Une deuxième tâche est encore plus révélatrice :
« J’ai oublié mon médicament, peux-tu me l’apporter ? Et jette aussi le mauvais carton pendant que tu y es. »
Le médicament n’est pas visible au moment de la demande.
HomeBody consulte sa mémoire spatiale enregistrée, se rappelle le tiroir où le médicament avait été observé auparavant, s’y dirige, ouvre le tiroir, récupère le médicament, le remet à la personne et accomplit malgré tout la tâche d’élimination du carton.
C’est là que se situe le changement important.
Le robot ne réagit plus uniquement à ce qui se trouve devant sa caméra à l’instant présent. Il combine la perception actuelle, les observations mémorisées, la géométrie de la pièce, la navigation, la manipulation et l’enchaînement des tâches dans l’ensemble de l’espace.

La conception centrale de HomeBody peut se résumer en une phrase :
GPT Astra sélectionne et enchaîne les compétences robotiques au moyen d’appels d’outils structurés.
Le modèle est chargé de comprendre l’objectif de l’utilisateur et de décider de l’étape suivante.
La pile robotique gère les détails physiques.
Une vue simplifiée se présente ainsi :
Instruction de l’utilisateur
↓
GPT Astra / System 2
↓
Choix de la compétence + de la cible
↓
Navigation / Saisie / Dépôt / Ouverture de tiroir / Saisie dans un tiroir
↓
Perception + planification des mouvements + contrôle bas niveau
↓
Résultat de l’exécution
↓
Retour du résultat à GPT Astra
↓
Choix de l’action suivante
Avant de pouvoir récupérer un objet dans une cuisine inconnue, le robot a toutefois besoin de plus qu’une bibliothèque de compétences.
Il doit savoir à quoi ressemble la cuisine et où se trouvent les objets mémorisés.
HomeBody construit ce contexte en trois étapes.
La première instruction est volontairement simple :
Tu es un robot de cuisine, explore l’espace s’il te plaît !
GPT Astra sélectionne ensuite des points de vue utiles et guide le G1 dans la pièce.
Pendant l’exploration, HomeBody collecte plusieurs types de données, notamment :
La caméra montre le contenu de la pièce.
Le LiDAR et les autres capteurs fournissent la structure spatiale mesurée.
Le SLAM — localisation et cartographie simultanées — aide le robot à construire une carte tout en estimant sa propre position à l’intérieur de celle-ci.
L’élément essentiel est la persistance.
Lorsque le G1 se détourne d’un objet, l’information ne disparaît pas avec le champ de vision de la caméra.
HomeBody enregistre les observations et les associe à des emplacements afin que les tâches ultérieures puissent les retrouver.
C’est ainsi qu’une demande telle que « apporte-moi mon médicament » peut fonctionner même si le médicament est actuellement caché dans un tiroir ou hors du champ de vision du robot.
L’exploration seule ne suffit pas.
HomeBody utilise ensuite GPT Astra comme agent Real2Sim pour créer une reconstitution numérique de l’environnement dans NVIDIA Isaac Sim.

Le jumeau numérique sert de modèle spatial de la cuisine.
Il fournit au système une représentation structurée de :
Il est important de noter que la reconstruction ne repose pas uniquement sur l’apparence.
HomeBody injecte également la géométrie SLAM mesurée dans le processus Real2Sim.
La reconstruction est ainsi soumise à des contraintes dimensionnelles du monde réel.
Cela compte, car une reconstruction visuelle convaincante ne suffit pas en robotique.
Le robot doit savoir si un passage est réellement assez large pour être franchi, si son corps peut se placer suffisamment près d’un tiroir et si un bras peut atteindre une cible sans entrer en collision avec l’environnement.
Le système aligne ensuite la carte SLAM du monde réel sur la simulation reconstruite dans un référentiel de coordonnées commun.
Les observations enregistrées par la caméra, les descriptions sémantiques et les positions du robot peuvent alors être reliées aux lieux physiques de la pièce.
Au lieu de mémoriser seulement :
J’ai vu un flacon de médicament.
HomeBody peut conserver quelque chose de plus précis :
J’ai vu le médicament dans ce tiroir,
à cet emplacement mémorisé,
dans le référentiel de coordonnées commun de la pièce.
C’est ce qui rend la récupération ultérieure possible.
Après l’exploration et la reconstruction, l’utilisateur peut donner une tâche quotidienne.
Par exemple :
Range la cuisine.
Mets les sachets de café sur l’îlot
et jette les cartons périmés.

À chaque étape, GPT Astra peut prendre en compte :
Il sélectionne ensuite la compétence et la cible suivantes.
La démonstration du médicament montre l’intérêt de cette approche.
L’utilisateur n’indique pas le tiroir.
Le modèle peut se rappeler une observation antérieure, revenir dans la zone appropriée, ouvrir le tiroir, récupérer le flacon, le remettre à la personne et poursuivre l’instruction de rangement restante.
La tâche est suffisamment longue pour qu’aucune image isolée ne contienne toutes les informations nécessaires à son accomplissement.
C’est précisément dans ce contexte que la mémoire spatiale persistante devient utile.
C’est le détail architectural le plus important de HomeBody.
Il est facile d’entendre « GPT contrôle un robot humanoïde » et d’imaginer que le modèle de langage produit directement chaque angle articulaire.
Ce n’est pas ainsi que fonctionne le système.
Des travaux antérieurs tels que RoboCurve ont montré des modèles de pointe contrôlant des tâches avec bras robotique en observant les images de caméra et l’état du robot, puis en utilisant des outils qui spécifient la position, l’orientation et l’état ouvert/fermé de la pince.
HomeBody fonctionne à un niveau d’abstraction supérieur.
Le modèle appelle des compétences réutilisables complètes.
Le projet décrit la pile humanoïde courante avec trois niveaux conceptuels :
Une architecture d’action apprise classique peut se présenter ainsi :
System 2 VLM
↓
System 1 VLA
↓
Contrôleur corps entier System 0
HomeBody modifie la partie centrale de ce pipeline.
Au lieu d’exiger qu’un VLA appris traduise l’intention de haut niveau en action, le VLM appelle directement une bibliothèque de compétences composables.

La structure obtenue est plus proche de ceci :
System 2 VLM
↓
Bibliothèque de compétences
↓
Planification des mouvements + perception
↓
Contrôle du corps entier System 0
Le vocabulaire actuel des compétences de HomeBody comprend :
| Compétence | Ce que fournit le modèle de haut niveau | Ce que gère la compétence |
|---|---|---|
| Naviguer | Emplacement et orientation cibles | Planification de l’itinéraire et exécution de la locomotion |
| Saisir | Point dans l’image et choix de la main | Segmentation, profondeur, pose de préhension, trajectoire du bras, nouvelles tentatives |
| Déposer | Main et cible de relâchement en 3D | Déplacement de l’objet tenu vers la cible et relâchement |
| Ouvrir un tiroir | Cible du tiroir ou de la poignée | Alignement, posture d’accrochage, séquence de traction vers l’arrière |
| Saisir dans un tiroir | Cible située dans le tiroir ouvert | Extension, préhension, levage et logique locale de nouvelle tentative |
Toutes les compétences partagent une interface pour les cibles et les résultats d’exécution.
Le modèle n’a pas besoin de comprendre l’implémentation bas niveau interne de chaque compétence.
Il doit seulement décider quelle compétence exécuter et quelle doit être sa cible.
Pour une action de saisie, GPT Astra sélectionne un point dans l’image de la caméra embarquée et choisit la main à utiliser.
La pile de compétences prend ensuite le relais.
Selon l’implémentation de HomeBody :

En d’autres termes :
GPT décide quoi saisir
et quelle main utiliser.
La compétence robotique décide
comment la main y parvient physiquement.
Cette séparation permet au modèle de pointe de se concentrer sur le raisonnement et l’enchaînement des tâches, plutôt que de devoir assurer le contrôle moteur en temps réel.
Le monde physique est bruité.
Un objet peut se déplacer dans l’image de la caméra lorsque le robot s’en approche.
Une prise peut se refermer sans entrer en contact.
Le robot peut devoir ajuster sa position.
HomeBody n’exige donc pas une nouvelle décision de GPT pour chaque petite correction.
Le projet utilise la segmentation et le suivi SAM 2.1 avec une sélection de mémoire de type SAMURAI pour suivre les cibles d’une image à l’autre.
Le servo-visuel peut ensuite corriger localement l’alignement.
Si une prise échoue, la compétence peut essayer un autre candidat de préhension ou repositionner le robot et replanifier.
Ces nouvelles tentatives locales sont limitées.
Lorsque la compétence locale ne peut plus récupérer la situation, elle renvoie la raison de l’échec à GPT Astra.
Le VLM peut alors choisir une autre cible, repositionner le robot ou modifier le plan de haut niveau.
La boucle devient :
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
Décider
↓
Exécuter la compétence
↓
Observer le résultat
↓
Nouvelle tentative locale si possible
↓
Renvoyer le résultat à GPT Astra
↓
Replanifier si nécessaire
C’est ainsi que plusieurs compétences peuvent être enchaînées dans une séquence plus longue, par exemple :
Naviguer jusqu’au tiroir
→ Ouvrir le tiroir
→ Saisir le médicament
→ Naviguer jusqu’à la personne
→ Remettre le médicament
→ Trouver le carton
→ Jeter le carton
Même si le planificateur de haut niveau sélectionne la bonne compétence, un humanoïde doit toujours conserver son équilibre en marchant et en tendant le bras.
HomeBody utilise AMO (Adaptive Motion Optimization), préentraîné pour le contrôle du bas du corps tenant compte du haut du corps.
Le contrôleur prend en compte les cibles du haut du corps tout en coordonnant la locomotion.
Selon la page du projet, les commandes des bras et des mains s’exécutent à 250 Hz, tandis que la politique AMO est mise à jour toutes les cinq périodes de contrôle, soit à 50 Hz.
C’est une autre raison pour laquelle l’expression « aucun entraînement supplémentaire » doit être contextualisée.
La nouvelle cuisine ne nécessite pas de politique d’action nouvellement entraînée pour un environnement spécifique.
Mais le système dépend toujours de composants précédemment entraînés et conçus sous-jacents au VLM.
L’une des affirmations les plus fortes de HomeBody est que le système peut fonctionner dans une cuisine jamais vue auparavant sans collecter de données d’entraînement propres à l’environnement ni apprendre une nouvelle politique d’action pour cette pièce.
C’est significatif.
Le déploiement traditionnel d’un robot nécessite souvent des démonstrations, un entraînement de politique ou un réglage propre à l’environnement avant que le robot puisse agir de manière fiable.
HomeBody combine plutôt :
Une partie de l’adaptation est ainsi déplacée du réentraînement vers le raisonnement + la cartographie + les outils réutilisables.
Le flux complet de HomeBody peut être résumé ainsi :

Explorer une pièce inconnue
↓
Collecter les observations embarquées + SLAM + positions
↓
Construire un jumeau numérique avec Real2Sim
↓
Aligner les référentiels de coordonnées réel et simulé
↓
Enregistrer les observations spatiales
↓
Recevoir une instruction quotidienne
↓
GPT Astra choisit la compétence + la cible
↓
La pile robotique locale exécute l’action
↓
Renvoyer le résultat
↓
Continuer jusqu’à l’accomplissement de la tâche
La démonstration de recherche est impressionnante, mais elle ne revient pas à acheter un G1, à saisir une clé API et à obtenir un robot domestique.
La pile HomeBody actuelle nécessite encore une infrastructure robotique importante.
Les chercheurs indiquent que la perception, la planification des mouvements et l’exécution des compétences fonctionnent sur un seul ordinateur portable Razer Blade équipé d’un GPU RTX 4090.
GPT Astra s’exécute à distance et envoie les demandes de compétences et les cibles à la machine locale.
L’architecture est donc répartie entre deux environnements de calcul :
Modèle de pointe distant
→ raisonnement de haut niveau et sélection des compétences
Système RTX 4090 local
→ perception, géométrie, planification, compétences, exécution
Le projet mentionne également plusieurs coûts et contraintes pratiques.
Le jumeau numérique doit être créé avant que le workflow complet puisse utiliser sa représentation spatiale.
Cela ajoute du temps de préparation.
Le modèle de pointe distant est appelé pendant la planification et le travail Real2Sim.
Cela ajoute des frais d’API.
Astra ne répond pas instantanément.
Les chercheurs signalent des pauses entre les compétences, le temps que le raisonnement de haut niveau se termine.
Pour les tâches domestiques, ces pauses comptent, car les tâches physiques prennent déjà beaucoup plus de temps que les tâches purement numériques.
La manipulation humanoïde de longue durée se heurte également à des limites mécaniques.
La page HomeBody mentionne spécifiquement la surchauffe des servomoteurs des doigts pendant les opérations prolongées.
Le robot ne peut exécuter que les tâches prises en charge par ses mains, sa portée, son équilibre, sa perception et son ensemble de compétences implémentées.
Le projet constitue donc une démonstration de recherche sur l’autonomie à long horizon, et non un assistant domestique général capable d’effectuer n’importe quelle corvée.
HomeBody s’inscrit dans une vague plus large de travaux qui relient les modèles de pointe aux robots physiques.
L’article source présente trois approches de plus en plus courantes.
Dans une configuration de type RoboCurve, le modèle reçoit des images et l’état du robot, puis appelle des outils qui spécifient des cibles telles que :
Une pile de cinématique inverse ou de contrôle bas niveau convertit ces cibles en mouvements robotiques.
Le modèle reste dans une boucle fréquente d’observation, de décision et d’action.
Une deuxième approche utilise un modèle de langage et de vision de pointe pour le raisonnement lent de haut niveau et un VLA appris pour générer les actions.
Conceptuellement :
Planificateur VLM
→ Modèle d’action VLA
→ Contrôleur bas niveau
Le modèle de pointe reste au-dessus de la couche moteur, tout en utilisant une politique apprise pour convertir les plans en actions physiques.
HomeBody suit une autre voie.
Le projet supprime l’obligation d’avoir un VLA appris au milieu et permet plutôt au VLM de pointe d’appeler directement des compétences réutilisables.
Ces compétences peuvent elles-mêmes être des algorithmes classiques, des politiques apprises ou d’autres contrôleurs.
Le projet HomeBody permet explicitement d’ajouter de nouvelles compétences au moyen de l’interface partagée.
L’architecture devient ainsi modulaire :
Remplacer le VLM
ou
ajouter une nouvelle compétence
sans reconcevoir toute la pile robotique
L’idée plus profonde n’est pas simplement d’« ajouter une couche System 0 ».
Il s’agit d’une connexion différente entre le raisonnement et l’exécution physique.
Associée à la mémoire spatiale, cette connexion permet au robot de travailler dans une pièce entière plutôt qu’autour d’une seule table.
L’article source s’achève en examinant les résultats d’évaluation de contrôle robotique réalisés par RoboCurve auprès de modèles tiers.
Ces résultats doivent être considérés comme des mesures de benchmark robotique propres à certaines tâches, et non comme des affirmations universelles sur l’intelligence générale des modèles.
Dans le résultat RoboCurve partagé par Jay Chooi, GPT-6 Sol aurait obtenu un score environ 1,6 fois supérieur à celui de GPT-5.6 Sol sur l’ensemble de tâches robotiques, tout en coûtant environ 47 % de moins par essai.

Le même graphique plaçait GPT-6 Sol sous la frontière de Pareto préliminaire établie par des configurations plus performantes d’Opus 5.5 dans cette évaluation.
Cela montre utilement que le coût et les performances de contrôle robotique n’évoluent pas toujours dans le même sens.
Un modèle moins cher peut constituer un meilleur choix opérationnel même si un autre modèle obtient encore un score supérieur.
Un autre résultat RoboCurve portait sur 360 essais robotiques.
La moyenne rapportée indiquait qu’Opus 5.5 obtenait un score environ 1,8 fois supérieur à celui d’Opus 5, pour environ la moitié du coût, tout en égalant approximativement le score moyen d’Astra à un coût inférieur d’environ 21 %.

Encore une fois, il ne s’agit pas d’un benchmark général d’Anthropic ou d’OpenAI.
Il s’agit d’une évaluation tierce du contrôle robotique sur un ensemble spécifique de tâches, avec du matériel, des prompts et des conditions d’essai déterminés.
Cette distinction est importante, car les performances de l’IA incarnée dépendent de l’ensemble du système :
Modèle
×
Prompting
×
Matériel robotique
×
Perception
×
Pile de contrôle
×
Conception des compétences
×
Définition de la tâche
Un modèle qui obtient les meilleures performances dans un benchmark de programmation n’est pas nécessairement celui qui présente le meilleur rapport coût/performance lorsqu’il contrôle un robot.
L’aspect le plus intéressant de HomeBody n’est pas qu’un humanoïde ait déplacé un sachet de café.
Les robots manipulent des objets depuis des années.
Le changement important est architectural.
HomeBody montre une manière pratique de combiner :
Le modèle de pointe n’a pas besoin d’apprendre chaque détail moteur.
Le robot n’a pas besoin d’une nouvelle politique de bout en bout entraînée spécifiquement pour chaque cuisine.
À la place, un modèle généraliste raisonne sur un environnement structuré et orchestre des capacités réutilisables.
Cela ressemble à la manière dont fonctionnent de plus en plus les agents logiciels :
Le modèle raisonne
→ appelle des outils
→ lit les résultats
→ choisit l’outil suivant
HomeBody transpose ce schéma dans le monde physique.
Les outils ne sont plus la recherche web, Python ou une base de données.
Ce sont :
Naviguer
Saisir
Déposer
Ouvrir un tiroir
Saisir dans un tiroir
C’est pourquoi le projet semble constituer une étape importante pour les agents incarnés.
HomeBody est un système de recherche de Stanford et Caltech qui fournit à un robot humanoïde une mémoire spatiale persistante et une bibliothèque de compétences motrices composables. Un modèle de vision et de langage de pointe planifie des tâches à long horizon et appelle ces compétences au moyen d’interfaces d’outils structurées.
Non. La page du projet HomeBody désigne le planificateur sous le nom de GPT Astra et l’utilise comme modèle System 2 de haut niveau. La navigation, la manipulation, la perception, la planification des mouvements, les nouvelles tentatives et le contrôle du corps entier sont pris en charge par des modules robotiques bas niveau et des contrôleurs préentraînés.
Les chercheurs indiquent que la cuisine inconnue présentée ne nécessite ni données d’entraînement propres à l’environnement ni apprentissage supplémentaire de politique. Le système dépend toutefois de modèles de perception préentraînés, de compétences réutilisables, du SLAM, de logiciels de planification et d’un contrôleur AMO préentraîné pour le corps entier.
Pendant l’exploration, HomeBody enregistre les observations de la caméra embarquée avec leur contenu sémantique et leur position dans un référentiel de coordonnées spatiales commun. Lorsqu’une demande ultérieure concerne un objet hors du champ de vision, GPT Astra peut rappeler une image clé enregistrée et revenir à l’emplacement mémorisé.
L’étape Real2Sim fournit au planificateur de haut niveau un modèle spatial structuré de la pièce. HomeBody ancre également la reconstruction dans la géométrie SLAM mesurée afin que les décisions de navigation et de manipulation soient liées aux dimensions réelles plutôt qu’à la seule apparence visuelle.
Le projet indique que les compétences locales, la perception et la planification des mouvements fonctionnent sur un ordinateur portable Razer Blade équipé d’un GPU RTX 4090, tandis que GPT Astra s’exécute à distance. La configuration actuelle nécessite également le matériel humanoïde, des caméras, des composants LiDAR/SLAM, un réseau et la pile logicielle robotique du projet.
Non. Le projet démontre une autonomie significative à long horizon, mais ses propres limites comprennent le temps de configuration de Real2Sim, le coût de l’API, la latence du raisonnement, les limites de manipulation et les problèmes d’endurance matérielle tels que la surchauffe des servomoteurs des doigts.
Non. Les chiffres évoqués dans la source proviennent de RoboCurve, un évaluateur indépendant tiers, et s’appliquent à ses ensembles de tâches robotiques et à ses conditions d’essai. Ils ne doivent pas être généralisés en classements globaux des modèles en dehors de ce contexte.
HomeBody montre comment un modèle de pointe peut devenir le planificateur de haut niveau d’un humanoïde sans générer directement chaque commande moteur bas niveau. GPT Astra explore une pièce inconnue, utilise une reconstruction Real2Sim et une mémoire spatiale persistante, puis compose des compétences de navigation et de manipulation pour accomplir des tâches de cuisine à long horizon.
Le choix de conception essentiel est la modularité. Le modèle décide de ce qui doit se produire, tandis que la perception, la géométrie, la planification des mouvements, les nouvelles tentatives locales et le contrôle du corps entier décident de la manière dont le robot l’exécute physiquement. Le système peut ainsi entrer dans une nouvelle cuisine sans entraîner une nouvelle politique d’action propre à l’environnement, tout en dépendant d’une infrastructure robotique préentraînée et conçue de manière importante.
L’implémentation actuelle reste un système de recherche plutôt qu’un robot domestique prêt à l’emploi : elle nécessite une machine locale de classe RTX 4090, une inférence distante du modèle, une configuration de simulation, un accès à l’API et un matériel robotique robuste. Les chercheurs documentent également des limites de latence et d’endurance qui restent importantes pour les tâches réelles de longue durée.
L’étape importante n’est pas simplement que « GPT peut contrôler un robot » ; c’est qu’un modèle généraliste peut désormais utiliser une mémoire spatiale et des compétences physiques réutilisables, à la manière dont un agent logiciel utilise des outils.
Partez d’une phrase et obtenez un site complet en quelques minutes.