Les modèles du monde sont devenus l’un des axes de recherche les plus actifs dans le domaine de l’intelligence incarnée, mais ce domaine man...

Le modèle du monde est devenu l’un des axes de recherche les plus actifs dans le domaine de l’intelligence incarnée, mais ce champ manque encore d’une définition unifiée.
Les chercheurs divergent sur ce que le modèle du monde devrait représenter, le degré de précision requis pour la modélisation physique, si les états futurs doivent être générés dans l’espace pixel ou dans l’espace latent, le nombre de prédictions nécessaires avant qu’un robot n’agisse, les données modales les plus cruciales, et même la manière de mesurer les progrès de la recherche.
Ce manque de consensus était particulièrement frappant lors du WAIC 2026.
Le 19 juillet, un forum organisé par six entreprises chinoises d’intelligence incarnée a réuni des leaders technologiques représentant différentes voies techniques de modélisation du monde pour robots :
La valeur de cette discussion réside précisément dans le fait que les intervenants n’ont pas abouti à une solution technique unique.
Certains souhaitent que le modèle du monde représente avec une précision croissante la géométrie, le mouvement et la mécanique. D’autres se préoccupent davantage de savoir si le modèle peut prédire suffisamment de structure physique pour sélectionner des actions réussies.
Certains estiment que la cohérence à long terme est cruciale. D’autres rétorquent qu’elle peut être contre-productive lorsque les prédictions consomment trop de temps de décision du robot.
Certains prévoient que le domaine convergera autour d’une représentation partagée. D’autres pensent que des architectures hybrides, la perception tactile ou des benchmarks standardisés seront les premiers points de départ du consensus.
Derrière ces divergences se trouve une question plus pratique :
De quelles capacités le modèle du monde a-t-il besoin pour apporter une valeur réelle au-delà des scénarios de démonstration ?

Les six entreprises n’ont pas adopté exactement la même architecture, mais selon la manière dont le modèle prédit le monde, la table ronde peut être résumée en trois voies techniques.
| Voie | Méthode représentative | Concept central |
|---|---|---|
| Génération dans l’espace pixel | GigaAI | Prédire directement l’état visuel futur, ou prédire via une représentation visuelle générative |
| Prédiction dans l’espace latent | Orientation JEPA de Wujie Dongli | Prédire une représentation interne compacte, plutôt que des pixels complets |
| Architecture hybride ou unifiée | ACE Robotics、Roboyant、X Square Robot、AgiBot | Combiner génération, prédiction dans l’espace latent, raisonnement spatial explicite, contrôle VLA ou modèles orientés simulation |
Cette classification, bien qu’utile, ne doit pas être considérée comme une norme industrielle permanente.
Certaines entreprises fusionnent déjà plusieurs mécanismes. La divergence la plus importante réside dans ce qu’une équipe considère qu’un modèle du monde utile doit maintenir.
Le premier désaccord majeur concerne la manière dont le modèle du monde se rapporte à la physique.
Xia Zhongpu estime que l’évaluation devrait inclure la précision du modèle dans la prédiction de l’état géométrique, de la trajectoire de mouvement, des effets mécaniques et des grandeurs physiques associées.
Ce point de vue considère en partie le modèle du monde comme un prédicteur structuré de l’état physique.
Pour un robot qui doit décider comment pousser, saisir, soulever, naviguer ou manipuler des objets, les questions pertinentes peuvent inclure :
Les représentations implicites peuvent rendre la régression physique explicite plus attrayante — car le modèle n’a pas besoin de rendre chaque pixel futur avant d’estimer ces grandeurs.
Son avantage réside dans la précision et la contrôlabilité.
La difficulté réside dans le fait que le monde physique contient des variables difficiles à observer ou à inférer directement, telles que la friction, la distribution de masse cachée, la flexibilité, l’état de contact et les propriétés des matériaux.
Ainsi, le modèle peut être physiquement structuré sans être un simulateur complet.
Shen Yujun propose un critère différent.
Le robot n’a pas nécessairement besoin de reproduire chaque paramètre du système physique, mais doit comprendre les différences cruciales pour l’action à venir.
Par exemple, lorsqu’un robot lance, comprime, traîne ou saisit deux matériaux, il peut avoir besoin de reconnaître leurs réponses différentes, sans avoir à estimer chaque coefficient au préalable.
Cela se rapproche davantage d’une compréhension physique liée à l’action que d’une simulation physique complète.
La différence entre les deux peut être résumée comme suit :
Simulation physique précise :
Prédire l’état détaillé du monde aussi précisément que possible.
Raisonnement physique lié à l’action :
Prédire suffisamment d’états du monde pour soutenir le choix d’une action sûre et efficace.
Le second objectif est moins coûteux en calcul et suffit pour de nombreuses tâches de robots réelles.
Cela correspond également à la philosophie de conception des systèmes issus des modèles de génération vidéo — ces modèles apprennent naturellement quels rendus visuels futurs sont plausibles, même sans révéler toutes les variables physiques sous-jacentes.
L’avis des experts pointe vers un critère d’évaluation plus pragmatique :
L’erreur de prédiction la plus cruciale est celle qui modifie la décision du robot.
Si un robot peut réussir à placer une tasse sans estimer le coefficient de friction exact de la table, l’absence de cette valeur peut être sans importance.
Mais si l’absence de cette compréhension physique fait tomber la tasse, cette erreur devient cruciale.
Ainsi, la fidélité physique requise dépend :
Le deuxième désaccord porte sur la distance dans le futur que le modèle du monde doit prédire.
AgiBot a investi massivement dans la simulation et l’évaluation basée sur le modèle du monde.
Son cadre public AgiBot Digital World fournit un environnement de simulation haute fidélité, des trajectoires d’experts générées automatiquement et des outils d’évaluation des modèles.
AgiBot a ensuite lancé le cadre de modèle du monde EVAC et EWMBench, élargissant encore le concept de simulation générative conditionnée par l’action.
Pour un modèle du monde utilisé comme simulateur, la cohérence à long terme est cruciale.
La valeur de la simulation est considérablement réduite si :
Sur cette base, le modèle du monde doit maintenir un état cohérent sur un horizon temporel significatif.
Wang Hao remet en question l’hypothèse selon laquelle « une prédiction plus longue est toujours meilleure ».
X Square Robot adopte une approche de modèle incarné de bout en bout, couplant étroitement perception, raisonnement, modélisation du monde et génération d’actions.
Son document public décrit la série WALL comme un modèle de monde physique unifié en cours, plutôt que de traiter la prédiction du monde et le contrôle du robot comme des systèmes isolés.
Dans de tels systèmes, le modèle du monde n’est pas seulement un simulateur — la prédiction fait elle-même partie de la boucle de contrôle.
Par conséquent, une prédiction plus longue entraîne les coûts suivants :
Plus le futur prédit est éloigné
→ Plus le raisonnement est important
→ Plus la latence est élevée
→ Moins il reste de temps pour agir
Si l’environnement du robot change plus vite que le modèle ne peut terminer son raisonnement, une prédiction parfaitement cohérente à long terme peut être inutile en termes opérationnels.
Pour le contrôle, une prédiction plus courte arrivant à temps peut avoir plus de valeur qu’une prédiction plus longue arrivant en retard.
Cela montre qu’il n’existe pas de longueur de prédiction unique optimale.
Un simulateur d’entrepôt peut nécessiter des séquences de prédiction longues.
Un robot effectuant une tâche d’équilibre d’objet peut nécessiter des prédictions très courtes et rapides.
Un manipulateur mobile gérant des tâches en plusieurs étapes peut avoir besoin des deux :
Ainsi, une conception raisonnable peut impliquer plusieurs horizons temporels, plutôt qu’un seul modèle du monde global.

Les divergences de points de vue exprimées lors du forum sont déjà visibles dans les systèmes techniques publics des différentes entreprises.
Lors de la conférence WAIC 2026, Epoch Embodied Intelligence a dévoilé Kairos 3.1, un modèle incarné du monde orienté vers l’action.
Les documents publics de lancement décrivent une architecture hybride de type Transformer, conçue pour relier :
Epoch Embodied Intelligence a également annoncé une latence d’inférence de 125 ms pour son modèle Kairos 3.1 de 8 milliards de paramètres sur la plateforme NVIDIA.
Le Jetson Thor utilise une précision BF16. Cette spécification est cruciale, car l’entreprise positionne clairement ce modèle comme un système embarqué destiné au comportement des robots, et non comme un simple générateur de vidéos hors ligne.
Le modèle open source LingBot-World de Robbyant est parti de la génération de vidéos. Son dépôt officiel le décrit ainsi : environnement interactif haute fidélité, cohérence temporelle longue, contrôle utilisateur en temps réel, latence d’interaction inférieure à la seconde, et capacité de génération en temps réel à 16 FPS dans sa version Fast. Ant Group a ensuite intégré LingBot-World-Fast dans son produit mobile LingGuang, permettant aux utilisateurs de transformer une seule image en un monde génératif explorable. Parallèlement, Robbyant s’est étendu à la recherche sur les modèles VLA et incarnés, devenant un exemple typique d’équipe ne se limitant pas à un seul paradigme de modèle du monde.
GigaAI se présente comme une entreprise d’intelligence incarnée et de robotique générale bâtie sur trois niveaux : GigaWorld (plateforme de modèles du monde), GigaBrain (système d’intelligence incarnée générale) et Maker (support robotique incarné). Ses travaux sur les modèles du monde mettent en avant le rôle central des environnements physiques génératifs pour accélérer la création, l’entraînement et le test des données. La génération dans l’espace des pixels est donc particulièrement importante lorsque le modèle du monde est utilisé comme simulateur visuellement riche.
Les travaux publics d’AgiBot illustrent clairement l’usage du simulateur. AgiBot Digital World combine actifs 3D, simulation physique, génération de trajectoires expertes, randomisation de domaine, génération de données et évaluation de modèles. Son framework EVAC permet de générer des états visuels futurs basés sur des séquences d’actions robotiques. Dans ce type d’applications, la cohérence temporelle et la reproduction précise des interactions action-environnement sont essentielles.
L’histoire officielle de Star Dynasty montre que son architecture WALL-A intègre profondément les modèles VLA et les modèles du monde. En 2026, la direction WALL-B vise ce que l’entreprise appelle une architecture unifiée du monde. Son objectif technique est d’éviter un pipeline où le modèle du monde prédit indépendamment, puis une politique distincte convertit ces prédictions en actions, mais plutôt d’intégrer les processus de prédiction et de contrôle en un système unifié de bout en bout.
Les documents publics de Wujie Dynamics indiquent que l’entreprise développe un « cerveau général » pour les robots ainsi qu’un système de modèle multimodal natif incarné basé sur un modèle du monde. Xia Zhongpu a rejoint l’entreprise en mars 2026, après avoir dirigé les travaux sur la conduite autonome de bout en bout chez Li Auto. Les orientations de recherche de l’entreprise mettent l’accent sur la prédiction dans l’espace latent, les grandeurs physiques et la pensée de type JEPA. Étant donné que la documentation technique publique détaillée sur les modèles du monde actuels reste limitée, les affirmations concernant leur architecture exacte doivent être considérées comme des orientations techniques décrites par leur direction, et non comme des modèles ouverts entièrement documentés.
La question n’est pas de savoir quelle architecture l’emportera finalement.
Mais plutôt :
Quelle partie du domaine parviendra en premier à un consensus ?
Les réponses varient considérablement.
Ren Guanghui et Xia Zhongpu ont tous deux souligné l’importance de la représentation.
Les grands modèles de langage ont fini par converger autour d’une représentation séquentielle tokenisée, rendant différentes tâches compatibles avec une même architecture.
L’intelligence incarnée manque encore d’une unité de base aussi universelle.
Le travail des robots implique :
Si ces modalités restent isolées, chaque système doit construire des ponts complexes entre elles.
Une représentation unifiée permettrait au modèle de raisonner sur la perception, l’état, la prédiction et l’action au sein d’un même espace partagé.
Le défi est que les signaux physiques ne sont pas naturellement interchangeables.
Une impulsion tactile, une image de caméra, une commande de pince : leurs fréquences et les informations qu’ils portent diffèrent.
Un « token robotique » pourrait donc être bien plus difficile à définir qu’un token textuel.
Wang Hao prédit une fusion des architectures.
Dans cette optique, les différentes approches des modèles du monde résolvent chacune une partie du problème :
L’architecture finale pourrait combiner ces mécanismes, plutôt que d’en choisir un au détriment des autres.
Ce schéma est courant en IA.
Les technologies d’abord concurrentes, une fois leurs forces et faiblesses clarifiées, tendent à devenir des composants de systèmes plus vastes.
Shen Yujun estime que l’information tactile pourrait être l’un des premiers domaines à faire consensus.
Actuellement, la plupart des grands modèles du monde sont principalement entraînés sur des données visuelles et linguistiques.
Les robots manipulent par le contact.
Ils doivent détecter :
Pour les tâches de manipulation, c’est précisément lorsque le toucher est le plus utile que la vision peut être ambigüe.
C’est un argument fort pour faire de la perception tactile une modalité native, et non un capteur optionnel ajouté après l’entraînement du modèle.
Les orientations de recherche de Robbyant illustrent également ce passage général de modèles basés sur la vidéo numérique à des modèles conçus autour du contrôle incarné.
La distinction importante est :
L’objectif d’un modèle vidéo est de générer un futur plausible.
L’objectif d’un modèle incarné du monde est de soutenir une action réussie.
Ces deux objectifs se chevauchent, mais ne sont pas identiques.
Tao Dacheng apporte une réponse différente : la convergence pourrait d’abord se produire dans l’évaluation, et non dans l’architecture.
Cela a des précédents historiques.
La vision par ordinateur n’a pas convergé parce que les chercheurs se sont mis d’accord au préalable sur une représentation. Des ensembles de données partagés et des benchmarks comme ImageNet ont fourni une mesure commune aux systèmes concurrents. Une fois tous les systèmes évalués sur la même échelle, les idées faibles ont disparu plus vite, et les idées utiles ont pu se propager au-delà des frontières architecturales. C’est la logique derrière le lancement du Quotient d’Intelligence Physique lors du forum.
Le Quotient d’Intelligence Physique a été présenté à la Conférence mondiale sur l’intelligence artificielle 2026 comme un benchmark unifié pour l’intelligence physique incarnée. Les informations publiées indiquent que cette initiative est co-lancée par :
Plus de 20 universités et organisations industrielles y participent. La plateforme vise à comparer différents systèmes selon :

Cette image est liée au contenu de la table ronde « Six Petits Dragons » présentée dans le document, et montre visuellement les intervenants de la discussion.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/c242a920-2b42-4966-92ce-2e70518c2ac6-7fb4c60a-1a46-46c3-9743-2b5a5a5a322e.jpeg)
Un benchmark utile pour le QI physique ne peut pas se contenter de se fier à la vraisemblance visuelle des vidéos générées. Il doit poser les questions suivantes :
La méthode spécifique du QI physique doit être documentée publiquement en continu et largement adoptée pour devenir un véritable standard industriel. Néanmoins, cette direction répond à un problème concret. Actuellement, les diverses affirmations concernant les modèles du monde sont difficiles à comparer, car une entreprise peut rapporter la qualité vidéo, une autre le taux de réussite des tâches, une troisième l’erreur d’état physique, et une quatrième la cohérence du simulateur. Sans échelle unifiée, chaque système peut se présenter comme le meilleur sur les critères qu’il a lui-même conçus.
Les discussions autour du QI physique reflètent également des questions de recherche plus larges dans le domaine de la vidéo générative. Les chercheurs de Google DeepMind ont introduit un benchmark indépendant appelé QI physique, destiné à évaluer si les modèles vidéo comprennent réellement les principes physiques. Cette étude a révélé que la fidélité visuelle et la correction physique peuvent être déconnectées. Une vidéo générée peut sembler convaincante tout en violant :
Cette distinction est cruciale pour les modèles du monde en robotique. Une prédiction future visuellement crédible n’est utile que si elle conserve les propriétés nécessaires à l’action. En même temps, un robot n’a pas besoin de résoudre tout un manuel de physique avant d’agir. Un standard pratique se situe entre ces deux extrêmes.
Insuffisant :
Semble réaliste, mais prédit un résultat erroné.
Potentiellement excessif :
Calcule chaque variable physique, même si l’action ne le nécessite pas.
Les différences physiques qui changent la décision du robot sont celles qu’une prédiction utile doit capturer.
C’est dans cet espace intermédiaire que les divergences de recherche actuelles se situent.
Bien que les avis divergent sur les architectures de modèles, les experts deviennent plus cohérents lorsqu’ils passent des modèles aux robots réels.
Le critère final est simple :
Un robot peut-il accomplir une tâche de manière fiable dans le monde physique ?
Différents intervenants l’ont exprimé avec des termes différents.
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
Les termes diffèrent, mais la question opérationnelle est la même.
Un modèle du monde n’a de sens que s’il améliore le comportement réel du robot.
Les démonstrations peuvent être optimisées presque à l’infini.
Une équipe peut :
Le déploiement supprime ces protections.
Les supermarchés, hôtels, entrepôts ou foyers sont confrontés chaque jour à des événements imprévisibles.
Wang Hao a décrit la courbe de coût comme fortement non linéaire.
Passer un système de :
90 % → 99 %
Ne demande pas le même effort que :
99 % → 99,9 %
Les échecs restants sont souvent des cas rares difficiles.
Un taux d’échec de 1 % semble faible en laboratoire.
Si un robot exécute 10 000 actions par jour, 1 % signifie 100 échecs.
Même avec une fiabilité de 99,9 %, des interventions humaines fréquentes peuvent encore se produire lorsque le volume de tâches est suffisamment élevé.
L’impact commercial inclut :
C’est pourquoi le déploiement change la signification de la qualité du modèle.
Shen Yujun a donné l’exemple du commerce de détail.
Un robot peut devoir chercher un paquet de légumes.
Les marchandises sont généralement stockées à un endroit, mais un client peut les prendre et les déposer dans un autre réfrigérateur.
Du point de vue d’un ensemble de données soigneusement conçu, cela ressemble à une anomalie.
Mais du point de vue d’un robot servant des milliers de clients, l’anomalie devient la norme.
Par conséquent, un modèle du monde doit gérer :
C’est là que la capacité de généralisation est plus importante que la rejouer des démonstrations mémorisées.
Tao Dacheng a souligné une autre contrainte pratique : la latence.
De nombreux modèles avancés fonctionnent dans le cloud.
Les robots n’ont pas toujours le temps d’attendre un aller-retour vers le cloud.
La fenêtre de décision peut n’être que de quelques millisecondes.
Dizaines ou centaines de millisecondes.
Le réseau peut également être :
C’est pourquoi ACE Robotics met l’accent sur les performances en périphérie du Kairos 3.1.
Un modèle légèrement moins performant mais capable de répondre dans les délais de contrôle peut être plus utile qu’un modèle plus puissant dont la réponse arrive après la fenêtre d’action.
Pour le déploiement, l’intelligence doit devenir :
Cela mène à une distinction utile :
Les démonstrations montrent la limite supérieure des capacités, le déploiement révèle la limite inférieure.
La dernière partie de la discussion a invité les intervenants à imaginer un regard rétrospectif depuis 2028.
Quels investissements faits en 2026 seront jugés justes ?
Lesquels pourraient sembler trompeurs ?
Les réponses ont à nouveau révélé ce que chaque équipe considère comme durable.
Shen Yujun a distingué deux concepts :
Les exemples incluent :
Les exemples incluent :
Un modèle peut améliorer ses capacités fondamentales sans produire immédiatement les démonstrations les plus impressionnantes.
Inversement, un système peut être fortement optimisé pour les sorties visibles sans améliorer les capacités nécessaires à l’intelligence physique générale.
C’est l’une des raisons pour lesquelles l’industrie a besoin de meilleures évaluations.
Shen a également estimé que le travail investi dans les pipelines de données resterait probablement utile.
Même si les architectures changent, la robotique incarnée aura toujours besoin de :
L’incertitude ne réside pas dans l’importance des données.
Mais dans la question de savoir si les données collectées aujourd’hui correspondront encore aux représentations et méthodes d’entraînement utilisées dans les futurs modèles.
Un ensemble de données peut devenir moins utile lorsque :
Par conséquent, construire des pipelines de données flexibles pourrait être plus durable que d’optimiser un ensemble de données fixe.
Zhu Zheng a averti que l’industrie pourrait explorer trop de scénarios commerciaux avant que le modèle fondamental lui-même ne soit stable.
C’est un dilemme familier aux startups.
Le déploiement commercial offre :
Mais il peut aussi éloigner l’équipe de modélisation vers :
Si l’architecture sous-jacente évolue encore rapidement, une spécialisation précoce pourrait ralentir la recherche fondamentale.
L’équilibre entre la recherche de modèles et le déploiement commercial varie selon les entreprises.
Il n’y a pas de réponse universelle.
Ren Guanghui a prédit que les modèles du monde évolueront de plus en plus vers une approche native incarnée.
Cela signifie que les modèles sont conçus dès le départ autour des interactions physiques, plutôt que d’être adaptés à partir de tâches de génération d’images ou de vidéos sur Internet.
L’entraînement natif incarné peut inclure :
L’architecture elle-même peut également être conçue autour de la boucle de contrôle.
Le problème clé est de savoir si le modèle représente les variables nécessaires à l'exécution des actions par le robot, et non si sa structure interne ressemble à un modèle de génération de médias.
Ce débat ne s'est pas conclu par une architecture unique acceptée par tous.
Cela peut indiquer que le domaine en est encore à ses débuts, plutôt qu'une impasse.
Plusieurs domaines importants restent non résolus :
| Problème | Points de vue divergents |
|---|---|
| Que doit prédire le modèle ? | Pixels, états latents, géométrie explicite, ou solution hybride |
| Quel niveau de précision physique est requis ? | Estimation exacte de l'état vs. plausibilité liée à l'action |
| Quelle doit être la portée de la prédiction ? | Cohérence à long terme vs. contrôle à faible latence sur court terme |
| Qu'est-ce qui unifiera le domaine ? | Représentation, architecture, données tactiles, ou bancs d'essai |
| Où l'inférence doit-elle s'exécuter ? | Cloud, edge, ou déploiement hybride |
| Quels sont les véritables critères de succès ? | Qualité de simulation, prédiction physique, amélioration de la politique, ou taux de succès des tâches réelles |
| Quelles données sont les plus importantes ? | Vidéos, trajectoires robotiques, forces, sens tactiles, simulations, ou données hybrides |
Dans les domaines matures, les architectures tendent à converger.
Dans les domaines émergents, les divergences révèlent précisément les plus grandes opportunités non encore exploitées.
Si une équipe peut prouver une hypothèse controversée actuelle, elle pourra établir un avantage technologique avant que l'industrie ne parvienne à un consensus.
Pour les développeurs et les équipes robotiques, ce débat peut se traduire en une liste d'évaluation plus concrète.
Définir clairement ce que le modèle prédit :
La sortie doit correspondre au problème de contrôle en aval.
Mesurer les performances aux niveaux suivants :
Ne pas évaluer uniquement sur la portée de prédiction où le modèle est le plus performant.
Mesurer le temps d'inférence réel sur le matériel de déploiement cible.
Un modèle qui ne respecte pas les contraintes de temps de contrôle ne doit pas être noté parfaitement pour sa précision de prédiction.
Les tests incluent :
La question la plus pratique est peut-être :
L'ajout d'un modèle du monde améliore-t-il le taux de réussite des tâches réelles ?
Comparer les performances des politiques en aval avec et sans modèle du monde —
Des politiques incluant et n'incluant pas la composante modèle du monde.
Tester sur de nouveaux contenus :
Mesurer ce qui se produit après la première erreur.
Un système déployé doit pouvoir détecter les défaillances, mettre à jour son état et essayer une autre solution.
Tester à la fois dans des conditions réseau normales et dégradées.
Lorsque l'inférence à distance n'est pas disponible, le robot doit pouvoir échouer en toute sécurité.
Suivre l'assistance humaine par unité :
Cela révèle souvent mieux la qualité du déploiement qu'un simple taux de réussite.
Inclut :
Le meilleur modèle du monde n'est pas nécessairement celui avec le meilleur score sur un banc d'essai.
C'est celui qui fait fonctionner l'ensemble du système robotique mieux.
Un modèle du monde est un modèle capable de représenter ou de prédire comment l'environnement change avec le temps, les actions du robot ou d'autres événements. En robotique, il peut soutenir la planification, la simulation, la sélection d'actions, la génération de données d'entraînement ou l'amélioration des politiques.
La discussion a largement couvert la génération dans l'espace pixel, la prédiction dans l'espace latent (comme les approches de type JEPA), et les systèmes hybrides ou unifiés combinant la prédiction du monde avec le contrôle VLA, le raisonnement 3D ou d'autres représentations. Ces catégories se chevauchent car plusieurs entreprises utilisent des techniques variées.
Pas nécessairement. Certains chercheurs plaident pour une prédiction précise de la géométrie, du mouvement et des forces, tandis que d'autres privilégient un raisonnement physique suffisant pour sélectionner la bonne action. La précision requise dépend de la tâche et du coût de l'échec.
Les déroulements longs sont utiles pour la simulation et la planification à long terme, mais augmentent le coût d'inférence et peuvent ralentir le contrôle en temps réel. Un robot physique peut avoir besoin de prédictions courtes et rapides pour les actions immédiates, tout en utilisant un autre mécanisme pour la planification à long terme.
PHYSICAL IQ est une initiative de banc d'essai de l'intelligence physique incarnée lancée lors de WAIC 2026. Elle vise à fournir un protocole d'évaluation commun pour différents corps robotiques, scénarios et tâches.
Non. Ce sont des projets différents. PHYSICAL IQ est une plate-forme d'évaluation pour la robotique incarnée lancée à WAIC 2026, tandis que Physics-IQ est un banc d'essai de recherche pour tester si les modèles de vidéo générative comprennent les lois physiques.
La vision ne révèle pas entièrement les forces de contact, le glissement, la pression, la conformité et certaines propriétés des matériaux. Les signaux tactiles et de force fournissent aux robots une information directe sur les interactions physiques et pourraient devenir de plus en plus importants pour les modèles du monde orientés vers la manipulation.
Le déploiement.
La fiabilité. Les équipes doivent mesurer les taux de réussite réels des tâches, la latence, les taux d'intervention, la récupération après des événements inattendus, la sécurité, les coûts et les performances dans de nombreux environnements, pas seulement pour des démonstrations choisies.
antgroup.com/en/news-media/press-releases/1777280400000):Un communiqué officiel d'Ant Group décrivant l'intégration de LingBot-World-Fast dans Lingguang.
La table ronde sur les modèles du monde lors de la WAIC 2026 a montré qu'aucun consensus n'a encore été atteint dans le domaine de l'intelligence incarnée concernant la définition, la représentation ou l'architecture des modèles du monde. Les principaux désaccords portent sur la précision physique, la portée de la prédiction, les modes de représentation, la perception tactile, ainsi que la relation entre la modélisation du monde et l'action.
Le consensus le plus fort apparaît dans les étapes ultérieures de la chaîne technologique. En fin de compte, les modèles du monde doivent rendre les robots physiques plus fiables : meilleur taux de réussite des tâches, moins d'interventions, prise de décision plus rapide, récupération plus sûre et coûts de déploiement réduits.
PHYSICAL IQ vise à créer une couche d'évaluation commune, avant laquelle
les architectures elles-mêmes tendent à converger. Reste à savoir si ce benchmark sera largement adopté, mais le besoin de méthodes de mesure comparables de l'intelligence physique est évident.
Les controverses actuelles dans ce domaine ne sont pas une faiblesse, mais une cartographie des problèmes non résolus qui pourraient bien définir l'orientation de la prochaine génération d'intelligence artificielle incarnée.
Partez d’une phrase et obtenez un site complet en quelques minutes.