Introducción
El modelo mundial se ha convertido en una de las direcciones de investigación más activas en el campo de la robótica inteligente, pero aún carece de una definición unificada.
Los investigadores discrepan sobre qué debe representar el modelo mundial, con qué precisión debe modelar la física, si los estados futuros deben generarse en el espacio de píxeles o en un espacio latente, cuántas predicciones debe hacer un robot antes de actuar, qué modalidades de datos son más críticas e incluso cómo medir el progreso de la investigación.
Esta falta de consenso se hizo particularmente evidente en la WAIC 2026.
El 19 de julio, un foro organizado por seis empresas chinas de robótica inteligente reunió a líderes tecnológicos que representan diferentes rutas técnicas de modelos mundiales robóticos:
- Moderador: Hai Dacheng, científico jefe de ACE Robotics
- Shen Xuejun, científico jefe del equipo Roboyant de Ant Group
- Zhu Zheng, cofundador y científico jefe de GigaAI
- Xia Zhongpu, cofundador y co-CTO de Boundless Dynamics
- Ren Guanghui, director de algoritmos de IA de AgiBot
- Wang Hao, cofundador y CTO de X Square Robot
El valor de este debate radica precisamente en que los oradores no alcanzaron una única solución técnica.
Algunos esperan que el modelo mundial represente geometría, movimiento y mecánica con precisión cada vez mayor. Otros se preocupan más por si el modelo puede predecir suficiente estructura física para seleccionar acciones exitosas.
Algunos consideran que la consistencia a largo plazo es crucial. Otros argumentan que, cuando la predicción consume demasiado de la ventana de decisión del robot, resulta contraproducente.
Algunos anticipan que el campo convergerá en torno a alguna representación compartida. Otros creen que las arquitecturas híbridas, la percepción táctil o los puntos de referencia estandarizados serán los primeros puntos de partida para el consenso.
Detrás de estas divergencias hay una pregunta más práctica:
¿Qué capacidades debe tener un modelo mundial para ser de valor real más allá de los escenarios de demostración?

Tres Rutas Técnicas
Estas seis empresas no adoptaron arquitecturas idénticas, pero según la forma en que el modelo predice el mundo, la mesa redonda puede resumirse aproximadamente en tres rutas técnicas.
| Ruta | Método Representativo | Idea Central |
|---|---|---|
| Generación en espacio de píxeles | GigaAI | Predecir directamente estados visuales futuros, o predecir a través de representaciones visuales generativas |
| Predicción en espacio latente | Dirección JEPA de Boundless Dynamics | Predecir representaciones internas compactas, en lugar de píxeles completos |
| Arquitectura híbrida o unificada | ACE Robotics, Roboyant, X Square Robot, AgiBot | Combinar generación, predicción latente, razonamiento espacial explícito, control VLA o modelos orientados a simulación |
Aunque esta clasificación tiene valor de referencia, no debe considerarse un estándar de división industrial permanente.
Varias de estas empresas ya están fusionando múltiples mecanismos. La divergencia más importante radica en lo que cada equipo cree que un modelo mundial útil debe mantener.
¿Qué Capacidad es la Más Crítica?
La primera divergencia principal está en la forma en que el modelo mundial se relaciona con la física.
Opinión 1: La predicción del estado físico debe ser precisa
Xia Zhongpu cree que la evaluación debe incluir la precisión del modelo en la predicción de estados geométricos, trayectorias de movimiento, interacciones mecánicas y cantidades físicas relacionadas.
Esta visión trata parcialmente al modelo mundial como un predictor estructurado del estado físico.
Para los robots que necesitan decidir cómo empujar, agarrar, levantar, navegar o manipular objetos, las preguntas relevantes pueden incluir:
- ¿Hacia dónde se moverá el objeto?
- ¿Chocará con otros objetos?
- ¿Cómo cambiará su orientación?
- ¿Cuánta fuerza se necesita aplicar?
- ¿El agarre se mantendrá estable?
- ¿Cómo será el entorno después de completar la acción?
Las representaciones implícitas pueden hacer que la regresión física explícita sea más atractiva, ya que el modelo no necesita renderizar cada píxel futuro antes de estimar estas cantidades.
Su ventaja radica en la precisión y el control.
La dificultad reside en que el mundo físico contiene variables difíciles de observar o inferir directamente, como la fricción, la distribución de masa oculta, la flexibilidad, el estado de contacto y las propiedades del material.
Por lo tanto, el modelo puede tener características estructuradas físicamente sin ser un simulador completo.
Opinión 2: La plausibilidad física puede ser más importante que la física precisa
Shen Yujun planteó un criterio diferente.
El robot no necesita necesariamente reproducir cada parámetro del sistema físico, pero sí debe comprender las diferencias que son cruciales para las acciones que realizará.
Por ejemplo, cuando se lanzan, aprietan, arrastran o agarran dos materiales, el robot puede necesitar identificar sus diferentes respuestas sin necesidad de estimar cada coeficiente de antemano.
Esto se acerca más a una comprensión física relevante para la acción que a una simulación física completa.
La diferencia entre ambos puede resumirse así:
Simulación física precisa:
Predecir el estado detallado del mundo con la mayor precisión posible.
Razonamiento físico relevante para la acción:
Predecir el estado del mundo lo suficiente como para respaldar la selección de acciones seguras y efectivas.
El segundo objetivo tiene un costo computacional más bajo y es suficiente para muchas tareas robóticas reales.
Esto también es coherente con la filosofía de diseño de sistemas derivados de modelos de generación de video, que aprenden naturalmente qué representaciones visuales futuras son plausibles, incluso sin revelar explícitamente todas las variables físicas subyacentes.
Pregunta central: ¿Qué tipo de error cambia la acción?
Las opiniones divergentes del panel apuntan a un criterio de evaluación más pragmático:
El error es más crítico cuando cambia la decisión del robot.
Si el robot puede colocar una taza con éxito sin estimar el coeficiente de fricción exacto de la mesa, la falta de ese valor puede ser irrelevante.
Pero si la falta de esa comprensión física provoca que la taza se caiga, ese error es crucial.
Por lo tanto, la fidelidad física requerida depende de:
- La tarea específica
- El margen de seguridad
- El diseño del robot
- El horizonte temporal de la acción
- El costo del fallo
- El tiempo disponible para el razonamiento
¿Consistencia a Largo Plazo o Decisiones Rápidas?
La segunda divergencia gira en torno a hasta qué futuro debe predecir el modelo mundial.
Agibot:
La consistencia física a largo plazo es crucial
Agibot ha invertido muchos recursos en simulación y evaluación basada en modelos mundiales.
Su marco público Mundo Digital Agibot proporciona un entorno de simulación de alta fidelidad, trayectorias de expertos generadas automáticamente y herramientas de evaluación de modelos.
Agibot luego lanzó el marco del modelo mundial EVAC y EWMBench, ampliando aún más el concepto de simulación generativa condicionada a la acción.
Para los modelos mundiales utilizados como simuladores, la consistencia a largo plazo es crucial.
El valor de la simulación se reduce considerablemente si:
- La identidad de los objetos cambia gradualmente
- La estructura geométrica se desvía
- El robot olvida interacciones previas
- Las secuencias largas violan el estado físico
- Las salidas multivista son inconsistentes
En base a esto, el modelo mundial debe mantener un estado coherente en un horizonte temporal significativo.
X Square Robot: La extrapolación a largo plazo puede convertirse en un objetivo falso
Wang Hao cuestionó la suposición de que "una predicción más larga siempre es mejor".
X Square Robot adopta una ruta de modelo encarnado de extremo a extremo, acoplando estrechamente percepción, razonamiento, modelado del mundo y generación de acciones.
Sus materiales públicos describen la serie WALL como un avance hacia un modelo mundial físico unificado, en lugar de tratar la predicción del mundo y el control del robot como sistemas aislados.
En tales sistemas, el modelo mundial no es solo un simulador: la predicción en sí misma es parte del bucle de control.
Por lo tanto, una extrapolación más larga tiene los siguientes costos:
Cuanto más lejos se predice el futuro
→ Mayor cantidad de razonamiento
→ Mayor latencia
→ Menos tiempo disponible para actuar
Si el entorno del robot cambia más rápido de lo que el modelo tarda en completar el razonamiento, una predicción perfectamente coherente a largo plazo puede ser inútil en la práctica.
Para el control, una predicción más corta que llegue en el momento adecuado puede valer mucho más que una predicción más larga que llegue tarde.
El horizonte de predicción debe coincidir con el horizonte de control
Esto sugiere que no existe una longitud de predicción óptima única.
Un simulador de almacén puede necesitar secuencias de predicción largas.
Un robot que realiza tareas de equilibrio de objetos puede necesitar predicciones ultrarrápidas a corto plazo.
Un manipulador móvil que maneja tareas de múltiples etapas puede necesitar ambas:
- Planificación a largo plazo
- Predicción física a corto plazo
- Corrección rápida en bucle cerrado
Por lo tanto, un diseño razonable puede implicar múltiples horizontes temporales, en lugar de un único modelo mundial completo.

Tres invitados están sentados en sillones blancos. El del medio sostiene un micrófono azul mientras habla; el de la derecha tiene las manos cruzadas, y el de la izquierda las mantiene colocadas de forma natural. El fondo es oscuro, con el texto "WAIC 2026 Conferencia Mundial de Inteligencia Artificial" y el logotipo "ACE" en la parte superior. Esta imagen coincide con la descripción del Foro de Modelos Mundiales de WAIC 2026 en el documento, mostrando visualmente la escena del foro.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/4c042a14-222f-479c-a285-6ffe08d2fb9e-c12217f2-9772-4644-9176-3c421bfb637a.jpeg)
Los sistemas públicos existentes ya reflejan estos enfoques diferenciados
Las diferencias de opinión presentadas en el foro ya se han manifestado en los sistemas técnicos públicos de cada empresa.
Época Robótica Incorporada: Unificación de comprensión, predicción y acción
En la conferencia WAIC 2026, Época Robótica Incorporada lanzó Kairos 3.1, un modelo mundial incorporado orientado a la acción.
Los materiales de lanzamiento públicos describen una arquitectura híbrida de Transformer diseñada para conectar:
- Comprensión
- Simulación del mundo
- Acción
- Reflexión
Época Robótica Incorporada también reportó una latencia de inferencia de 125 milisegundos para su modelo Kairos 3.1 de 8 mil millones de parámetros en la plataforma NVIDIA.
Jetson Thor utiliza precisión BF16. Esta especificación es crucial, ya que la empresa posiciona explícitamente el modelo como un sistema de borde para el comportamiento robótico, y no como un mero generador de video fuera de línea.
Grupo Ant / Robbyant: De la simulación interactiva del mundo al modelo nativo incorporado
El LingBot-World de código abierto de Robbyant comenzó en la dirección del video generativo. Su repositorio de código oficial describe: entorno interactivo de alta fidelidad, consistencia temporal prolongada, control de usuario en tiempo real, latencia de interacción de menos de un segundo y capacidad de generación en tiempo real de 16 FPS en la versión Fast. Posteriormente, Grupo Ant integró LingBot-World-Fast en el producto móvil Lingguang, permitiendo a los usuarios convertir una sola imagen en un mundo generativo explorable. Al mismo tiempo, Robbyant se ha expandido a la investigación de modelos VLA y modelos incorporados, convirtiéndose en un caso típico de equipo que no se limita a un único paradigma de modelo mundial.
GigaAI: Generación a nivel de píxeles y plataforma GigaWorld
GigaAI se autodenomina una empresa de robótica incorporada e inteligencia general construida sobre tres niveles: GigaWorld (plataforma de modelo mundial), GigaBrain (sistema de inteligencia incorporada general) y Maker (portador robótico). Su trabajo en modelos mundiales enfatiza el papel central de los entornos físicos generativos en la aceleración de la creación, entrenamiento y prueba de datos. Cuando el modelo mundial se utiliza como un simulador visualmente rico, la generación en el espacio de píxeles se vuelve particularmente importante.
Robot Ágil: Modelo mundial como simulador generativo
El trabajo público de Robot Ágil muestra de manera particularmente clara el escenario de uso del simulador. AgiBot Digital World combina activos 3D, simulación física, generación de trayectorias de expertos, aleatorización de dominios, generación de datos y evaluación de modelos. Su marco posterior EVAC puede generar estados visuales futuros basados en secuencias de acciones robóticas. En tales aplicaciones, la consistencia temporal y la reproducción precisa de las interacciones acción-entorno son cruciales.
Star Dynamics: Fusión de modelo mundial y VLA
La trayectoria de desarrollo oficial de Star Dynamics muestra que su arquitectura WALL-A integra profundamente el modelo VLA con el modelo mundial. La dirección de WALL-B en 2026 avanza hacia lo que la empresa llama arquitectura de modelo mundial unificado. Su objetivo técnico es evitar el flujo de trabajo en el que el modelo mundial predice de forma independiente y luego una política independiente convierte las predicciones en acciones, integrando en su lugar los procesos de predicción y control en un sistema unificado de extremo a extremo.
Mundo Físico en Movimiento: Modelo mundial nativo incorporado y predicción en espacio latente
Los materiales públicos de Mundo Físico en Movimiento indican que la empresa está construyendo un "cerebro universal" para robots y un sistema de modelo fundamental multimodal nativo incorporado basado en modelos mundiales. Xia Zhongpu se unió a la empresa en marzo de 2026, después de liderar el trabajo de conducción autónoma de extremo a extremo en Li Auto. La dirección de investigación de la empresa enfatiza la predicción en espacio latente, cantidades físicas y el pensamiento de tipo JEPA. Dado que la documentación técnica pública detallada del modelo mundial actual sigue siendo limitada, las afirmaciones sobre su arquitectura exacta deben considerarse como direcciones técnicas descritas por su dirección, no como modelos abiertos completamente documentados.
¿Cuál es más probable que llegue a un consenso primero?
La siguiente pregunta no es qué arquitectura ganará al final.
Sino:
¿Qué parte del campo llegará primero a un acuerdo?
Las respuestas varían mucho.
Candidato 1: Representación unificada
Ren Guanghui y Xia Zhongpu enfatizaron la importancia de la representación.
Los grandes modelos de lenguaje finalmente convergieron en torno a representaciones secuenciales tokenizadas, permitiendo que diferentes tareas sean compatibles con una arquitectura.
La inteligencia incorporada aún carece de una unidad base igualmente universal.
El trabajo robótico implica:
- Imágenes.
- Video.
- Lenguaje.
- Posiciones de articulaciones.
- Velocidad.
- Fuerza.
- Señales táctiles.
- Geometría 3D.
- Acciones.
- Recompensas.
- Estados del entorno.
Si estas modalidades están aisladas, cada sistema necesita construir puentes complejos entre ellas.
Una representación unificada puede permitir que el modelo razone sobre percepción, estado, predicción y acción dentro del mismo espacio compartido.
El desafío es que las señales físicas no son naturalmente intercambiables.
Un pulso táctil, un fotograma de cámara, un comando de pinza: todos operan a diferentes velocidades y transportan información diferente.
Por lo tanto, un "token robótico" puede ser mucho más difícil de definir que un token de texto.
Candidato 2: Arquitectura híbrida
Wang Hao predijo una convergencia arquitectónica.
Desde esta perspectiva, diferentes enfoques de modelos mundiales resuelven partes del problema:
- La generación de video es buena para la predicción visual del futuro.
- La predicción latente es eficiente para el razonamiento.
- Los modelos 3D explícitos pueden proporcionar memoria espacial.
- Los modelos VLA conectan percepción y acción.
- El control clásico puede proporcionar estabilidad determinista de bajo nivel.
La arquitectura final puede combinar estos mecanismos en lugar de elegir uno y descartar los demás.
Este patrón es común en IA.
Las tecnologías inicialmente competitivas a menudo se convierten en componentes de sistemas más grandes una vez que sus fortalezas y debilidades se vuelven claras.
Candidato 3: Percepción táctil
Shen Yujun cree que la información táctil podría ser una de las primeras áreas en lograr consenso en la industria.
Actualmente, la mayoría de los grandes modelos mundiales se entrenan principalmente con datos visuales y de lenguaje.
Los robots operan mediante el contacto.
Necesitan detectar:
- Si un objeto se está deslizando.
- Si una superficie es dura o blanda.
- Si un agarre es seguro.
- Cuánta fuerza se está aplicando.
- Si un objeto deformable ha cambiado de forma.
- Si se ha producido un contacto, incluso cuando la vista está obstruida.
Para tareas de manipulación, la visión puede ser ambigua precisamente cuando el tacto es más útil.
Esto es un argumento convincente para que la percepción táctil sea una modalidad nativa, no un sensor opcional agregado después del entrenamiento del modelo.
La dirección de investigación de Robbyant también refleja un cambio amplio desde modelos basados en video digital hacia modelos diseñados en torno al control incorporado.
Una distinción importante:
El objetivo de un modelo de video es generar un futuro plausible.
El objetivo de un modelo mundial incorporado es apoyar acciones exitosas.
Estos dos objetivos se superponen, pero no son idénticos.
Candidato 4: Puntos de referencia compartidos
Tao Dacheng ofreció una respuesta diferente: la convergencia puede ocurrir primero en la evaluación, no en la arquitectura.
Esto tiene precedentes históricos.
La visión por computadora no convergió porque los investigadores acordaran de antemano una representación. Conjuntos de datos compartidos y puntos de referencia, como ImageNet, proporcionaron un objetivo común de medición para sistemas competidores. Una vez que todos los sistemas se evaluaron en la misma escala, las ideas débiles desaparecieron más rápido, mientras que las ideas útiles se difundieron a través de los límites arquitectónicos. Esta es la lógica detrás del lanzamiento de Cociente de Inteligencia Física en el foro.
Cociente de Inteligencia Física: Una métrica unificada para la inteligencia incorporada
El Cociente de Inteligencia Física se introdujo en la Conferencia Mundial de Inteligencia Artificial 2026 como un punto de referencia unificado para la inteligencia física incorporada. La información pública de lanzamiento indica que la iniciativa fue co-iniciada por:
- La Asociación de Inteligencia Artificial de Shanghái
- El Instituto de Investigación de Economía Circular de Shenzhen
- La Rama Este de China de la Academia de Tecnología de la Información y la Comunicación de China
Participan más de 20 universidades y organizaciones industriales. La plataforma tiene como objetivo comparar diferentes sistemas en las siguientes dimensiones:
- Diferentes morfologías robóticas
- Múltiples escenarios del mundo real
- Diferentes categorías de tareas
- Protocolos de evaluación unificados

Un punto de referencia útil para la inteligencia física no puede basarse únicamente en si el video generado parece realista. Debe plantear las siguientes preguntas:
- ¿El robot completó la tarea?
- ¿Las acciones son físicamente válidas?
- ¿Se recupera de eventos inesperados?
- ¿Cuánta intervención se requiere?
- ¿El comportamiento es seguro?
- ¿La estrategia se traslada a nuevos entornos?
- ¿Qué tan bien generaliza entre objetos y morfologías?
- ¿Cuánto tiempo y cálculo se necesita para cada decisión?
Para que el método específico de inteligencia física se convierta en un verdadero estándar de la industria, debe documentarse públicamente de manera continua y adoptarse ampliamente. Aun así, esta dirección aborda problemas prácticos. Las diversas afirmaciones sobre los modelos del mundo actuales son difíciles de comparar, porque una empresa puede informar sobre la calidad del video, otra sobre la tasa de éxito de las tareas, una tercera sobre el error en el estado físico y una cuarta sobre la consistencia del simulador. Sin una métrica unificada, cada sistema puede mostrar su mejor rendimiento en los indicadores para los que fue diseñado.
El realismo visual no equivale a comprensión física
El debate en torno a la inteligencia física también refleja cuestiones de investigación más amplias en el campo del video generativo. Investigadores de Google DeepMind introdujeron un punto de referencia independiente llamado inteligencia física, utilizado para evaluar si los modelos de video realmente entienden los principios físicos. El estudio encontró que el realismo visual y la corrección física pueden estar desconectados. El video generado puede verse convincente, pero violar:
- Mecánica de sólidos
- Comportamiento de fluidos
- Óptica
- Termodinámica
- Magnetismo
Esta distinción es crucial para los modelos del mundo robóticos. Solo las predicciones futuras visualmente creíbles son útiles cuando conservan las propiedades necesarias para la acción. Al mismo tiempo, un robot no necesita resolver todo un libro de texto de física antes de actuar. Un estándar práctico se sitúa entre ambos extremos.
Insuficiente:
Se ve realista, pero predice resultados incorrectos.
Potencialmente excesivo:
Calcula todas las variables físicas, incluso cuando la acción no las requiere.
Una predicción útil captura las diferencias físicas que alteran la decisión del robot.
Esta zona intermedia es precisamente donde se encuentra la divergencia actual en la investigación.
De la demostración al despliegue
Aunque hay divergencias en las arquitecturas de los modelos, cuando la discusión pasa de los modelos a los robots físicos, las opiniones de los expertos se vuelven más consistentes.
El estándar final es simple:
¿Puede el robot completar la tarea de manera confiable en el mundo físico?
Diferentes ponentes describen esto con distintos lenguajes.
- Xia Zhongpu enfatizó la eficacia de la decisión final.
- Ren Guanghui se centró en cuánto mejora el modelo del mundo las estrategias posteriores.
- Zhu Zheng destacó la tasa de éxito en múltiples tareas con robots físicos.
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
La terminología varía, pero el problema operativo es el mismo.
Un modelo del mundo solo tiene sentido si mejora el comportamiento real del robot.
Por qué el 99% de las demostraciones pueden seguir siendo un mal producto
Las demostraciones se pueden optimizar casi indefinidamente.
El equipo puede:
- Reiniciar el entorno.
- Seleccionar objetos favorables.
- Definir rutas preestablecidas.
- Repetir intentos fallidos.
- Ajustar durante semanas para un solo escenario.
- Tener ingenieros en espera en el sitio.
- Eliminar casos extremos raros.
El despliegue elimina estas protecciones.
En supermercados, hoteles, almacenes u hogares, ocurren eventos impredecibles a diario.
Wang Hao describió la curva de costos como fuertemente no lineal.
Llevar un sistema de:
90% → 99%
El esfuerzo requerido no es necesariamente el mismo que:
99% → 99.95%
Los fallos restantes suelen ser casos extremos difíciles.
Una tasa de fallo del 1% suena pequeña en el laboratorio.
Si el robot realiza 10,000 acciones al día, el 1% significa 100 fallos.
Incluso con una fiabilidad del 99.9%, cuando el volumen de tareas es suficientemente grande, aún se generan intervenciones humanas frecuentes.
El impacto empresarial incluye:
- Intervención manual.
- Retrabajo.
- Tiempo de inactividad.
- Quejas de clientes.
- Riesgos de seguridad.
- Costos de mantenimiento.
- Pérdida de rendimiento.
- Personal de supervisión adicional.
Por eso el despliegue cambia el significado de la calidad del modelo.
Los eventos aleatorios son la norma en el mundo real
Shen Yujun puso un ejemplo del sector minorista.
Un robot puede necesitar buscar un paquete de verduras.
Los productos suelen almacenarse en un lugar, pero un cliente puede cogerlo y dejarlo en otro refrigerador.
Desde la perspectiva de un conjunto de datos cuidadosamente planificado, esto parece una anomalía.
Pero desde la perspectiva de un robot que atiende a miles de clientes, la anomalía se convierte en la norma.
Por lo tanto, el modelo del mundo necesita manejar:
- Objetos en ubicaciones inesperadas.
- Falta de inventario.
- Personas bloqueando caminos.
- Reorganizaciones repentinas.
- Observaciones parciales.
- Cambios en la iluminación.
- Nuevas combinaciones de objetos.
- Suposiciones erróneas generadas en tareas anteriores.
Aquí es donde la capacidad de generalización es más importante que repetir demostraciones memorizadas.
La inferencia en el borde es un requisito de despliegue
Tao Dacheng destacó otra restricción práctica: la latencia.
Muchos modelos avanzados se ejecutan en la nube.
Los robots no siempre tienen tiempo para esperar un viaje de ida y vuelta a la nube.
La ventana de decisión puede ser de solo milisegundos.
Decenas o cientos de milisegundos.
La red también puede presentar:
- Congestión
- Indisponibilidad
- Falta de fiabilidad
- Costos excesivos
- Limitaciones por requisitos de privacidad o seguridad
Por eso ACE Robotics enfatiza el rendimiento en el borde del Kairos 3.1.
Un modelo con capacidades ligeramente inferiores pero que responde dentro del límite de control puede ser más útil que un modelo más potente que llega después de que la ventana de acción haya pasado.
Para el despliegue, la inteligencia debe ser:
- Suficientemente económica
- Suficientemente rápida
- Suficientemente confiable
- Suficientemente local
- Suficientemente predecible
Esto lleva a una distinción útil:
La demostración muestra el límite superior de la capacidad, el despliegue revela el límite inferior.
¿Qué será correcto dentro de dos años?
La parte final de la discusión invitó a los ponentes a imaginar mirando hacia atrás desde 2028.
¿Qué inversiones realizadas en 2026 resultarán ser correctas?
¿Cuáles podrían parecer engañosas?
Las respuestas revelan nuevamente lo que cada equipo considera perdurable.
Capacidad del modelo versus salida visible del modelo
Shen Yujun distinguió dos conceptos:
Capacidades fundamentales
Ejemplos incluyen:
- Eficiencia de generalización
- Interactividad
- Calidad de representación
- Condicionamiento de acciones
- Eficiencia de datos
- Consistencia causal
Salidas visibles
Ejemplos incluyen:
- Videos generados visualmente impresionantes
- Demostraciones refinadas
- Tareas individuales exitosas a largo plazo
- Alta calidad estética
Un modelo puede mejorar en capacidades fundamentales sin producir inmediatamente las demostraciones más impresionantes.
Por el contrario, un sistema puede optimizarse en torno a salidas visibles sin mejorar las capacidades necesarias para la inteligencia física general.
Esta es una de las razones por las que la industria necesita mejores evaluaciones.
La infraestructura de datos podría seguir siendo valiosa
Shen también cree que el trabajo invertido en tuberías de datos probablemente seguirá siendo útil.
Incluso si las arquitecturas cambian, la inteligencia incorporada seguirá necesitando:
- Trayectorias del mundo real
- Datos táctiles
- Casos de fallo
- Correcciones humanas
- Acciones robóticas
- Sincronización de sensores
- Datos de simulación
- Filtrado de calidad
- Conjuntos de datos de evaluación
La incertidumbre no está en si los datos importan.
Sino en si los datos recopilados hoy seguirán coincidiendo con las representaciones y métodos de entrenamiento utilizados en modelos futuros.
Un conjunto de datos puede volverse menos útil cuando:
- La configuración del sensor cambia
- El espacio de acción se modifica
- Las etiquetas codifican suposiciones obsoletas
- Los datos carecen de las modalidades necesarias
- La estrategia de recopilación es demasiado limitada
- Los nuevos modelos requieren una resolución temporal diferente
Por lo tanto, construir una tubería de datos flexible puede ser más duradero que optimizar un conjunto de datos fijo.
No interferir prematuramente con el modelo base
Zhu Zheng advirtió que la industria podría explorar demasiados escenarios comerciales antes de que el modelo base en sí mismo se haya estabilizado.
Esta es una situación familiar para las startups.
El despliegue comercial proporciona:
- Ingresos
- Datos
- Retroalimentación de clientes
- Restricciones reales
Pero también puede desviar al equipo del modelo hacia:
- Integraciones únicas
- Flujos de trabajo personalizados
- Reglas específicas del cliente
- Adaptación de hardware
- Soporte y mantenimiento
Si la arquitectura subyacente aún está cambiando rápidamente, una
especialización prematura puede ralentizar el progreso de la investigación fundamental.
El equilibrio entre la investigación de modelos y el despliegue comercial varía según la empresa.
No hay una respuesta única.
Las arquitecturas nativas incorporadas podrían surgir
Ren Guanghui predijo que los modelos del mundo tenderán cada vez más hacia lo nativo incorporado.
Esto significa que el modelo se diseña desde el principio en torno a la interacción física, en lugar de adaptarse posteriormente a partir de tareas de generación de imágenes o video en internet.
El entrenamiento nativo incorporado puede incluir:
- Acciones robóticas.
- Percepción propioceptiva.
- Fuerza.
- Datos táctiles.
- Video en primera persona.
- Observaciones multivista.
- Estado tridimensional.
- Retroalimentación de herramientas.
- Datos de intervención.
- Éxito y fracaso de tareas.
La arquitectura en sí misma también podría diseñarse en torno al bucle de control.
El problema clave es si el modelo representa las variables que el robot necesita para ejecutar acciones, no si su estructura interna es similar a la de un modelo generativo de medios.
Justo donde hay divergencia está la mayor oportunidad
Este debate no concluyó con una única arquitectura aceptada por todos.
Quizás esto indica que el campo aún está en una etapa temprana, no que esté estancado.
Aún quedan varias áreas importantes sin resolver:
| Pregunta | Diferentes puntos de vista |
|---|---|
| ¿Qué debería predecir el modelo? | Píxeles, estados latentes, geometría explícita, o un enfoque mixto |
| ¿Qué nivel de precisión física se requiere? | Estimación precisa del estado vs. plausibilidad relacionada con la acción |
| ¿Hasta dónde debería alcanzar la predicción? | Consistencia a largo plazo vs. control de bajo retardo a corto plazo |
| ¿Qué unificará este campo? | Representaciones, arquitecturas, datos táctiles o puntos de referencia |
| ¿Dónde debería ejecutarse la inferencia? | En la nube, en el borde, o en un despliegue mixto |
| ¿Cuáles son las verdaderas métricas de éxito? | Calidad de simulación, predicción física, mejora de políticas o tasa de éxito en tareas reales |
| ¿Qué datos son los más importantes? | Video, trayectorias de robots, fuerza, tacto, simulación o datos mixtos |
En campos maduros, las arquitecturas tienden a converger.
En campos emergentes, la divergencia revela precisamente las mayores oportunidades aún no conquistadas.
Si se logra demostrar una de las hipótesis actualmente en disputa, un equipo podría establecer una ventaja técnica antes de que la industria llegue a un consenso.
Un marco práctico para evaluar modelos del mundo robóticos
Para desarrolladores y equipos de robótica, este debate puede traducirse en una lista de verificación de evaluación más concreta.
- Objetivo de predicción
Definir qué predice el modelo:
- Píxeles.
- Estados latentes.
- Geometría.
- Acciones.
- Fuerzas.
- Observaciones futuras.
- Una combinación de los anteriores.
La salida debe coincidir con el problema de control descendente.
- Horizonte de predicción
Medir el rendimiento en los siguientes niveles:
- Próximo paso inmediato.
- Ciclo corto.
- Ciclo de varios segundos.
- Ciclo largo de tarea.
No evaluar únicamente en el horizonte donde el modelo se desempeña mejor.
- Latencia
Medir el tiempo de inferencia real en el hardware objetivo de despliegue.
Un modelo que no cumple con los requisitos de tiempo de control no debe obtener una puntuación perfecta por su precisión predictiva.
- Validez física
Las pruebas incluyen:
- Colisiones.
- Contacto.
- Equilibrio.
- Deformación.
- Acciones sensibles a la fricción.
- Permanencia de objetos.
- Consistencia multiángulo.
- Mejora de la política
La pregunta más práctica quizás sea:
¿Incluir un modelo del mundo mejora la tasa de éxito en tareas reales?
Comparar el rendimiento de la política descendente con y sin modelo del mundo:
Políticas que incluyen y no incluyen componentes de modelo del mundo.
- Capacidad de generalización
Probar en nuevos elementos:
- Objetos
- Disposiciones
- Cuerpos robóticos
- Iluminación
- Materiales
- Comportamientos humanos
- Combinaciones de tareas
- Capacidad de recuperación
Medir lo que ocurre después del primer error.
Un sistema desplegado debe detectar fallos, actualizar su estado e intentar otra solución.
- Comportamiento en el borde y en la nube
Probar tanto condiciones de red normales como degradadas.
Cuando la inferencia remota no está disponible, el robot debe fallar de forma segura.
- Tasa de intervención
Realizar seguimiento de la asistencia humana por:
- Hora
- Tarea
- Cada 100 acciones
- Cada 1000 acciones
Esto suele revelar más sobre la calidad del despliegue que una única tasa de éxito.
- Costo por tarea exitosa
Incluye:
- Inferencia del modelo
- Hardware
- Red
- Intervención humana
- Retrabajo
- Mantenimiento
- Consumo energético
- Tiempo de inactividad
El mejor modelo del mundo no es necesariamente el que obtiene la puntuación más alta en el punto de referencia.
Es el que hace que todo el sistema robótico funcione mejor.
Preguntas frecuentes
¿Qué es un modelo del mundo en IA incorporada?
Un modelo del mundo es un modelo que puede representar o predecir cómo cambia el entorno con el tiempo, las acciones del robot u otros eventos. En robótica, puede apoyar la planificación, simulación, selección de acciones, generación de datos de entrenamiento o mejora de políticas.
¿Cuáles son los principales enfoques de modelos del mundo discutidos en WAIC 2026?
La discusión cubrió ampliamente la generación en el espacio de píxeles, la predicción en el espacio latente (como los enfoques tipo JEPA) y los sistemas híbridos o unificados que combinan la predicción del mundo con control VLA, razonamiento 3D u otras representaciones. Estas categorías se superponen, ya que varias empresas utilizan múltiples técnicas.
¿Un modelo del mundo robótico necesita un simulador físico preciso?
No necesariamente. Algunos investigadores abogan por una predicción precisa de geometría, movimiento y fuerzas, mientras que otros priorizan un razonamiento físico suficiente para seleccionar la acción correcta. La precisión requerida depende de la tarea y del costo del fallo.
¿Por qué es controvertida la consistencia a largo plazo?
Las expansiones de secuencias largas son útiles para la simulación y la planificación a largo plazo, pero aumentan el costo de inferencia y pueden ralentizar el control en tiempo real. Un robot físico puede necesitar predicciones rápidas y cortas para acciones inmediatas, mientras utiliza otro mecanismo para la planificación a largo plazo.
¿Qué es PHYSICAL IQ?
PHYSICAL IQ es una iniciativa de punto de referencia para la inteligencia física incorporada lanzada durante WAIC
2026. Su objetivo es proporcionar un protocolo de evaluación común para diferentes cuerpos robóticos, escenarios y tareas.
¿PHYSICAL IQ es lo mismo que Physics-IQ de Google DeepMind?
No. Son proyectos diferentes. PHYSICAL IQ es una plataforma de evaluación para robótica incorporada presentada en WAIC 2026, mientras que Physics-IQ es un punto de referencia de investigación para probar si los modelos de video generativos comprenden la física.
¿Por qué es importante la detección táctil para los modelos del mundo?
La visión no revela completamente la fuerza de contacto, el deslizamiento, la presión, la flexibilidad y algunas propiedades del material. Las señales táctiles y de fuerza proporcionan al robot información directa sobre las interacciones físicas y pueden volverse cada vez más importantes para los modelos del mundo centrados en la manipulación.
¿Qué es más importante que una buena demostración robótica?
El despliegue
La confiabilidad. Los equipos necesitan medir la tasa de éxito real de las tareas, la latencia, la tasa de intervención, la capacidad de recuperación ante eventos inesperados, la seguridad, el costo y el rendimiento en múltiples entornos, no solo en demostraciones seleccionadas.
Herramientas relacionadas
- Kairos 3.1 en Hugging Face: Colección pública de ACE Robotics para su trabajo de modelos del mundo orientados a la acción.
- LingBot-World: Simulador mundial interactivo de código abierto de Robbyant, que incluye código, modelos y documentación técnica.
- Mundo Digital de AgiBot: Marco de simulación oficial de AgiBot para generación de datos, entrenamiento y evaluación de modelos incorporados.
- GigaAI: Sitio web oficial de GigaWorld, GigaBrain y la plataforma de IA incorporada de la empresa.
- X cuadrado Robot: Sitio web oficial que describe la familia de modelos fundamentales WALL y la integración de modelos del mundo/VLA.
- Physics-IQ: Un punto de referencia de investigación independiente para evaluar la comprensión física en modelos de video generativos.
- NVIDIA Isaac Sim: Plataforma de simulación robótica para generar datos sintéticos y probar sistemas robóticos.
Enlaces relacionados
- Colección Kairos 3.1 de ACE Robotics: Recursos de modelos públicos de Kairos 3.1 y sistemas incorporados relacionados.
- Anuncio de WAIC 2026 de ACE Robotics: Comunicado de prensa de la empresa que cubre Kairos 3.1 y la iniciativa PHYSICAL IQ.
- [Anuncio del modelo del mundo LingGuang de Ant Group](https://www.
antgroup.com/en/news-media/press-releases/1777280400000): Comunicado oficial de Ant Group que describe la integración de LingBot-World-Fast en Lingguang.
- Repositorio de GitHub de LingBot-World: Código abierto, instrucciones de instalación, pesos y enlaces a documentos de Robbyant.
- Mundo Digital de AgiBot: Presentación oficial del marco de simulación y datos encarnados de AgiBot.
- AgiBot EVAC y EWMBench: Trabajo oficial de AgiBot sobre modelos del mundo condicionados por acciones y su evaluación.
- Robot X cuadrado: Información oficial sobre la familia de modelos WALL y la inteligencia encarnada de extremo a extremo.
Resumen
La mesa redonda sobre modelos del mundo en WAIC 2026 mostró que el campo de la inteligencia encarnada aún no ha alcanzado un consenso sobre la definición, representación o arquitectura de los modelos del mundo. Las principales discrepancias involucran la precisión física, el alcance de la predicción, las formas de representación, la percepción táctil y la relación entre el modelado del mundo y la acción.
El consenso más fuerte surge en las etapas posteriores de la pila tecnológica. En última instancia, los modelos del mundo deben hacer que los robots físicos sean más confiables: mejor tasa de éxito de tareas, menos intervenciones, decisiones más rápidas, recuperaciones más seguras y menores costos de implementación.
PHYSICAL IQ tiene como objetivo crear una capa de evaluación común, y antes de eso, las arquitecturas mismas tienden a converger. Queda por ver si este punto de referencia será ampliamente adoptado, pero la necesidad de métodos de medición de inteligencia física comparables es clara.
Las controversias actuales en este campo no son una debilidad, sino un mapa de problemas aún no resueltos que probablemente definirán la dirección del desarrollo de la próxima generación de inteligencia artificial encarnada.



