Введение
Мировая модель стала одним из самых активных направлений исследований в области воплощённого интеллекта, однако в этой сфере до сих пор отсутствует единое определение.
Исследователи расходятся во мнениях относительно того, что должна представлять мировая модель, насколько точным должно быть физическое моделирование, должны ли будущие состояния генерироваться в пиксельном или скрытом пространстве, сколько прогнозов должен делать робот перед действием, какие данные наиболее важны и даже как измерять прогресс в исследованиях.
Это отсутствие консенсуса особенно ярко проявилось на WAIC 2026.
19 июля форум, организованный шестью китайскими компаниями в области воплощённого интеллекта, собрал лидеров технологий, представляющих различные подходы к роботизированным мировым моделям:
- Ведущий: Хай Дачэн, главный научный сотрудник ACE Robotics
- Шэнь Сюэцзюнь, главный научный сотрудник команды Roboyant, Ant Group
- Чжу Чжэн, сооснователь и главный научный сотрудник GigaAI
- Ся Чжунпу, сооснователь и совместный технический директор Wujie Power
- Жэнь Гуанхуэй, директор по алгоритмам ИИ в AgiBot
- Ван Хао, сооснователь и технический директор X Square Robot
Ценность этой дискуссии заключается именно в том, что выступающие не пришли к единому техническому решению.
Одни хотят, чтобы мировая модель всё точнее представляла геометрию, движение и механику. Других больше волнует, сможет ли модель предсказать достаточную физическую структуру для выбора успешного действия.
Одни считают, что долгосрочная согласованность имеет решающее значение. Другие утверждают, что это может оказаться контрпродуктивным, когда прогнозы отнимают слишком много времени на принятие решений роботом.
Одни ожидают, что сфера придёт к консенсусу вокруг какого-то общего представления. Другие считают, что гибридная архитектура, тактильное восприятие или стандартизированные бенчмарки станут отправной точкой для начала консенсуса.
За этими разногласиями стоит более практический вопрос:
Какими способностями должна обладать мировая модель, чтобы приносить реальную пользу за пределами демонстрационных сценариев?

Три технологических подхода
Эти шесть компаний не использовали полностью идентичные архитектуры, но, основываясь на способе прогнозирования мира моделью, дискуссию можно обобщить в три основных технологических подхода.
| Подход | Репрезентативный метод | Основная концепция |
|---|---|---|
| Генерация в пиксельном пространстве | GigaAI | Прямое прогнозирование будущего визуального состояния или прогнозирование через генеративные визуальные представления |
| Прогнозирование в скрытом пространстве | Направление JEPA от Wujie Power | Прогнозирование компактного внутреннего представления, а не полных пикселей |
| Гибридная или унифицированная архитектура | ACE Robotics, Roboyant, X Square Robot, AgiBot | Сочетание генерации, прогнозирования в скрытом пространстве, явного пространственного рассуждения, VLA-управления или симуляционно-ориентированных моделей |
Хотя эта классификация имеет справочную ценность, её не следует рассматривать как постоянный стандарт для отрасли.
Некоторые из этих компаний уже сочетают несколько механизмов. Более важное разногласие заключается в том, какой должна быть полезная мировая модель, по мнению каждой команды.
Какие способности наиболее важны?
Первое основное разногласие касается того, как мировая модель связана с физикой.
Точка зрения 1: Прогнозирование физического состояния должно быть точным
Ся Чжунпу считает, что оценка должна включать точность модели в прогнозировании геометрического состояния, траекторий движения, механических воздействий и связанных физических величин.
Эта точка зрения рассматривает мировую модель частично как структурированный предиктор физического состояния.
Для роботов, которым необходимо решать, как толкать, захватывать, поднимать, навигировать или манипулировать объектами, соответствующие вопросы могут включать:
- Куда переместится объект?
- Столкнётся ли он с другими объектами?
- Как изменится его ориентация?
- Сколько усилия нужно приложить?
- Останется ли захват стабильным?
- Каким будет состояние среды после выполнения действия?
Неявное представление может сделать явный физический регресс более привлекательным — потому что модели не нужно визуализировать каждый будущий пиксель перед оценкой этих величин.
Преимущество заключается в точности и контролируемости.
Сложность в том, что физический мир содержит переменные, которые трудно непосредственно наблюдать или выводить, такие как трение, скрытое распределение массы, податливость, состояние контакта и свойства материала.
Таким образом, модель может иметь физическую структурированность, не будучи полным симулятором.
Точка зрения 2: Физическая правдоподобность может быть важнее точной физики
Шэнь Юйцзюнь предложил другой критерий.
Роботу не обязательно воспроизводить каждый параметр физической системы, но нужно понимать различия, которые критически важны для выполнения предстоящего действия.
Например, когда два материала бросают, сжимают, тянут или захватывают, роботу может потребоваться распознать их различную реакцию, не оценивая заранее каждый коэффициент.
Это ближе к физическому пониманию, связанному с действием, а не к полной физической симуляции.
Разницу можно обобщить так:
Точная физическая симуляция:
Максимально точное прогнозирование детального состояния мира.
Физическое рассуждение, связанное с действием:
Прогнозирование состояния мира, достаточное для выбора безопасного и эффективного действия.
Вторая цель требует меньше вычислительных затрат и достаточна для многих реальных роботизированных задач.
Это также соответствует системному дизайну, происходящему из моделей генерации видео — такие модели естественным образом обучаются тому, какие будущие визуальные представления являются правдоподобными, даже если не раскрывают явно все потенциальные физические переменные.
Основной вопрос: Какая ошибка меняет действие?
Мнения экспертов указывают на более прагматичный критерий оценки:
Ошибка наиболее критична, когда она меняет решение робота.
Если робот может успешно поставить чашку, не оценивая точный коэффициент трения стола, отсутствие этого значения может быть неважно.
Но если отсутствие этого физического понимания приводит к падению чашки, то эта ошибка критична.
Таким образом, требуемая физическая точность зависит от:
- Конкретной задачи
- Запаса безопасности
- Конструкции самого робота
- Временного горизонта действия
- Цены неудачи
- Доступного времени для рассуждения
Долгосрочная согласованность или быстрое принятие решений?
Второе разногласие касается того, как далеко в будущее должна прогнозировать мировая модель.
AgiBot:
Долгосрочная физическая согласованность критически важна
AgiBot вложила значительные ресурсы в симуляцию и оценку на основе мировых моделей.
Их публичная платформа AgiBot Digital World предоставляет высокоточную симуляционную среду, автоматически сгенерированные экспертные траектории и инструменты оценки моделей.
Затем AgiBot выпустила фреймворк мировой модели EVAC и EWMBench, расширяя концепцию управляемой действиями генеративной симуляции.
Для мировой модели, используемой в качестве симулятора, долгосрочная согласованность имеет решающее значение.
Ценность симуляции значительно снижается, если:
- Идентичность объектов постепенно меняется
- Геометрия дрейфует
- Робот забывает предыдущие взаимодействия
- Длинные последовательности нарушают физические законы
- Результаты из нескольких видов несовместимы
Исходя из этого, мировая модель должна поддерживать согласованное состояние на значительном временном горизонте.
X Square Robot: Долгосрочное прогнозирование может стать ложной целью
Ван Хао подверг сомнению предположение, что «более длинный прогноз всегда лучше».
X Square Robot следует подходу сквозной воплощённой модели, тесно связывая восприятие, рассуждение, моделирование мира и генерацию действий.
Их публичные материалы описывают серию WALL как шаг к унифицированной физической мировой модели, а не как изолированные системы прогнозирования и управления.
В таких системах мировая модель — это не просто симулятор; само прогнозирование является частью управляющего цикла.
Поэтому более длительное прогнозирование влечёт за собой следующие издержки:
Чем дальше прогнозируется будущее
→ Тем больше объём рассуждений
→ Тем выше задержка
→ Тем меньше времени на действие
Если среда, в которой находится робот, меняется быстрее, чем модель завершает рассуждение, идеально согласованный долгосрочный прогноз может быть практически бесполезен.
Для управления короткий прогноз, поступивший в нужное время, может быть гораздо ценнее, чем долгий прогноз, пришедший с опозданием.
Горизонт прогнозирования должен соответствовать горизонту управления
Это указывает на то, что не существует единственного оптимального горизонта прогнозирования.
Симулятору склада может потребоваться прогнозирование длинных последовательностей.
Роботу, выполняющему задачу балансировки объекта, может потребоваться чрезвычайно быстрое краткосрочное прогнозирование.
Мобильному манипулятору, выполняющему многоэтапные задачи, может потребоваться и то, и другое:
- Долгосрочное планирование
- Краткосрочное физическое прогнозирование
- Быстрое корректирующее замыкание
Таким образом, разумный дизайн может включать несколько временных горизонтов, а не единую мировую модель полной длины.

Три гостя сидят на белых кожаных креслах. Участник в центре держит синий микрофон и выступает, участник справа сложил руки, участник слева держит руки естественно. Фон тёмный, сверху надпись «WAIC 2026 Всемирная конференция по искусственному интеллекту» и логотип «ACE». Данное изображение соответствует описанию форума по мировым моделям WAIC 2026 в документе, наглядно отображая обстановку на форуме.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/4c042a14-222f-479c-a285-6ffe08d2fb9e-c12217f2-9772-4644-9176-3c421bfb637a.jpeg)
Существующие открытые системы уже отражают эти различия в приоритетах
Разногласия во взглядах, представленные на форуме, уже проявились в публичных технологических системах различных компаний.
Эпохальный воплощённый интеллект: единство понимания, прогнозирования и действия
На конференции WAIC 2026 компания «Эпохальный воплощённый интеллект» представила Kairos 3.1 — воплощённую мировую модель, ориентированную на действия.
В опубликованных материалах описывается гибридная архитектура Transformer, направленная на объединение:
- понимания
- прогнозирования мира
- действий
- рефлексии
Компания также сообщила о задержке вывода модели Kairos 3.1 с 8 миллиардами параметров на платформе NVIDIA, составившей 125 миллисекунд.
Jetson Thor использует точность BF16. Эта характеристика критически важна, поскольку компания позиционирует данную модель как периферийную систему для роботизированного поведения, а не просто как автономный генератор видео.
Ant Group / Robbyant: от интерактивного моделирования мира к воплощённым нативным моделям
Открытая модель LingBot-World от Robbyant изначально развивалась в направлении генеративного видео. Её официальное описание в репозитории включает: высокоточную интерактивную среду, долговременную временную согласованность, управление в реальном времени, задержку взаимодействия менее секунды и возможность генерации в реальном времени со скоростью 16 кадров в секунду в версии Fast. Впоследствии Ant Group интегрировала LingBot-World-Fast в мобильный продукт «Лингуан», позволяя пользователям превращать одно изображение в генерируемый мир для исследования. Одновременно Robbyant расширил свою деятельность на исследования в области VLA и воплощённых моделей, став типичным примером команды, не ограничивающейся единой парадигмой мировой модели.
GigaAI: генерация на уровне пикселей и платформа GigaWorld
GigaAI позиционирует себя как компанию в области воплощённого интеллекта и универсальной робототехники, построенную на трёх уровнях: GigaWorld (платформа мировых моделей), GigaBrain (универсальная воплощённая интеллектуальная система) и Maker (воплощённый носитель робота). Работа компании над мировыми моделями подчёркивает ключевую роль генеративной физической среды в ускорении создания данных, обучения и тестирования. Когда мировая модель используется как визуально насыщенный симулятор, генерация в пиксельном пространстве становится особенно важной.
Zhiyuan Robot: мировая модель как генеративный симулятор
Публичная работа Zhiyuan Robot особенно наглядно демонстрирует сценарий использования симулятора. AgiBot Digital World объединяет 3D-активы, физическое моделирование, генерацию экспертных траекторий, рандомизацию доменов, создание данных и оценку моделей. Его последующий фреймворк EVAC способен генерировать будущие визуальные состояния на основе последовательностей действий робота. В таких приложениях временная согласованность и точное воспроизведение взаимодействия действия и среды имеют первостепенное значение.
Xingdong Jiyuan: слияние мировой модели и VLA
Официальная история развития Xingdong Jiyuan показывает, что её архитектура WALL-A глубоко интегрирует модель VLA и мировую модель. Направление WALL-B 2026 года движется к тому, что компания называет унифицированной архитектурой мировой модели. Её техническая цель — избежать конвейерного процесса, при котором мировая модель независимо прогнозирует, а затем отдельная политика преобразует прогнозы в действия, объединяя процессы прогнозирования и управления в единую сквозную систему.
Wujie Dongli: воплощённая нативная мировая модель и прогнозирование в латентном пространстве
Публичные материалы Wujie Dongli показывают, что компания создаёт «универсальный мозг» для роботов и воплощённую нативную мультимодальную фундаментальную модельную систему на основе мировой модели. Ся Чжунпу присоединился к компании в марте 2026 года, ранее руководя работой по сквозному автономному вождению в Li Auto. Направление исследований компании подчёркивает прогнозирование в латентном пространстве, физические величины и мышление в стиле JEPA. Поскольку подробная открытая техническая документация по текущей мировой модели всё ещё ограничена, утверждения о её точной архитектуре следует рассматривать как техническое направление, описанное руководством компании, а не как полностью документированную открытую модель.
Что, скорее всего, будет согласовано в первую очередь?
Следующий вопрос заключается не в том, какая архитектура в итоге победит.
А в том:
Какая часть этой области будет согласована первой?
Ответы сильно различаются.
Кандидат 1: унифицированное представление
Жэнь Гуанхуэй и Ся Чжунпу оба подчеркнули важность представления.
Большие языковые модели в конечном итоге сошлись на токенизированном последовательном представлении, что позволило различным задачам быть совместимыми с одной архитектурой.
Воплощённому интеллекту всё ещё не хватает столь же универсального базового элемента.
Работа роботов включает:
- изображения
- видео
- язык
- положения суставов
- скорость
- силу
- тактильные сигналы
- 3D-геометрию
- действия
- награды
- состояния среды
Если эти модальности изолированы друг от друга, каждой системе требуется строить сложные мосты между ними.
Унифицированное представление позволило бы модели рассуждать о восприятии, состоянии, прогнозировании и действиях в одном и том же общем пространстве.
Проблема в том, что физические сигналы по своей природе невзаимозаменяемы.
Тактильный импульс, кадр с камеры, команда захвата — они работают на разных скоростях и несут различную информацию.
Следовательно, «токен робота» может быть гораздо сложнее определить, чем текстовый токен.
Кандидат 2: гибридная архитектура
Ван Хао прогнозирует слияние архитектур.
С этой точки зрения, различные подходы к мировым моделям решают лишь часть проблемы:
- Генерация видео хороша для прогнозирования визуального будущего.
- Латентное прогнозирование эффективно для рассуждений.
- Явные 3D-модели обеспечивают пространственную память.
- Модели VLA соединяют восприятие и действие.
- Классическое управление обеспечивает детерминированную низкоуровневую стабильность.
Конечная архитектура, вероятно, объединит эти механизмы, а не выберет один и отвергнет другие.
Такая модель распространена в области ИИ.
Изначально конкурирующие технологии, после выявления их сильных и слабых сторон, часто становятся частью более крупных систем.
Кандидат 3: тактильное восприятие
Шэнь Юйцзюнь считает, что тактильная информация может стать одной из первых областей, где отрасль достигнет консенсуса.
В настоящее время большинство крупных мировых моделей обучаются в основном на визуальных и языковых данных.
Роботы манипулируют объектами через контакт.
Им необходимо обнаруживать:
- скользит ли объект
- твёрдая или мягкая поверхность
- надёжен ли захват
- сколько силы приложено
- изменил ли деформируемый объект форму
- произошёл ли контакт, даже если поле зрения перекрыто
Для задач манипуляции именно в моменты, когда тактильные ощущения наиболее полезны, зрение может быть неоднозначным.
Это является веским аргументом в пользу того, чтобы тактильное восприятие было нативной модальностью, а не опциональным датчиком, добавляемым после обучения модели.
Исследовательское направление Robbyant также отражает широкий переход от моделей, основанных на цифровом видео, к моделям, разработанным вокруг воплощённого управления.
Важное различие заключается в следующем:
Цель видеомодели — генерировать правдоподобное будущее.
Цель воплощённой мировой модели — поддерживать успешные действия.
Эти две цели пересекаются, но не совпадают.
Кандидат 4: общий бенчмарк
Тао Дачэн дал другой ответ: конвергенция может сначала произойти в области оценки, а не архитектуры.
Для этого есть исторический прецедент.
Компьютерное зрение не сошлось потому, что исследователи заранее договорились о каком-то одном представлении. Общие наборы данных и бенчмарки, такие как ImageNet, предоставили конкурирующим системам общую цель для измерения. Как только все системы стали оцениваться по одной шкале, слабые идеи исчезли быстрее, а полезные идеи смогли распространяться через границы архитектур. Именно эта логика лежит в основе запуска на форуме Физического IQ.
Физический IQ: единый стандарт для воплощённого интеллекта
Физический IQ был представлен на Всемирной конференции по искусственному интеллекту 2026 года как унифицированный бенчмарк для воплощённого физического интеллекта. Согласно опубликованной информации, данная инициатива была совместно запущена:
- Шанхайской ассоциацией искусственного интеллекта
- Шэньчжэньским институтом циркулярной экономики
- Восточно-Китайским филиалом Китайской академии информационных и коммуникационных технологий
В ней участвуют более 20 университетов и отраслевых организаций. Платформа предназначена для сравнения различных систем по следующим направлениям:
- различные морфологии роботов
- множество сценариев реального мира
- различные категории задач
- унифицированные протоколы оценки
![Изображение демонстрирует сцену круглого стола форума «Шесть маленьких драконов» мировых моделей 2026 года. На изображении семь участников, шестеро из которых стоят, а один сидит слева. Фон тёмный, сверху логотип «WAIC 2026 Всемирная конференция по искусственному интеллекту» и надпись «ACE». Участники одеты в различные стили одежды, некоторые носят бейджи. В левом верхнем углу надпись: «Круглый стол «Шести маленьких драконов» мировых моделей — продвижение физического ИИ от «понимания» к «исполнению».]
Это изображение связано с содержанием обсуждения за круглым столом «Шести драконов», представленного в документе, и наглядно показывает участников дискуссии.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/c242a920-2b42-4966-92ce-2e70518c2ac6-7fb4c60a-1a46-46c3-9743-2b5a5a5a322e.jpeg)
Полезный бенчмарк физического интеллекта не может полагаться только на то, насколько реалистично выглядит сгенерированное видео. Он должен задавать следующие вопросы:
- Выполнил ли робот задачу?
- Физически ли эффективны действия?
- Восстанавливается ли он после неожиданных событий?
- Сколько требуется вмешательств?
- Безопасно ли поведение?
- Переносится ли стратегия в новую среду?
- Насколько хорошо он обобщает на различные объекты и формы?
- Сколько времени и вычислительных ресурсов требуется на каждое решение?
Конкретные методы оценки физического интеллекта требуют постоянной открытой документации и широкого внедрения, чтобы стать настоящим отраслевым стандартом. Тем не менее, это направление решает реальные проблемы. Текущие заявления о моделях мира трудно сравнивать, потому что одна компания может сообщать о качестве видео, другая — о проценте успешности задач, третья — об ошибках физического состояния, а четвёртая — о согласованности симулятора. Без единой шкалы каждая система может демонстрировать наилучшие результаты по специально разработанным для неё метрикам.
Визуальное правдоподобие ≠ понимание физики
Обсуждение физического интеллекта также отражает более широкие исследовательские вопросы в области генеративного видео. Исследователи Google DeepMind ввели независимый бенчмарк под названием физический интеллект для оценки того, действительно ли видеомодели понимают физические принципы. Исследование показало, что визуальное правдоподобие и физическая корректность могут расходиться. Сгенерированное видео может выглядеть убедительно, но при этом нарушать:
- механику твёрдых тел;
- поведение жидкостей;
- оптику;
- термодинамику;
- магнетизм.
Это различие критически важно для роботизированных моделей мира. Прогноз будущего полезен только в том случае, если он, будучи визуально достоверным, сохраняет свойства, необходимые для действий. В то же время роботу не нужно решать весь учебник физики перед действием. Практический стандарт находится между двумя крайностями.
Недостаточно:
Выглядит реалистично, но предсказывает неправильный результат.
Возможно, избыточно:
Вычисляет каждую физическую переменную, даже если это не нужно для действия.
Полезное предсказание улавливает физические различия, изменяющие решения робота.
Эта промежуточная зона и является текущей точкой расхождения в исследованиях.
От демонстрации к развёртыванию
Несмотря на разногласия в архитектурах моделей, когда обсуждение переходит от моделей к физическим роботам, мнения экспертов становятся более согласованными.
Создайте сайт-витрину и привлекайте лиды за минуты
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Конечный критерий прост:
Может ли робот надёжно выполнять задачи в физическом мире?
Разные выступающие описывали это разными словами.
- Ся Чжунпу подчеркнул эффективность конечных решений.
- Жэнь Гуанхуэй сосредоточился на том, насколько модель мира улучшает нижестоящие стратегии.
- Чжу Чжэн подчеркнул многозадачную успешность на физических роботах.
Терминология разная, но операционный вопрос един.
Модель мира имеет смысл только если она улучшает фактическое поведение робота.
Почему 99% демонстраций всё ещё могут быть плохим продуктом
Демонстрации можно оптимизировать почти бесконечно.
Команда может:
- сбросить окружение;
- выбрать благоприятные объекты;
- предопределить маршрут;
- повторять неудачные попытки;
- настраивать единичный сценарий неделями;
- держать инженера наготове;
- исключить редкие крайние случаи.
Развёртывание устраняет эти защитные меры.
Супермаркеты, отели, склады или дома ежедневно сталкиваются с непредсказуемыми событиями.
Ван Хао описал кривую затрат как сильно нелинейную.
Переход системы от:
90% → 99%
не обязательно равен по усилиям:
99% → 99.9%
Оставшиеся сбои часто относятся к трудным длиннохвостовым случаям.
1% отказов в лаборатории звучит незначительно.
Если робот выполняет 10 000 действий в день, 1% означает 100 сбоев.
Даже при 99.9% надёжности, при достаточном объёме задач всё равно будут частые ручные вмешательства.
Бизнес-последствия включают:
- ручное управление;
- переделки;
- простои;
- жалобы клиентов;
- риски безопасности;
- затраты на обслуживание;
- потери пропускной способности;
- дополнительный надзорный персонал.
Вот почему развёртывание меняет значение качества модели.
Случайные события в реальном мире — норма
Шэнь Юйцзюнь привёл пример из розничной торговли.
Роботу может потребоваться найти упаковку овощей.
Товар обычно хранится в одном месте, но покупатель мог взять его и положить в другой холодильник.
С точки зрения тщательно подготовленного набора данных это выглядит как аномалия.
Но с точки зрения робота, обслуживающего тысячи покупателей, аномалия становится нормой.
Поэтому модель мира должна обрабатывать:
- объекты в неожиданных местах;
- отсутствие запасов;
- людей, блокирующих путь;
- внезапные перестановки;
- локальные наблюдения;
- изменения освещения;
- новые комбинации объектов;
- ошибочные предположения, сделанные на ранних этапах задачи.
Вот почему способность к обобщению важнее, чем воспроизведение заученных демонстраций.
Периферийный вывод — требование развёртывания
Тао Дачэн подчеркнул ещё одно практическое ограничение: задержку.
Многие передовые модели работают в облаке.
У робота не всегда есть время ждать облачного цикла.
Окно для принятия решения может составлять миллисекунды.
Десятки или сотни миллисекунд.
Сеть также может быть:
- перегружена;
- недоступна;
- ненадёжна;
- слишком дорога;
- ограничена требованиями конфиденциальности или безопасности.
Вот почему ACE Robotics делает акцент на производительности на периферии модели Kairos 3.1.
Модель с несколько меньшими возможностями, но отвечающая в пределах временных ограничений управления, может быть полезнее, чем более сильная модель, прибывающая после окна действия.
Для развёртывания интеллект должен быть:
- достаточно дешёвым;
- достаточно быстрым;
- достаточно надёжным;
- достаточно локализованным;
- достаточно предсказуемым.
Отсюда вытекает полезное различие:
Демонстрация показывает потолок возможностей, развёртывание раскрывает пол.
Что окажется правильным через два года?
Заключительная часть обсуждения пригласила выступающих представить, что они оглядываются назад из 2028 года.
Какие инвестиции, сделанные в 2026 году, окажутся верными?
Какие могут показаться вводящими в заблуждение?
Ответы снова показали, что каждая команда считает долговечным.
Возможности модели и видимый вывод модели
Шэнь Юйцзюнь разграничил два понятия:
Фундаментальные способности
Примеры включают:
- эффективность обобщения;
- интерактивность;
- качество представления;
- обусловленность действий;
- эффективность данных;
- причинно-следственная согласованность.
Видимый вывод
Примеры включают:
- визуально впечатляющие сгенерированные видео;
- отточенные демонстрации;
- единичные успешные долгосрочные задачи;
- высокое эстетическое качество.
Модель может прогрессировать в фундаментальных способностях, но не давать сразу самые впечатляющие демонстрации.
И наоборот, система может быть сильно оптимизирована для видимого вывода без улучшения способностей, необходимых для общего физического интеллекта.
Это одна из причин, почему отрасли нужны более качественные оценки.
Инфраструктура данных может сохранить ценность
Шэнь также считает, что работа, вложенная в конвейеры данных, вероятно, останется полезной.
Даже если архитектуры изменятся, воплощённый интеллект всё равно будет нуждаться в:
- реальных траекториях;
- тактильных данных;
- примерах сбоев;
- ручных корректировках;
- действиях роботов;
- синхронизации датчиков;
- симуляционных данных;
- фильтрации качества;
- наборах данных для оценки.
Неопределённость не в том, важны ли данные.
А в том, будут ли данные, собранные сегодня, по-прежнему соответствовать представлениям и методам обучения, используемым в будущих моделях.
Наборы данных могут стать менее полезными, когда:
- конфигурации датчиков меняются;
- пространство действий изменяется;
- метки кодируют устаревшие предположения;
- данные лишены необходимых модальностей;
- стратегия сбора слишком узкая;
- новые модели требуют другого временного разрешения.
Таким образом, создание гибких конвейеров данных может быть более долговечным, чем оптимизация фиксированного набора данных.
Не вмешивайтесь в фундаментальные модели слишком рано
Чжу Чжэн предупредил, что отрасль может слишком рано начать исследовать множество коммерческих сценариев ещё до того, как сама фундаментальная модель стабилизируется.
Это знакомая дилемма стартапов.
Коммерческое развёртывание даёт:
- доход;
- данные;
- обратную связь от клиентов;
- реальные ограничения.
Но оно также может отвлекать команду модели на:
- одноразовые интеграции;
- настраиваемые рабочие процессы;
- специфические правила клиентов;
- аппаратную адаптацию;
- поддержку и обслуживание.
Если базовая архитектура всё ещё быстро меняется, преждевременная
специализация может замедлить фундаментальные исследования.
Баланс между исследованиями модели и коммерческим развёртыванием варьируется от компании к компании.
Универсального ответа нет.
Воплощённо-нативные архитектуры могут возобладать
Жэнь Гуанхуэй предсказал, что модели мира будут всё больше становиться воплощённо-нативными.
Это означает, что модель разрабатывается с нуля вокруг физического взаимодействия, а не адаптируется позднее из задач генерации интернет-видео или изображений.
Воплощённо-нативное обучение может включать:
- действия робота;
- проприоцепцию;
- силу;
- тактильные данные;
- видео от первого лица;
- наблюдения с нескольких точек;
- трёхмерное состояние;
- обратную связь от инструментов;
- данные вмешательств;
- успех и неудачу задач.
Сама архитектура также может быть спроектирована вокруг контура управления.
Ключевой вопрос заключается в том, представляет ли модель переменные, необходимые роботу для выполнения действий, а не в том, похожа ли её внутренняя структура на генеративные модели медиа.
Именно разногласия открывают наибольшие возможности
Дискуссия не завершилась принятием единой архитектуры, устраивающей всех.
Возможно, это указывает на то, что область находится на ранней стадии развития, а не в тупике.
Остаётся множество важных нерешённых вопросов:
| Вопрос | Различные точки зрения |
|---|---|
| Что должна предсказывать модель? | Пиксели, скрытые состояния, явную геометрию или гибридный подход |
| Насколько высокой должна быть физическая точность? | Точная оценка состояния против правдоподобия, достаточного для действий |
| Как далеко должно простираться прогнозирование? | Согласованность на длинных горизонтах против низкой задержки в коротких циклах управления |
| Что объединит эту область? | Представления, архитектуры, тактильные данные или бенчмарки |
| Где должны выполняться вычисления? | В облаке, на периферии или в гибридном развёртывании |
| Каков истинный показатель успеха? | Качество симуляции, физические предсказания, улучшение стратегий или реальный успех выполнения задач |
| Какие данные наиболее важны? | Видео, траектории роботов, силы, тактильные данные, симуляция или их комбинация |
В зрелых областях архитектуры, как правило, сближаются.
В новых же областях разногласия как раз и указывают на самые серьёзные нерешённые задачи.
Если команда сможет доказать верность одного из спорных предположений, у неё есть шанс получить технологическое преимущество до того, как отрасль придёт к консенсусу.
Практическая структура для оценки моделей мира роботов
Для разработчиков и робототехнических команд эта дискуссия может быть преобразована в более конкретный контрольный список.
- Цель прогнозирования
Чётко определите, что предсказывает модель:
- Пиксели.
- Скрытые состояния.
- Геометрию.
- Действия.
- Силы.
- Будущие наблюдения.
- Комбинацию вышеперечисленного.
Выходные данные должны соответствовать задаче нижнего уровня управления.
- Горизонт прогнозирования
Оценивайте производительность на следующих уровнях:
- Следующий шаг.
- Короткий цикл.
- Цикл в несколько секунд.
- Длинный горизонт задачи.
Не оценивайте модель только на том горизонте, где она показывает наилучшие результаты.
- Задержка
Измеряйте фактическое время вывода на целевом оборудовании.
Модели, не удовлетворяющие требованиям времени управления, не должны получать высокие оценки за точность предсказаний.
- Физическая правдоподобность
Тесты должны включать:
- Столкновения.
- Контакты.
- Баланс.
- Деформации.
- Действия, чувствительные к трению.
- Постоянство объектов.
- Согласованность с разных точек зрения.
- Улучшение стратегии
Самый практичный вопрос, возможно, таков:
Повышает ли добавление модели мира реальный уровень успешности выполнения задач?
Сравните производительность стратегии нижнего уровня с моделью мира и без неё — стратегии, включающие и не включающие компонент модели мира.
- Способность к обобщению
Тестируйте на новых:
- Объектах
- Компоновках
- Корпусах роботов
- Освещении
- Материалах
- Поведении человека
- Комбинациях задач
- Способность к восстановлению
Измеряйте, что происходит после первой ошибки.
Развёрнутая система должна обнаруживать сбои, обновлять своё состояние и пытаться действовать иначе.
- Поведение на периферии и в облаке
Тестируйте как в нормальных, так и в ухудшенных условиях сети.
Когда удалённые вычисления недоступны, робот должен безопасно выходить из строя.
- Частота вмешательств
Отслеживайте запросы помощи от человека в расчёте на:
- Час
- Задачу
- 100 действий
- 1000 действий
Этот показатель часто лучше, чем единичный коэффициент успешности, для оценки качества развёртывания.
- Стоимость каждой успешной задачи
Включает:
- Вывод модели
- Оборудование
- Сеть
- Вмешательство человека
- Переделки
- Обслуживание
- Энергопотребление
- Простои
Лучшая модель мира — это не обязательно та, что набрала наибольший балл в бенчмарке.
А та, которая позволяет работать лучше всей робототехнической системе в целом.
Часто задаваемые вопросы
Что такое модель мира в воплощённом ИИ?
Модель мира — это модель, способная представлять или предсказывать, как окружающая среда изменяется во времени, под действием действий робота или других событий. В робототехнике она может использоваться для планирования, симуляции, выбора действий, генерации данных для обучения или улучшения стратегий.
Какие основные подходы к моделям мира обсуждались на WAIC 2026?
Дискуссия охватывала широкий спектр: генерацию в пространстве пикселей, прогнозирование в скрытом пространстве (например, подходы в стиле JEPA), а также гибридные или унифицированные системы, сочетающие прогнозирование мира с VLA-управлением, 3D-выводом или другими представлениями. Эти категории пересекались, поскольку многие компании использовали комбинации методов.
Должна ли модель мира робота быть точным физическим симулятором?
Необязательно. Некоторые исследователи выступают за точное прогнозирование геометрии, движений и сил, в то время как другие отдают приоритет физическим оценкам, достаточным для выбора правильного действия. Необходимая точность зависит от задачи и цены ошибки.
Почему долгосрочная согласованность является спорной?
Развёртывание длинных последовательностей полезно для симуляции и долгосрочного планирования, но увеличивает стоимость вычислений и может замедлить управление в реальном времени. Физическому роботу может потребоваться краткосрочное, быстрое прогнозирование для немедленных действий, с использованием другого механизма для долгосрочного планирования.
Что такое PHYSICAL IQ?
PHYSICAL IQ — это инициатива по созданию бенчмарка для воплощённого физического интеллекта, запущенная на WAIC
2026. Она направлена на предоставление общего протокола оценки для различных корпусов роботов, сценариев и задач.
PHYSICAL IQ и Google DeepMind Physics-IQ — это одно и то же?
Нет. Это разные проекты. PHYSICAL IQ — это платформа оценки для воплощённых роботов, представленная на WAIC 2026, в то время как Physics-IQ — это исследовательский бенчмарк для проверки того, понимают ли генеративные видеомодели законы физики.
Почему тактильное восприятие важно для моделей мира?
Зрение не может полностью раскрыть контактные силы, проскальзывание, давление, податливость и некоторые свойства материалов. Тактильные и силовые сигналы предоставляют роботу прямую информацию о физическом взаимодействии и могут стать всё более важными для моделей мира, ориентированных на манипуляции.
Что важнее одного хорошего показательного запуска робота?
Развёртывание и надёжность. Командам необходимо измерять реальный уровень успешности выполнения задач, задержку, частоту вмешательств, восстановление после неожиданных событий, безопасность, стоимость и производительность в множестве сред, а не только на отдельных подобранных демонстрациях.
Соответствующие инструменты
- Kairos 3.1 на Hugging Face: Публичная коллекция ACE Robotics для их работы над ориентированными на действия воплощёнными моделями мира.
- LingBot-World: Интерактивный симулятор мира с открытым исходным кодом от Robbyant, включающий код, модели и техническую документацию.
- Цифровой мир AgiBot: Официальный симуляционный фреймворк AgiBot для генерации данных, обучения и оценки воплощённых моделей.
- GigaAI: Официальный сайт GigaWorld, GigaBrain и платформы воплощённого ИИ этой компании.
- X квадрат робот: Официальный сайт, описывающий семейство воплощённых фундаментальных моделей WALL и интеграцию модели мира/VLA.
- Physics-IQ: Независимый исследовательский бенчмарк для оценки понимания физики в генеративных видеомоделях.
- NVIDIA Isaac Sim: Платформа симуляции роботов для генерации синтетических данных и тестирования робототехнических систем.
Соответствующие ссылки
- Коллекция ACE Robotics Kairos 3.1: Общедоступные ресурсы моделей для Kairos 3.1 и связанных воплощённых систем.
- Объявление ACE Robotics на WAIC 2026: Пресс-релиз компании, освещающий Kairos 3.1 и инициативу PHYSICAL IQ.
- [Объявление о модели мира Ant Group Ling](https://www.
(antgroup.com/en/news-media/press-releases/1777280400000): Официальное заявление Ant Group об интеграции LingBot-World-Fast в Lingguang.
- Репозиторий LingBot-World на GitHub: Открытый исходный код, инструкции по установке, веса и ссылки на статьи от Robbyant.
- Цифровой мир AgiBot: Официальное описание фреймворка симуляции и воплощённых данных AgiBot.
- AgiBot EVAC и EWMBench: Официальная работа AgiBot по условным от действий мировым моделям и их оценке.
- Роботы X²: Официальная информация о семействе моделей WALL и сквозном воплощённом интеллекте.
Итоги
Круглый стол по мировым моделям WAIC 2026 показал, что в области воплощённого интеллекта до сих пор нет единого мнения об определении, представлении или архитектуре мировых моделей. Основные расхождения касаются физической точности, прогностического горизонта, способов репрезентации, тактильного восприятия, а также взаимосвязи между моделированием мира и действиями.
Наиболее сильный консенсус наблюдается на поздних этапах технологического стека. Мировые модели в конечном счёте должны сделать реальных роботов более надёжными: повысить успешность выполнения задач, сократить вмешательство, ускорить принятие решений, обеспечить более безопасное восстановление и снизить затраты на развёртывание.
PHYSICAL IQ нацелен на создание единого оценочного уровня, и до этого момента
Архитектуры сами по себе склонны к конвергенции. Будет ли этот бенчмарк широко принят, ещё предстоит выяснить, однако потребность в сопоставимых методах измерения физического интеллекта очевидна.
Текущие разногласия в данной области — не слабость, а карта нерешённых проблем, которые, возможно, определят дальнейшее развитие воплощённого искусственного интеллекта следующего поколения.



