Мировая модель стала одним из наиболее активных направлений исследований в области воплощенного интеллекта, однако в этой области все еще от...

Мировая модель стала одним из самых активных направлений исследований в области воплощённого интеллекта, однако в этой сфере до сих пор отсутствует единое определение.
Исследователи расходятся во мнениях относительно того, что должна представлять мировая модель, насколько точным должно быть физическое моделирование, должны ли будущие состояния генерироваться в пиксельном или скрытом пространстве, сколько прогнозов должен делать робот перед действием, какие данные наиболее важны и даже как измерять прогресс в исследованиях.
Это отсутствие консенсуса особенно ярко проявилось на WAIC 2026.
19 июля форум, организованный шестью китайскими компаниями в области воплощённого интеллекта, собрал лидеров технологий, представляющих различные подходы к роботизированным мировым моделям:
Ценность этой дискуссии заключается именно в том, что выступающие не пришли к единому техническому решению.
Одни хотят, чтобы мировая модель всё точнее представляла геометрию, движение и механику. Других больше волнует, сможет ли модель предсказать достаточную физическую структуру для выбора успешного действия.
Одни считают, что долгосрочная согласованность имеет решающее значение. Другие утверждают, что это может оказаться контрпродуктивным, когда прогнозы отнимают слишком много времени на принятие решений роботом.
Одни ожидают, что сфера придёт к консенсусу вокруг какого-то общего представления. Другие считают, что гибридная архитектура, тактильное восприятие или стандартизированные бенчмарки станут отправной точкой для начала консенсуса.
За этими разногласиями стоит более практический вопрос:
Какими способностями должна обладать мировая модель, чтобы приносить реальную пользу за пределами демонстрационных сценариев?

Эти шесть компаний не использовали полностью идентичные архитектуры, но, основываясь на способе прогнозирования мира моделью, дискуссию можно обобщить в три основных технологических подхода.
| Подход | Репрезентативный метод | Основная концепция |
|---|---|---|
| Генерация в пиксельном пространстве | GigaAI | Прямое прогнозирование будущего визуального состояния или прогнозирование через генеративные визуальные представления |
| Прогнозирование в скрытом пространстве | Направление JEPA от Wujie Power | Прогнозирование компактного внутреннего представления, а не полных пикселей |
| Гибридная или унифицированная архитектура | ACE Robotics, Roboyant, X Square Robot, AgiBot | Сочетание генерации, прогнозирования в скрытом пространстве, явного пространственного рассуждения, VLA-управления или симуляционно-ориентированных моделей |
Хотя эта классификация имеет справочную ценность, её не следует рассматривать как постоянный стандарт для отрасли.
Некоторые из этих компаний уже сочетают несколько механизмов. Более важное разногласие заключается в том, какой должна быть полезная мировая модель, по мнению каждой команды.
Первое основное разногласие касается того, как мировая модель связана с физикой.
Ся Чжунпу считает, что оценка должна включать точность модели в прогнозировании геометрического состояния, траекторий движения, механических воздействий и связанных физических величин.
Эта точка зрения рассматривает мировую модель частично как структурированный предиктор физического состояния.
Для роботов, которым необходимо решать, как толкать, захватывать, поднимать, навигировать или манипулировать объектами, соответствующие вопросы могут включать:
Неявное представление может сделать явный физический регресс более привлекательным — потому что модели не нужно визуализировать каждый будущий пиксель перед оценкой этих величин.
Преимущество заключается в точности и контролируемости.
Сложность в том, что физический мир содержит переменные, которые трудно непосредственно наблюдать или выводить, такие как трение, скрытое распределение массы, податливость, состояние контакта и свойства материала.
Таким образом, модель может иметь физическую структурированность, не будучи полным симулятором.
Шэнь Юйцзюнь предложил другой критерий.
Роботу не обязательно воспроизводить каждый параметр физической системы, но нужно понимать различия, которые критически важны для выполнения предстоящего действия.
Например, когда два материала бросают, сжимают, тянут или захватывают, роботу может потребоваться распознать их различную реакцию, не оценивая заранее каждый коэффициент.
Это ближе к физическому пониманию, связанному с действием, а не к полной физической симуляции.
Разницу можно обобщить так:
Точная физическая симуляция:
Максимально точное прогнозирование детального состояния мира.
Физическое рассуждение, связанное с действием:
Прогнозирование состояния мира, достаточное для выбора безопасного и эффективного действия.
Вторая цель требует меньше вычислительных затрат и достаточна для многих реальных роботизированных задач.
Это также соответствует системному дизайну, происходящему из моделей генерации видео — такие модели естественным образом обучаются тому, какие будущие визуальные представления являются правдоподобными, даже если не раскрывают явно все потенциальные физические переменные.
Мнения экспертов указывают на более прагматичный критерий оценки:
Ошибка наиболее критична, когда она меняет решение робота.
Если робот может успешно поставить чашку, не оценивая точный коэффициент трения стола, отсутствие этого значения может быть неважно.
Но если отсутствие этого физического понимания приводит к падению чашки, то эта ошибка критична.
Таким образом, требуемая физическая точность зависит от:
Второе разногласие касается того, как далеко в будущее должна прогнозировать мировая модель.
AgiBot вложила значительные ресурсы в симуляцию и оценку на основе мировых моделей.
Их публичная платформа AgiBot Digital World предоставляет высокоточную симуляционную среду, автоматически сгенерированные экспертные траектории и инструменты оценки моделей.
Затем AgiBot выпустила фреймворк мировой модели EVAC и EWMBench, расширяя концепцию управляемой действиями генеративной симуляции.
Для мировой модели, используемой в качестве симулятора, долгосрочная согласованность имеет решающее значение.
Ценность симуляции значительно снижается, если:
Исходя из этого, мировая модель должна поддерживать согласованное состояние на значительном временном горизонте.
Ван Хао подверг сомнению предположение, что «более длинный прогноз всегда лучше».
X Square Robot следует подходу сквозной воплощённой модели, тесно связывая восприятие, рассуждение, моделирование мира и генерацию действий.
Их публичные материалы описывают серию WALL как шаг к унифицированной физической мировой модели, а не как изолированные системы прогнозирования и управления.
В таких системах мировая модель — это не просто симулятор; само прогнозирование является частью управляющего цикла.
Поэтому более длительное прогнозирование влечёт за собой следующие издержки:
Чем дальше прогнозируется будущее
→ Тем больше объём рассуждений
→ Тем выше задержка
→ Тем меньше времени на действие
Если среда, в которой находится робот, меняется быстрее, чем модель завершает рассуждение, идеально согласованный долгосрочный прогноз может быть практически бесполезен.
Для управления короткий прогноз, поступивший в нужное время, может быть гораздо ценнее, чем долгий прогноз, пришедший с опозданием.
Это указывает на то, что не существует единственного оптимального горизонта прогнозирования.
Симулятору склада может потребоваться прогнозирование длинных последовательностей.
Роботу, выполняющему задачу балансировки объекта, может потребоваться чрезвычайно быстрое краткосрочное прогнозирование.
Мобильному манипулятору, выполняющему многоэтапные задачи, может потребоваться и то, и другое:
Таким образом, разумный дизайн может включать несколько временных горизонтов, а не единую мировую модель полной длины.

Три гостя сидят на белых кожаных креслах. Участник в центре держит синий микрофон и выступает, участник справа сложил руки, участник слева держит руки естественно. Фон тёмный, сверху надпись «WAIC 2026 Всемирная конференция по искусственному интеллекту» и логотип «ACE». Данное изображение соответствует описанию форума по мировым моделям WAIC 2026 в документе, наглядно отображая обстановку на форуме.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/4c042a14-222f-479c-a285-6ffe08d2fb9e-c12217f2-9772-4644-9176-3c421bfb637a.jpeg)
Разногласия во взглядах, представленные на форуме, уже проявились в публичных технологических системах различных компаний.
На конференции WAIC 2026 компания «Эпохальный воплощённый интеллект» представила Kairos 3.1 — воплощённую мировую модель, ориентированную на действия.
В опубликованных материалах описывается гибридная архитектура Transformer, направленная на объединение:
Компания также сообщила о задержке вывода модели Kairos 3.1 с 8 миллиардами параметров на платформе NVIDIA, составившей 125 миллисекунд.
Jetson Thor использует точность BF16. Эта характеристика критически важна, поскольку компания позиционирует данную модель как периферийную систему для роботизированного поведения, а не просто как автономный генератор видео.
Открытая модель LingBot-World от Robbyant изначально развивалась в направлении генеративного видео. Её официальное описание в репозитории включает: высокоточную интерактивную среду, долговременную временную согласованность, управление в реальном времени, задержку взаимодействия менее секунды и возможность генерации в реальном времени со скоростью 16 кадров в секунду в версии Fast. Впоследствии Ant Group интегрировала LingBot-World-Fast в мобильный продукт «Лингуан», позволяя пользователям превращать одно изображение в генерируемый мир для исследования. Одновременно Robbyant расширил свою деятельность на исследования в области VLA и воплощённых моделей, став типичным примером команды, не ограничивающейся единой парадигмой мировой модели.
GigaAI позиционирует себя как компанию в области воплощённого интеллекта и универсальной робототехники, построенную на трёх уровнях: GigaWorld (платформа мировых моделей), GigaBrain (универсальная воплощённая интеллектуальная система) и Maker (воплощённый носитель робота). Работа компании над мировыми моделями подчёркивает ключевую роль генеративной физической среды в ускорении создания данных, обучения и тестирования. Когда мировая модель используется как визуально насыщенный симулятор, генерация в пиксельном пространстве становится особенно важной.
Публичная работа Zhiyuan Robot особенно наглядно демонстрирует сценарий использования симулятора. AgiBot Digital World объединяет 3D-активы, физическое моделирование, генерацию экспертных траекторий, рандомизацию доменов, создание данных и оценку моделей. Его последующий фреймворк EVAC способен генерировать будущие визуальные состояния на основе последовательностей действий робота. В таких приложениях временная согласованность и точное воспроизведение взаимодействия действия и среды имеют первостепенное значение.
Официальная история развития Xingdong Jiyuan показывает, что её архитектура WALL-A глубоко интегрирует модель VLA и мировую модель. Направление WALL-B 2026 года движется к тому, что компания называет унифицированной архитектурой мировой модели. Её техническая цель — избежать конвейерного процесса, при котором мировая модель независимо прогнозирует, а затем отдельная политика преобразует прогнозы в действия, объединяя процессы прогнозирования и управления в единую сквозную систему.
Публичные материалы Wujie Dongli показывают, что компания создаёт «универсальный мозг» для роботов и воплощённую нативную мультимодальную фундаментальную модельную систему на основе мировой модели. Ся Чжунпу присоединился к компании в марте 2026 года, ранее руководя работой по сквозному автономному вождению в Li Auto. Направление исследований компании подчёркивает прогнозирование в латентном пространстве, физические величины и мышление в стиле JEPA. Поскольку подробная открытая техническая документация по текущей мировой модели всё ещё ограничена, утверждения о её точной архитектуре следует рассматривать как техническое направление, описанное руководством компании, а не как полностью документированную открытую модель.
Что, скорее всего, будет согласовано в первую очередь?
Следующий вопрос заключается не в том, какая архитектура в итоге победит.
А в том:
Какая часть этой области будет согласована первой?
Ответы сильно различаются.
Жэнь Гуанхуэй и Ся Чжунпу оба подчеркнули важность представления.
Большие языковые модели в конечном итоге сошлись на токенизированном последовательном представлении, что позволило различным задачам быть совместимыми с одной архитектурой.
Воплощённому интеллекту всё ещё не хватает столь же универсального базового элемента.
Работа роботов включает:
Если эти модальности изолированы друг от друга, каждой системе требуется строить сложные мосты между ними.
Унифицированное представление позволило бы модели рассуждать о восприятии, состоянии, прогнозировании и действиях в одном и том же общем пространстве.
Проблема в том, что физические сигналы по своей природе невзаимозаменяемы.
Тактильный импульс, кадр с камеры, команда захвата — они работают на разных скоростях и несут различную информацию.
Следовательно, «токен робота» может быть гораздо сложнее определить, чем текстовый токен.
Ван Хао прогнозирует слияние архитектур.
С этой точки зрения, различные подходы к мировым моделям решают лишь часть проблемы:
Конечная архитектура, вероятно, объединит эти механизмы, а не выберет один и отвергнет другие.
Такая модель распространена в области ИИ.
Изначально конкурирующие технологии, после выявления их сильных и слабых сторон, часто становятся частью более крупных систем.
Шэнь Юйцзюнь считает, что тактильная информация может стать одной из первых областей, где отрасль достигнет консенсуса.
В настоящее время большинство крупных мировых моделей обучаются в основном на визуальных и языковых данных.
Роботы манипулируют объектами через контакт.
Им необходимо обнаруживать:
Для задач манипуляции именно в моменты, когда тактильные ощущения наиболее полезны, зрение может быть неоднозначным.
Это является веским аргументом в пользу того, чтобы тактильное восприятие было нативной модальностью, а не опциональным датчиком, добавляемым после обучения модели.
Исследовательское направление Robbyant также отражает широкий переход от моделей, основанных на цифровом видео, к моделям, разработанным вокруг воплощённого управления.
Важное различие заключается в следующем:
Цель видеомодели — генерировать правдоподобное будущее.
Цель воплощённой мировой модели — поддерживать успешные действия.
Эти две цели пересекаются, но не совпадают.
Тао Дачэн дал другой ответ: конвергенция может сначала произойти в области оценки, а не архитектуры.
Для этого есть исторический прецедент.
Компьютерное зрение не сошлось потому, что исследователи заранее договорились о каком-то одном представлении. Общие наборы данных и бенчмарки, такие как ImageNet, предоставили конкурирующим системам общую цель для измерения. Как только все системы стали оцениваться по одной шкале, слабые идеи исчезли быстрее, а полезные идеи смогли распространяться через границы архитектур. Именно эта логика лежит в основе запуска на форуме Физического IQ.
Физический IQ был представлен на Всемирной конференции по искусственному интеллекту 2026 года как унифицированный бенчмарк для воплощённого физического интеллекта. Согласно опубликованной информации, данная инициатива была совместно запущена:
В ней участвуют более 20 университетов и отраслевых организаций. Платформа предназначена для сравнения различных систем по следующим направлениям:
![Изображение демонстрирует сцену круглого стола форума «Шесть маленьких драконов» мировых моделей 2026 года. На изображении семь участников, шестеро из которых стоят, а один сидит слева. Фон тёмный, сверху логотип «WAIC 2026 Всемирная конференция по искусственному интеллекту» и надпись «ACE». Участники одеты в различные стили одежды, некоторые носят бейджи. В левом верхнем углу надпись: «Круглый стол «Шести маленьких драконов» мировых моделей — продвижение физического ИИ от «понимания» к «исполнению».]
Это изображение связано с содержанием обсуждения за круглым столом «Шести драконов», представленного в документе, и наглядно показывает участников дискуссии.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/c242a920-2b42-4966-92ce-2e70518c2ac6-7fb4c60a-1a46-46c3-9743-2b5a5a5a322e.jpeg)
Полезный бенчмарк физического интеллекта не может полагаться только на то, насколько реалистично выглядит сгенерированное видео. Он должен задавать следующие вопросы:
Конкретные методы оценки физического интеллекта требуют постоянной открытой документации и широкого внедрения, чтобы стать настоящим отраслевым стандартом. Тем не менее, это направление решает реальные проблемы. Текущие заявления о моделях мира трудно сравнивать, потому что одна компания может сообщать о качестве видео, другая — о проценте успешности задач, третья — об ошибках физического состояния, а четвёртая — о согласованности симулятора. Без единой шкалы каждая система может демонстрировать наилучшие результаты по специально разработанным для неё метрикам.
Обсуждение физического интеллекта также отражает более широкие исследовательские вопросы в области генеративного видео. Исследователи Google DeepMind ввели независимый бенчмарк под названием физический интеллект для оценки того, действительно ли видеомодели понимают физические принципы. Исследование показало, что визуальное правдоподобие и физическая корректность могут расходиться. Сгенерированное видео может выглядеть убедительно, но при этом нарушать:
Это различие критически важно для роботизированных моделей мира. Прогноз будущего полезен только в том случае, если он, будучи визуально достоверным, сохраняет свойства, необходимые для действий. В то же время роботу не нужно решать весь учебник физики перед действием. Практический стандарт находится между двумя крайностями.
Недостаточно:
Выглядит реалистично, но предсказывает неправильный результат.
Возможно, избыточно:
Вычисляет каждую физическую переменную, даже если это не нужно для действия.
Полезное предсказание улавливает физические различия, изменяющие решения робота.
Эта промежуточная зона и является текущей точкой расхождения в исследованиях.
Несмотря на разногласия в архитектурах моделей, когда обсуждение переходит от моделей к физическим роботам, мнения экспертов становятся более согласованными.
Конечный критерий прост:
Может ли робот надёжно выполнять задачи в физическом мире?
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Разные выступающие описывали это разными словами.
Терминология разная, но операционный вопрос един.
Модель мира имеет смысл только если она улучшает фактическое поведение робота.
Демонстрации можно оптимизировать почти бесконечно.
Команда может:
Развёртывание устраняет эти защитные меры.
Супермаркеты, отели, склады или дома ежедневно сталкиваются с непредсказуемыми событиями.
Ван Хао описал кривую затрат как сильно нелинейную.
Переход системы от:
90% → 99%
не обязательно равен по усилиям:
99% → 99.9%
Оставшиеся сбои часто относятся к трудным длиннохвостовым случаям.
1% отказов в лаборатории звучит незначительно.
Если робот выполняет 10 000 действий в день, 1% означает 100 сбоев.
Даже при 99.9% надёжности, при достаточном объёме задач всё равно будут частые ручные вмешательства.
Бизнес-последствия включают:
Вот почему развёртывание меняет значение качества модели.
Шэнь Юйцзюнь привёл пример из розничной торговли.
Роботу может потребоваться найти упаковку овощей.
Товар обычно хранится в одном месте, но покупатель мог взять его и положить в другой холодильник.
С точки зрения тщательно подготовленного набора данных это выглядит как аномалия.
Но с точки зрения робота, обслуживающего тысячи покупателей, аномалия становится нормой.
Поэтому модель мира должна обрабатывать:
Вот почему способность к обобщению важнее, чем воспроизведение заученных демонстраций.
Тао Дачэн подчеркнул ещё одно практическое ограничение: задержку.
Многие передовые модели работают в облаке.
У робота не всегда есть время ждать облачного цикла.
Окно для принятия решения может составлять миллисекунды.
Десятки или сотни миллисекунд.
Сеть также может быть:
Вот почему ACE Robotics делает акцент на производительности на периферии модели Kairos 3.1.
Модель с несколько меньшими возможностями, но отвечающая в пределах временных ограничений управления, может быть полезнее, чем более сильная модель, прибывающая после окна действия.
Для развёртывания интеллект должен быть:
Отсюда вытекает полезное различие:
Демонстрация показывает потолок возможностей, развёртывание раскрывает пол.
Заключительная часть обсуждения пригласила выступающих представить, что они оглядываются назад из 2028 года.
Какие инвестиции, сделанные в 2026 году, окажутся верными?
Какие могут показаться вводящими в заблуждение?
Ответы снова показали, что каждая команда считает долговечным.
Шэнь Юйцзюнь разграничил два понятия:
Примеры включают:
Примеры включают:
Модель может прогрессировать в фундаментальных способностях, но не давать сразу самые впечатляющие демонстрации.
И наоборот, система может быть сильно оптимизирована для видимого вывода без улучшения способностей, необходимых для общего физического интеллекта.
Это одна из причин, почему отрасли нужны более качественные оценки.
Шэнь также считает, что работа, вложенная в конвейеры данных, вероятно, останется полезной.
Даже если архитектуры изменятся, воплощённый интеллект всё равно будет нуждаться в:
Неопределённость не в том, важны ли данные.
А в том, будут ли данные, собранные сегодня, по-прежнему соответствовать представлениям и методам обучения, используемым в будущих моделях.
Наборы данных могут стать менее полезными, когда:
Таким образом, создание гибких конвейеров данных может быть более долговечным, чем оптимизация фиксированного набора данных.
Чжу Чжэн предупредил, что отрасль может слишком рано начать исследовать множество коммерческих сценариев ещё до того, как сама фундаментальная модель стабилизируется.
Это знакомая дилемма стартапов.
Коммерческое развёртывание даёт:
Но оно также может отвлекать команду модели на:
Если базовая архитектура всё ещё быстро меняется, преждевременная
специализация может замедлить фундаментальные исследования.
Баланс между исследованиями модели и коммерческим развёртыванием варьируется от компании к компании.
Универсального ответа нет.
Жэнь Гуанхуэй предсказал, что модели мира будут всё больше становиться воплощённо-нативными.
Это означает, что модель разрабатывается с нуля вокруг физического взаимодействия, а не адаптируется позднее из задач генерации интернет-видео или изображений.
Воплощённо-нативное обучение может включать:
Сама архитектура также может быть спроектирована вокруг контура управления.
Ключевой вопрос заключается в том, представляет ли модель переменные, необходимые роботу для выполнения действий, а не в том, похожа ли её внутренняя структура на генеративные модели медиа.
Дискуссия не завершилась принятием единой архитектуры, устраивающей всех.
Возможно, это указывает на то, что область находится на ранней стадии развития, а не в тупике.
Остаётся множество важных нерешённых вопросов:
| Вопрос | Различные точки зрения |
|---|---|
| Что должна предсказывать модель? | Пиксели, скрытые состояния, явную геометрию или гибридный подход |
| Насколько высокой должна быть физическая точность? | Точная оценка состояния против правдоподобия, достаточного для действий |
| Как далеко должно простираться прогнозирование? | Согласованность на длинных горизонтах против низкой задержки в коротких циклах управления |
| Что объединит эту область? | Представления, архитектуры, тактильные данные или бенчмарки |
| Где должны выполняться вычисления? | В облаке, на периферии или в гибридном развёртывании |
| Каков истинный показатель успеха? | Качество симуляции, физические предсказания, улучшение стратегий или реальный успех выполнения задач |
| Какие данные наиболее важны? | Видео, траектории роботов, силы, тактильные данные, симуляция или их комбинация |
В зрелых областях архитектуры, как правило, сближаются.
В новых же областях разногласия как раз и указывают на самые серьёзные нерешённые задачи.
Если команда сможет доказать верность одного из спорных предположений, у неё есть шанс получить технологическое преимущество до того, как отрасль придёт к консенсусу.
Для разработчиков и робототехнических команд эта дискуссия может быть преобразована в более конкретный контрольный список.
Чётко определите, что предсказывает модель:
Выходные данные должны соответствовать задаче нижнего уровня управления.
Оценивайте производительность на следующих уровнях:
Не оценивайте модель только на том горизонте, где она показывает наилучшие результаты.
Измеряйте фактическое время вывода на целевом оборудовании.
Модели, не удовлетворяющие требованиям времени управления, не должны получать высокие оценки за точность предсказаний.
Тесты должны включать:
Самый практичный вопрос, возможно, таков:
Повышает ли добавление модели мира реальный уровень успешности выполнения задач?
Сравните производительность стратегии нижнего уровня с моделью мира и без неё — стратегии, включающие и не включающие компонент модели мира.
Тестируйте на новых:
Измеряйте, что происходит после первой ошибки.
Развёрнутая система должна обнаруживать сбои, обновлять своё состояние и пытаться действовать иначе.
Тестируйте как в нормальных, так и в ухудшенных условиях сети.
Когда удалённые вычисления недоступны, робот должен безопасно выходить из строя.
Отслеживайте запросы помощи от человека в расчёте на:
Этот показатель часто лучше, чем единичный коэффициент успешности, для оценки качества развёртывания.
Включает:
Лучшая модель мира — это не обязательно та, что набрала наибольший балл в бенчмарке.
А та, которая позволяет работать лучше всей робототехнической системе в целом.
Модель мира — это модель, способная представлять или предсказывать, как окружающая среда изменяется во времени, под действием действий робота или других событий. В робототехнике она может использоваться для планирования, симуляции, выбора действий, генерации данных для обучения или улучшения стратегий.
Дискуссия охватывала широкий спектр: генерацию в пространстве пикселей, прогнозирование в скрытом пространстве (например, подходы в стиле JEPA), а также гибридные или унифицированные системы, сочетающие прогнозирование мира с VLA-управлением, 3D-выводом или другими представлениями. Эти категории пересекались, поскольку многие компании использовали комбинации методов.
Необязательно. Некоторые исследователи выступают за точное прогнозирование геометрии, движений и сил, в то время как другие отдают приоритет физическим оценкам, достаточным для выбора правильного действия. Необходимая точность зависит от задачи и цены ошибки.
Развёртывание длинных последовательностей полезно для симуляции и долгосрочного планирования, но увеличивает стоимость вычислений и может замедлить управление в реальном времени. Физическому роботу может потребоваться краткосрочное, быстрое прогнозирование для немедленных действий, с использованием другого механизма для долгосрочного планирования.
PHYSICAL IQ — это инициатива по созданию бенчмарка для воплощённого физического интеллекта, запущенная на WAIC 2026. Она направлена на предоставление общего протокола оценки для различных корпусов роботов, сценариев и задач.
Нет. Это разные проекты. PHYSICAL IQ — это платформа оценки для воплощённых роботов, представленная на WAIC 2026, в то время как Physics-IQ — это исследовательский бенчмарк для проверки того, понимают ли генеративные видеомодели законы физики.
Зрение не может полностью раскрыть контактные силы, проскальзывание, давление, податливость и некоторые свойства материалов. Тактильные и силовые сигналы предоставляют роботу прямую информацию о физическом взаимодействии и могут стать всё более важными для моделей мира, ориентированных на манипуляции.
Развёртывание и надёжность. Командам необходимо измерять реальный уровень успешности выполнения задач, задержку, частоту вмешательств, восстановление после неожиданных событий, безопасность, стоимость и производительность в множестве сред, а не только на отдельных подобранных демонстрациях.
(antgroup.com/en/news-media/press-releases/1777280400000): Официальное заявление Ant Group об интеграции LingBot-World-Fast в Lingguang.
Круглый стол по мировым моделям WAIC 2026 показал, что в области воплощённого интеллекта до сих пор нет единого мнения об определении, представлении или архитектуре мировых моделей. Основные расхождения касаются физической точности, прогностического горизонта, способов репрезентации, тактильного восприятия, а также взаимосвязи между моделированием мира и действиями.
Наиболее сильный консенсус наблюдается на поздних этапах технологического стека. Мировые модели в конечном счёте должны сделать реальных роботов более надёжными: повысить успешность выполнения задач, сократить вмешательство, ускорить принятие решений, обеспечить более безопасное восстановление и снизить затраты на развёртывание.
PHYSICAL IQ нацелен на создание единого оценочного уровня, и до этого момента
Архитектуры сами по себе склонны к конвергенции. Будет ли этот бенчмарк широко принят, ещё предстоит выяснить, однако потребность в сопоставимых методах измерения физического интеллекта очевидна.
Текущие разногласия в данной области — не слабость, а карта нерешённых проблем, которые, возможно, определят дальнейшее развитие воплощённого искусственного интеллекта следующего поколения.
Начните с одной фразы и получите полноценный сайт за считанные минуты.