はじめに
世界モデルは、身体知能分野において最も活発な研究領域の一つとなっているが、今なお統一された定義は存在しない。
研究者たちは、世界モデルが何を表象すべきか、物理モデリングをどの程度の精度で行うべきか、将来の状態をピクセル空間で生成すべきか潜在空間で生成すべきか、ロボットが行動前にどの程度の予測を行うべきか、どのデータモダリティが最も重要か、さらには研究の進捗をどのように測定するかといった点で意見が分かれている。
このような共通認識の欠如は、WAIC 2026で特に顕著に現れた。
7月19日、6社の中国身体知能企業が主催したフォーラムには、異なるロボット世界モデルの技術ロードマップを代表する技術リーダーたちが集結した。
- 司会:海大程(ACE Robotics チーフサイエンティスト)
- 沈学軍(Ant Group Roboyant チーム チーフサイエンティスト)
- 朱政(GigaAI 共同創業者兼チーフサイエンティスト)
- 夏仲普(無界動力 共同創業者兼共同CTO)
- 任光輝(AgiBot AIアルゴリズムディレクター)
- 王浩(X Square Robot 共同創業者兼CTO)
この議論の価値は、まさに発表者たちが単一の技術的解決策に合意しなかったことにある。
ある者は、世界モデルが幾何学、運動、力学をますます正確に表象できるようになることを望んでいる。別の者は、モデルが成功する動作を選択するために十分な物理構造を予測できるかどうかにより関心を持っている。
ある者は、長期的な時間的一貫性が極めて重要だと考える。別の者は、予測がロボットの意思決定ウィンドウを過度に消費する場合、逆効果になると主張する。
ある者は、この分野が何らかの共有表象を中心に共通認識に達するだろうと予想する。別の者は、ハイブリッドアーキテクチャ、触覚センシング、または標準化されたベンチマークが先に共通認識の出発点となると考える。
これらの相違の背景には、より現実的な問題がある:
世界モデルは、デモンストレーションシナリオを超えて実用的な価値を発揮するために、どのような能力を備える必要があるのか?

三つの技術ロードマップ
これら6社は完全に同一のアーキテクチャを採用しているわけではないが、モデルが世界を予測する方法に基づいて、ラウンドテーブルディスカッションはおおむね三つの技術ロードマップに分類できる。
| ロードマップ | 代表的手法 | 核心理念 |
|---|---|---|
| ピクセル空間生成 | GigaAI | 将来の視覚状態を直接予測、または生成的視覚表象を通じて予測 |
| 潜在空間予測 | 無界動力のJEPA方向 | 完全なピクセルではなく、コンパクトな内部表象を予測 |
| ハイブリッドまたは統合アーキテクチャ | ACE Robotics、Roboyant、X Square Robot、AgiBot | 生成、潜在空間予測、明示的空間推論、VLA制御、またはシミュレーション指向モデルを組み合わせる |
この分類は参考にはなるが、永続的な業界区分基準とみなすべきではない。
そのうちの数社はすでに複数のメカニズムを融合している。より重要な相違点は、各チームが有用な世界モデルにとって何が必須であると考えるかにある。
どの能力が最も重要か?
最初の主要な相違点は、世界モデルと物理学の関連付け方にある。
見解一:物理状態の予測は正確であるべき
夏仲璞は、評価には幾何学的状態、運動軌跡、力学的相互作用、および関連する物理量の予測におけるモデルの正確性が含まれるべきだと考える。
この見解は、世界モデルを部分的に物理状態の構造化予測器として捉えている。
押す、掴む、持ち上げる、ナビゲートする、または物体を操作する方法を決定する必要があるロボットにとって、関連する疑問には以下が含まれる可能性がある:
- 物体はどこに移動するのか?
- 他の物体と衝突するか?
- その向きはどう変化するか?
- どれだけの力を加える必要があるか?
- 掴みは安定を保てるか?
- 動作完了後の環境はどのような状態か?
潜在的表象は、明示的な物理回帰をより魅力的にする——モデルがこれらの量を推定する前にすべての将来ピクセルをレンダリングする必要がないからである。
その利点は、正確性と制御可能性にある。
难点は、物理世界には摩擦力、隠れた質量分布、柔軟性、接触状態、材料特性など、直接観測または推論が難しい変数が含まれることである。
したがって、モデルは完全なシミュレーターになることなく、物理的に構造化された特性を持つことができる。
見解二:物理的な妥当性は正確な物理よりも重要かもしれない
沈宇軍は異なる基準を提示した。
ロボットは物理システムのすべてのパラメータを再現する必要は必ずしもないが、実行しようとする動作にとって重要な差異を理解する必要がある。
例えば、2つの材料が投げ落とされたり、圧縮されたり、引きずられたり、掴まれたりした場合、ロボットはそれぞれの係数を事前に推定することなく、異なる応答を認識する必要があるかもしれない。
これは完全な物理シミュレーションというよりも、動作関連の物理理解に近い。
両者の違いは次のように要約できる:
正確な物理シミュレーション:
世界の詳細な状態を可能な限り正確に予測する。
動作関連の物理推論:
安全かつ効果的な動作を選択するために十分な世界の状態を予測する。
2つ目の目標は計算コストが低く、多くの現実のロボットタスクにとって十分である。
これはまた、ビデオ生成モデルに由来するシステム設計思想とも一致する——これらのモデルは、すべての潜在的な物理変数を明示的に明らかにしなくても、どの将来の視覚表現が妥当であるかを自然に学習する。
核心問題:どのような誤差が動作を変えるのか?
専門家パネルの意見の相違は、より実用的な評価基準を指し示している:
予測誤差がロボットの意思決定を変えるとき、その誤差が最も重要である。
ロボットが机の正確な摩擦係数を推定することなくカップを正常に置くことができるのであれば、その数値の欠如は重要ではないかもしれない。
しかし、その物理的理解の欠如がカップを滑り落とす原因となる場合、この誤差は極めて重要である。
したがって、必要な物理的忠実度は以下に依存する:
- 具体的なタスク
- 安全マージン
- ロボットのハードウェア設計
- 動作の時間スパン
- 失敗のコスト
- 推論に利用可能な時間
長期的な一貫性か、それとも迅速な意思決定か?
2つ目の相違点は、世界モデルがどの程度未来を予測すべきかを中心としている。
智元ロボット:
長期的な物理的一貫性が極めて重要
智元ロボットは、シミュレーションと世界モデルベースの評価に多大なリソースを投入している。
公開されている智元デジタルワールドフレームワークは、高忠実度のシミュレーション環境、自動生成されたエキスパート軌跡、およびモデル評価ツールを提供している。
智元ロボットはその後、EVAC世界モデルフレームワークとEWMBenchを発表し、アクション条件付き生成シミュレーションの概念をさらに拡張した。
シミュレーターとして使用される世界モデルにとって、長期的な一貫性は極めて重要である。
以下のような状況が発生した場合、シミュレーションの価値は大幅に低下する:
- 物体の同一性が徐々に変化する
- 幾何学的構造がドリフトする
- ロボットが以前のインタラクションを忘れる
- 長いシーケンスが物理的状態に違反する
- マルチビューの出力結果が矛盾する
これに基づき、世界モデルは意味のある時間領域にわたって一貫した状態を維持すべきである。
スクエアロボット:長期的な推論は誤った目標になり得る
汪浩は、「より長い予測は常により良い」という前提に疑問を投げかけた。
スクエアロボットは、知覚、推論、世界モデリング、およびアクション生成を密接に結合したエンドツーエンドの身体知能モデルロードマップを採用している。
公開資料では、WALLシリーズを、世界予測とロボット制御を孤立したシステムとして扱うのではなく、統一された物理世界モデルへの統合として説明している。
このようなシステムでは、世界モデルは単なるシミュレーターではない——予測自体が制御ループの一部である。
したがって、より長い推論には以下の代償が伴う:
予測する未来が遠いほど
→ 推論量が増加する
→ レイテンシが高くなる
→ 行動に利用できる時間が減少する
ロボットの環境がモデルが推論を完了するよりも速く変化する場合、完全に一貫した長期的な予測は操作レベルで役に立たない可能性がある。
制御にとっては、適切なタイミングで到達する短い予測の方が、遅れて到着する長い予測よりもはるかに価値がある可能性がある。
予測時間領域は制御時間領域と一致すべき
これは、唯一最適な予測長が存在しないことを示している。
倉庫シミュレーターは長いシーケンス予測を必要とするかもしれない。
物体のバランスを取るタスクを実行するロボットは、非常に高速な短時間予測を必要とするかもしれない。
マルチステージタスクを処理する移動マニピュレーターは、両方を必要とする可能性がある:
- 長期計画
- 短時間領域の物理予測
- 高速な閉ループ修正
したがって、合理的な設計は、単一の全長世界モデルではなく、複数の時間領域を伴う可能性がある。

3名のゲストが白いソファに座っており、中央のゲストは青いマイクを持って発言中、右側のゲストは両手を重ね、左側のゲストは両手を自然に置いている。背景は濃色で、上部に「WAIC 2026世界人工智能大会」の文字と「ACE」のロゴがある。この画像は、文書内のWAIC 2026世界モデルフォーラムの説明と一致し、フォーラムの現場の様子をそのまま伝えている。
既存の公開システムには、こうした差別化の重点がすでに反映されている
フォーラムで示された見解の相違は、各社の公開技術システムにすでに表れている。
時代具身知能:理解、予測、行動の統一
WAIC 2026において、時代具身知能は行動指向の具身世界モデル Kairos 3.1 を発表した。
公開された発表資料では、以下をつなぐことを目的としたハイブリッドTransformerアーキテクチャが説明されている:
- 理解
- 世界推論
- 行動
- 反省
時代具身知能はまた、8BパラメータのKairos 3.1モデルがNVIDIAプラットフォーム上で125ミリ秒の推論レイテンシを達成したと報告している。
Jetson Thor は BF16 精度を採用。このスペックは、同社が本モデルを単なるオフライン動画生成器ではなく、ロボット行動向けのエッジシステムとして明確に位置づけているため、極めて重要である。
アントグループ / Robbyant:インタラクティブな世界シミュレーションから具身ネイティブモデルへ
Robbyant がオープンソース化した LingBot-World は、生成型ビデオ方向から始まった。その公式コードベースの説明には次のようにある:高忠実度インタラクティブ環境、長時間の時間的一貫性、リアルタイムユーザー制御、サブ秒単位のインタラクション遅延、Fast版における16 FPSのリアルタイム生成能力。その後アントグループは LingBot-World-Fast を霊光(LingGuang)モバイル製品に統合し、ユーザーが単一の画像を探索可能な生成世界に変換できるようにした。同時に、Robbyant は VLA および具身モデル研究分野にも進出し、単一の世界モデルパラダイムに限定されないチームの典型例となっている。
GigaAI:ピクセル生成と GigaWorld プラットフォーム
GigaAI は、3つのレイヤー(GigaWorld(世界モデルプラットフォーム)、GigaBrain(汎用具身知能システム)、Maker(ロボット具身キャリア))上に構築された具身知能および汎用ロボット企業であると自称する。同社の世界モデルに関する研究は、データ作成、トレーニング、テストを加速する上での生成型物理環境の中心的役割を強調している。世界モデルが視覚的に豊かなシミュレーターとして使用される場合、ピクセル空間での生成は特に重要になる。
智元ロボット:生成型シミュレーターとしての世界モデル
智元ロボットの公開研究は、シミュレーター利用シナリオを特に明確に示している。AgiBot Digital World は、3Dアセット、物理シミュレーション、エキスパート軌道生成、ドメインランダム化、データ生成、モデル評価を融合している。その後の EVAC フレームワークは、ロボットの行動シーケンスに基づく未来の視覚状態を生成する。この種のアプリケーションでは、時間的一貫性と行動-環境間相互作用の正確な再現が極めて重要である。
星動紀元:世界モデルとVLAの融合
星動紀元の公式な発展の経緯によれば、その WALL-A アーキテクチャは VLA モデルと世界モデルを深く融合させている。2026年の WALL-B の方向性は、同社が世界統一モデルアーキテクチャと呼ぶものへとさらに進んでいる。その技術目標は、世界モデルが独立して予測し、その後独立したポリシーが予測結果を行動に変換するというパイプラインを避け、予測と制御のプロセスを統合したエンドツーエンドシステムとすることである。
物界動力:具身ネイティブ世界モデルと潜在空間予測
物界動力の公開資料によれば、同社はロボットの「汎用頭脳」および世界モデルに基づく具身ネイティブマルチモーダル基盤モデルシステムを構築している。夏中普(Xia Zhongpu)は2026年3月に同社に加わり、それ以前は理想汽車(Li Auto)でエンドツーエンド自動運転を主導していた。同社の研究方針は、潜在空間予測、物理量、JEPA的思考を強調している。現在のところ、世界モデルに関する詳細な公開技術文書はまだ限られているため、その正確なアーキテクチャに関する主張は、完全に文書化されたオープンモデルというよりも、経営陣が説明する技術的方向性として捉えるべきである。
最も早く合意に至る可能性が高いのは何か?
次の問題は、どのアーキテクチャが最終的に勝つかではない。
そうではなく:
この分野のどの部分が最初に一致団結するのか?
答えは大きく異なる。
候補1:統一表現
任広輝(Ren Guanghui)と夏仲普(Xia Zhongpu)はともに、表現の重要性を強調した。
大規模言語モデルは最終的にトークン化された系列表現の周りに収束し、異なるタスクが単一のアーキテクチャと互換性を持つことを可能にした。
具身知能には、まだ同様に汎用的な基本単位が欠けている。
ロボットの作業には以下が関わる:
- 画像。
- ビデオ。
- 言語。
- 関節位置。
- 速度。
- 力。
- 触覚信号。
- 3Dジオメトリ。
- 行動。
- 報酬。
- 環境状態。
これらのモダリティが互いに孤立している場合、各システムはそれらの間に複雑な橋渡しを構築する必要がある。
統一表現により、モデルは同じ共有空間内で知覚、状態、予測、行動の推論を行うことができる。
課題は、物理信号は本質的に交換可能ではないことにある。
触覚パルス、カメラフレーム、グリッパーコマンドは、それぞれ異なるレートで動作し、異なる情報を伝達する。
したがって、「ロボットトークン」はテキストトークンよりもはるかに定義が難しい可能性がある。
候補2:ハイブリッドアーキテクチャ
王浩(Wang Hao)の予測はアーキテクチャの融合である。
この観点から見ると、異なる世界モデルアプローチはそれぞれ問題の一部を解決している:
- ビデオ生成は視覚的な未来予測に優れる。
- 潜在予測は推論にとって効率的である。
- 明示的な3Dモデルは空間記憶を提供できる。
- VLAモデルは知覚と行動を接続する。
- 古典的な制御は決定論的な低レベルの安定性を提供できる。
最終的なアーキテクチャは、これらの中から1つだけを選んで他を捨てるのではなく、これらのメカニズムを組み合わせる可能性が高い。
このパターンはAI分野で一般的である。
当初競合していた技術は、長所と短所が明らかになった後、より大きなシステムの構成要素となることが多い。
候補3:触覚知覚
沈玉軍(Shen Yujun)は、触覚情報が業界で最も早期に合意に達する分野の1つになる可能性があると考える。
現在、ほとんどの大規模世界モデルは主に視覚と言語データで訓練されている。
ロボットは接触によって操作する。
それらは検出する必要がある:
- 物体が滑っているかどうか。
- 表面が硬いか柔らかいか。
- 把握が安定しているかどうか。
- どれだけの力が加えられているか。
- 変形可能な物体が形状を変えたかどうか。
- 視界が遮られていても接触が発生したかどうか。
操作タスクにとって、触覚が最も有用な瞬間に、視覚はあいまいになる可能性がある。
これは、触覚知覚を、モデル訓練後に追加されるオプションのセンサーではなく、ネイティブモダリティとして扱うべき強力な理由となる。
Robbyantの研究方向性も、デジタルビデオベースのモデルから、具身制御を中心に設計されたモデルへの広範なシフトを反映している。
重要な違いは:
ビデオモデルの目標は、もっともらしい未来を生成することである。
具身世界モデルの目標は、成功する行動をサポートすることである。
これら2つの目標は重なる部分もあるが、同一ではない。
候補4:共有ベンチマーク
陶大程(Tao Dacheng)は異なる答えを示した:収束はアーキテクチャではなく、評価において最初に起こる可能性がある。
これには歴史的な前例がある。
コンピュータービジョンは、研究者が事前にある表現について合意していたからではなく、収束した。ImageNetのような共有データセットとベンチマークが、競合するシステムに共通の評価目標を提供した。すべてのシステムが同じ尺度で評価されると、弱いアイデアはより早く消え去り、有用なアイデアはアーキテクチャの境界を超えて広がることができる。これこそが、フォーラムで物理IQが導入された背後にある論理である。
物理IQ:具身知能の統一メジャー
物理IQは、2026年の世界人工知能大会において、具身物理知能の統一ベンチマークとして導入された。公開情報によれば、このイニシアチブは以下の機関によって共同で開始された:
- 上海市人工知能協会
- 深圳市循環経済研究院
- 中国信息通信研究院華東分院
20以上の大学と業界団体が参加している。このプラットフォームは、以下の次元にわたって異なるシステムを比較することを目的としている:
- 異なるロボット形態
- 多様な実世界シナリオ
- 異なるタスクカテゴリ
- 統一された評価プロトコル

有用な物理的知能のベンチマークは、生成された動画がリアルに見えるかどうかだけに依存すべきではありません。問われるべきは以下の点です:
- ロボットはタスクを完了したか?
- 動作は物理的に有効か?
- 予期せぬ出来事から回復できるか?
- どれだけの介入が必要か?
- 行動は安全か?
- 戦略は新しい環境に移行できるか?
- 物体や形態を超えてどの程度汎化できるか?
- 各決定にどれだけの時間と計算量が必要か?
物理的IQ(Physical IQ)の具体的な手法は、継続的に文書化され、広く採用されて初めて真の業界標準となります。それでも、この方向性は実際の問題を解決します。現在、様々なワールドモデルの主張は比較が困難です。ある企業が動画の品質を報告し、別の企業がタスク成功率を報告し、三社目が物理状態の誤差を報告し、四社目がシミュレーターとの一致性を報告するからです。統一された尺度がなければ、各システムは自身が最適化された指標で最も強い結果を示すことができます。
視覚的なリアリティは物理的理解とイコールではない
物理的IQをめぐる議論は、生成動画分野におけるより広範な研究課題も反映しています。Google DeepMindの研究者は、動画モデルが物理原理を真に理解しているかを評価する独立したベンチマーク**物理的IQ(Physical IQ)**を導入しました。この研究により、視覚的なリアリティと物理的正確性は乖離する可能性があることが判明しました。生成された動画は説得力を持って見えても、以下に違反する場合があります:
- 固体力学
- 流体の挙動
- 光学
- 熱力学
- 磁気学
この区別はロボットのワールドモデルにとって極めて重要です。視覚的に信頼できる将来予測は、行動に必要な特性を保持している場合にのみ有用です。同時に、ロボットは行動する前に物理の教科書全体を解決する必要はありません。実用的な基準は、これら二つの極端な中間にあります。
不十分:
リアルに見えるが、誤った結果を予測する。
過剰かもしれない:
行動に必要なくても、あらゆる物理変数を計算する。
有用な予測とは、ロボットの意思決定を変える物理的な差異を捉えるものです。
この中間領域こそが、現在の研究における意見の分かれ目です。
デモから実導入へ
モデルアーキテクチャに関する意見の相違はあるものの、議論がモデルから実ロボットへと移るにつれて、専門家の見解はより一致してきます。
究極の基準は単純です:
数分で紹介サイトを作り、リード獲得を伸ばす
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
ロボットは物理世界で確実にタスクを遂行できるか?
異なる講演者はそれぞれ異なる言葉でこれを表現しました。
- 夏仲普氏は最終的な意思決定の有効性を強調しました。
- 任光輝氏はワールドモデルが下流の戦略をどれだけ向上させるかに焦点を当てました。
- 朱峥氏は実ロボットでのマルチタスク成功率を強調しました。
用語は異なりますが、運用上の問題は一貫しています。
ワールドモデルは、ロボットの実際の行動を改善できて初めて意味を持ちます。
なぜ99%のデモでもまだ使い物にならない製品になり得るのか
デモはほぼ無限に最適化できます。
チームは以下を行うことができます:
- 環境をリセットする。
- 有利な物体を選択する。
- 経路を事前に定義する。
- 失敗した試行を繰り返す。
- 単一のシナリオに数週間かけて調整する。
- エンジニアを常駐待機させる。
- 稀なエッジケースを除外する。
実導入はこれらの保護措置を排除します。
スーパーマーケット、ホテル、倉庫、家庭では、毎日予測不可能な出来事が発生します。
王浩氏はコスト曲線を強い非線形性と表現しました。
システムを以下のようにする場合:
90% → 99%
に要する労力は、必ずしも以下と同等ではありません:
99% → 99.9%
残りの失敗は、しばしば困難なロングテールのケースです。
1%の失敗率は実験室では小さく聞こえます。
ロボットが1日に10,000回の動作を実行する場合、1%は100回の失敗を意味します。
たとえ99.9%の信頼性を達成しても、タスク量が十分に大きければ、頻繁な人的介入が依然として発生します。
ビジネスへの影響は以下を含みます:
- 人的な対応。
- やり直し作業。
- ダウンタイム。
- 顧客クレーム。
- 安全リスク。
- メンテナンスコスト。
- スループットの損失。
- 追加の監視要員。
これが、実導入がモデル品質の意味を変える理由です。
ランダムイベントは現実世界では常態である
沈宇軍氏は小売業の例を挙げました。
ロボットは野菜のパックを探す必要があるかもしれません。
商品は通常一箇所に保管されていますが、顧客が手に取って別の冷蔵庫に置くことがあります。
厳選されたデータセットの観点からは、これは異常に見えます。
しかし、何千もの顧客にサービスを提供するロボットの観点からは、異常こそが常態です。
したがって、ワールドモデルは以下を処理する必要があります:
- 予期しない場所にある物体。
- 在庫切れ。
- 経路を塞ぐ人。
- 突然の再配置。
- 部分的な観測。
- 照明の変化。
- 新しい物体の組み合わせ。
- タスク早期に発生した誤った仮定。
これこそが、記憶されたデモンストレーションの再現よりも汎化能力が重要となる場面です。
エッジ推論は導入の要件である
陶大成氏は別の実際的な制約を強調しました:レイテンシ。
多くの高度なモデルはクラウド上で動作します。
ロボットは常にクラウドの往復を待つ時間があるわけではありません。
意思決定のウィンドウはミリ秒単位である可能性があります。
数十ミリ秒、あるいは数百ミリ秒。
ネットワークは以下の状態になる可能性もあります:
- 混雑
- 利用不可
- 信頼性が低い
- コストが高すぎる
- プライバシーやセキュリティ要件により制限される
これが、ACE RoboticsがKairos 3.1のエッジ性能を重視する理由です。
能力がやや劣っていても、制御のタイムリミット内に応答できるモデルは、アクションのウィンドウが過ぎた後に到着する強力なモデルよりも有用かもしれません。
導入において、知能は以下を満たさなければなりません:
- 十分に低コスト
- 十分に高速
- 十分に信頼性が高い
- 十分にローカル
- 十分に予測可能
これにより、有用な区別が導かれます:
デモは能力の上限を示し、導入は能力の下限を明らかにする。
2年後、何が正しかったと言えるのか?
議論の最後の部分では、講演者に2028年から振り返って想像するよう求めました。
2026年に行われたどの投資が正しかったと証明されるでしょうか?
どれが誤解を招くものであった可能性があるでしょうか?
答えは、各チームが永続的だと考えるものを再び明らかにしました。
モデル能力と見えるモデル出力
沈宇軍氏は二つの概念を区別しました:
基礎能力
例:
- 汎化効率
- インタラクティブ性
- 表現の質
- 動作条件付け
- データ効率
- 因果的一貫性
見える出力
例:
- 視覚的に印象的な生成動画
- 洗練されたデモ
- 単一の成功した長期タスク
- 高い美的品質
あるモデルは基礎能力が向上しても、すぐに最も印象的なデモを生成するとは限りません。
逆に、システムは汎用物理知能に必要な能力を向上させることなく、見える出力に大きく最適化することができます。
これが、業界がより良い評価を必要とする理由の一つです。
データ基盤は引き続き価値を持つ可能性がある
沈氏はまた、データパイプラインに投資された作業は有用性を維持する可能性が高いと述べました。
アーキテクチャが変わっても、具現化知能は依然として以下を必要とします:
- 実世界の軌跡
- 触覚データ
- 失敗事例
- 人手による修正
- ロボットの動作
- センサーの同期
- シミュレーションデータ
- 品質フィルタリング
- 評価データセット
不確実性はデータが重要かどうかではありません。
今日収集されたデータが、将来のモデルで使用される表現や訓練手法に依然として適合するかどうかです。
以下の場合、データセットは有用性を失う可能性があります:
- センサー構成が変更される
- アクションスペースが変わる
- ラベルが時代遅れの仮定をコード化している
- データに必要なモダリティが欠けている
- 収集戦略が狭すぎる
- 新しいモデルが異なる時間解像度を必要とする
したがって、柔軟なデータパイプラインを構築することは、固定されたデータセットを最適化するよりも永続性があるかもしれません。
基盤モデルに早急に手を加えない
朱政氏は、業界が基盤モデル自体が安定する前に、あまりにも多くの商業シナリオを探索する可能性があると警告しました。
これは新興企業が陥りがちなジレンマです。
商業導入は以下を提供します:
- 収益
- データ
- 顧客からのフィードバック
- 実際の制約
しかし、モデルチームを以下の方向に引き寄せる可能性もあります:
- 一回限りの統合
- カスタムワークフロー
- 顧客固有のルール
- ハードウェア適応
- サポートと運用
基盤となるアーキテクチャがまだ急速に変化している場合、早期の特化は基礎研究の進行を遅らせる可能性があります。
モデル研究と商業導入のバランスは企業によって異なります。
万能の答えはありません。
具現化ネイティブアーキテクチャが台頭する可能性
任光輝氏は、ワールドモデルはますます具現化ネイティブへと向かうと予測しました。
これは、モデルが後からインターネット動画や画像生成タスクから改造されるのではなく、設計当初から物理的インタラクションを中心に構築されることを意味します。
具現化ネイティブな訓練には以下が含まれる可能性があります:
- ロボットの動作
- 自己受容感覚
- 力
- 触覚データ
- 一人称視点動画
- 多視点観測
- 三次元状態
- ツールからのフィードバック
- 介入データ
- タスクの成功と失敗
アーキテクチャ自体も制御ループを中心に設計される可能性があります。
重要なのは、モデルがロボットの動作実行に必要な変数を表現しているかどうかであり、その内部構造がメディア生成モデルと類似しているかどうかではない。
相違点こそが最大の好機
この議論は、全員が同意する単一のアーキテクチャに収束することはなかった。
これは、この分野が行き詰まっているのではなく、まだ初期段階にあることを示しているのかもしれない。
未解決の重要な領域が依然として複数存在する:
| 問題 | 異なる視点 |
|---|---|
| モデルは何を予測すべきか? | ピクセル、潜在状態、明示的幾何学、あるいはハイブリッド方式 |
| 物理的な精度はどの程度必要か? | 正確な状態推定 vs. 動作に関連する合理性 |
| 予測範囲はどの程度先までか? | 長期的な一貫性 vs. 低遅延の短期的制御 |
| この分野を統一するものは何か? | 表現、アーキテクチャ、触覚データ、それともベンチマーク |
| 推論はどこで実行されるべきか? | クラウド、エッジ、あるいはハイブリッド展開 |
| 真の成功指標とは何か? | シミュレーション品質、物理予測、ポリシー改善、実際のタスク成功率 |
| 最も重要なデータは何か? | ビデオ、ロボット軌跡、力、触覚、シミュレーション、あるいは混合データ |
成熟した分野では、アーキテクチャは収束する傾向がある。
一方、新興分野では、相違点こそが未だ攻略されていない最大の好機を明らかにする。
現在の議論中の仮説のいずれかを証明できれば、チームは業界のコンセンサスが形成される前に技術的優位性を築くことができる。
ロボット用世界モデルを評価する実用的フレームワーク
開発者やロボットチームにとって、この議論はより具体的な評価チェックリストに変換できる。
- 予測目標
モデルが何を予測するかを明確にする:
- ピクセル。
- 潜在状態。
- 幾何学。
- 動作。
- 力。
- 将来の観測。
- 上記要素の組み合わせ。
出力は下流の制御問題に適合する必要がある。
- 予測範囲
以下のレベルの性能を測定する:
- 即時の次のステップ。
- 短期サイクル。
- 数秒単位のサイクル。
- 長期タスクサイクル。
モデルが最も得意とする予測範囲だけで評価してはならない。
- レイテンシ
対象となる展開ハードウェア上で実際の推論時間を測定する。
制御の時間制約を満たせないモデルは、予測精度が高くても満点を与えるべきではない。
- 物理的有効性
テスト内容は以下を含む:
- 衝突。
- 接触。
- バランス。
- 変形。
- 摩擦に敏感な動作。
- 物体の永続性。
- 多視点間の一貫性。
- ポリシー改善
最も実用的な問いはおそらくこれである:
世界モデルを導入することで、実際のタスク成功率は向上するか?
世界モデルがある場合とない場合で、下流のポリシーの性能を比較する——
世界モデルコンポーネントを含むポリシーと含まないポリシー。
- 汎化能力
新しい内容でテストする:
- 物体
- レイアウト
- ロボット本体
- 照明
- 材質
- 人間の行動
- タスクの組み合わせ
- 回復能力
最初のエラー発生後の状況を測定する。
展開されたシステムは、障害を検出し、状態を更新し、別の方法を試みる必要がある。
- エッジとクラウドの動作
正常時および劣化したネットワーク状態の両方でテストする。
リモート推論が利用できない場合、ロボットは安全にフェイルオーバーできなければならない。
- 介入率
以下の単位で人間の支援を追跡する:
- 1時間あたり
- タスクあたり
- 100アクションあたり
- 1000アクションあたり
これは多くの場合、単一の成功率よりも展開の質をよく示す。
- 成功タスクあたりのコスト
以下を含む:
- モデル推論
- ハードウェア
- ネットワーク
- 人的介入
- 手直し
- メンテナンス
- エネルギー消費
- ダウンタイム
最良の世界モデルとは、必ずしもベンチマークスコアが最も高いものではない。
ロボットシステム全体をより良く機能させるものである。
よくある質問
具現化AIにおける世界モデルとは何か?
世界モデルとは、環境が時間、ロボットの動作、またはその他のイベントに応じてどのように変化するかを表現または予測できるモデルである。ロボット工学においては、計画、シミュレーション、動作選択、訓練データ生成、またはポリシー改善を支援できる。
WAIC 2026で議論された主な世界モデル手法は何か?
議論は、ピクセル空間生成、潜在空間予測(JEPAスタイルのアプローチなど)、および世界予測とVLA制御、3D推論、またはその他の表現を組み合わせたハイブリッドまたは統一システムに広く及んだ。これらのカテゴリは、複数の企業が複数の技術を使用しているため、重複している。
ロボット用世界モデルには正確な物理シミュレータが必要か?
必ずしもそうではない。一部の研究者は幾何学、運動、力の正確な予測を主張する一方、正しい動作を選択するのに十分な物理推論を優先する研究者もいる。必要な精度はタスクと失敗のコストに依存する。
なぜ長期的な一貫性が議論の的となるのか?
長いシーケンスの展開はシミュレーションや長期計画に有用だが、推論コストが増加し、リアルタイム制御を遅くする可能性がある。物理ロボットは、即時の動作に対しては短くて速い予測を必要とし、長期計画には別のメカニズムを使用する可能性がある。
PHYSICAL IQとは何か?
PHYSICAL IQは、WAIC 2026期間中に開始された具現化物理知能ベンチマークイニシアチブである。異なるロボット本体、シナリオ、タスクに対する共通の評価プロトコルを提供することを目的としている。
PHYSICAL IQとGoogle DeepMindのPhysics-IQは同じものか?
いいえ。それらは異なるプロジェクトである。PHYSICAL IQはWAIC 2026で発表された具現化ロボット評価プラットフォームであり、Physics-IQは生成ビデオモデルが物理原理を理解しているかどうかをテストするための研究ベンチマークである。
なぜ触覚センシングが世界モデルにとって重要なのか?
視覚だけでは、接触力、滑り、圧力、コンプライアンス、および特定の材料特性を完全に明らかにすることはできない。触覚と力の信号は、物理的相互作用に関する直接的な情報をロボットに提供し、操作に焦点を当てた世界モデルにとってますます重要になる可能性がある。
良いロボットデモよりも重要なことは何か?
展開。
信頼性。チームは、選択されたデモ事例だけでなく、多様な環境において、実際のタスク成功率、レイテンシ、介入率、予期しない事態からの回復能力、安全性、コスト、および性能を測定する必要がある。
関連ツール
- Hugging Face上のKairos 3.1:ACE Roboticsの行動指向具現化世界モデルに関する公開コレクション。
- LingBot-World:Robbyantによるオープンソースのインタラクティブ世界シミュレータ。コード、モデル、技術文書を含む。
- AgiBotデジタルワールド:AgiBotのデータ生成、訓練、具現化モデル評価のための公式シミュレーションフレームワーク。
- GigaAI:GigaWorld、GigaBrain、および同社の具現化AIプラットフォームの公式ウェブサイト。
- X平方ロボット:WALL具現化基礎モデルファミリーと世界モデル/VLA統合について説明する公式ウェブサイト。
- Physics-IQ:生成ビデオモデルにおける物理理解を評価するための独立した研究ベンチマーク。
- NVIDIA Isaac Sim:合成データの生成とロボットシステムのテストのためのロボットシミュレーションプラットフォーム。
関連リンク
- ACE Robotics Kairos 3.1コレクション:Kairos 3.1および関連具現化システムの公開モデルリソース。
- ACE Robotics WAIC 2026発表:Kairos 3.1とPHYSICAL IQイニシアチブをカバーする同社のプレスリリース。
- [アリババグループ Lingong世界モデル発表](https://www.
antgroup.com/en/news-media/press-releases/1777280400000):アント・グループの公式発表。LingBot-World-Fastを「霊光」に統合した旨が記載されています。
- LingBot-World GitHubリポジトリ:Robbyantによるオープンソースコード、インストール手順、重み、論文へのリンク。
- AgiBotデジタルワールド:AgiBotのシミュレーションと具身データフレームワークに関する公式紹介。
- AgiBot EVACとEWMBench:行動条件付きワールドモデルとその評価に関するAgiBot公式の取り組み。
- Xスクエアロボット:WALLモデルファミリーとエンドツーエンドの具身知能に関する公式情報。
まとめ
WAIC 2026のワールドモデル円卓会議では、具身知能の分野においてワールドモデルの定義、表現、アーキテクチャに関する合意がまだ形成されていないことが明らかになりました。主な対立点は、物理的正確性、予測範囲、表現方法、触覚知覚、そして世界モデリングと行動の関係に及びます。
最も強いコンセンサスが得られたのは、技術スタックの後段部分でした。ワールドモデルは最終的に、実体ロボットの信頼性を高める必要があります。すなわち、より高いタスク成功率、より少ない介入、より迅速な意思決定、より安全な復旧、そしてより低い導入コストです。
PHYSICAL IQは、その前段階として共通の評価レイヤーを創設することを目指しています。
アーキテクチャ自体は収束に向かう傾向にあります。このベンチマークが広く採用されるかどうかは未知数ですが、比較可能な物理的知能の測定手法へのニーズは明らかです。
この分野における現在の論争は弱点ではなく、次世代の具身人工知能の方向性を定義づける未解決の問題群を示しています。



