はじめに
前記事では、強化学習(RL)の学習ループを基準に、Sim2Real Gapをダイナミクス/観測/報酬の3種類へ分類しました。あれは「低レベル制御ループの内側」で生じるギャップの話でした。
本記事はその続編です。近年のロボティクスは、RL方策を直接組むのではなく、基盤モデル(Foundation Models, FM)——VFM(視覚基盤モデル)、VLM(Vision-Languageモデル)、VLA(Vision-Language-Actionモデル)、World Model——を知覚・計画・行動生成に据える構成へ移行しつつあります。
このとき、Sim2Real Gapは消えるのではなく、発生箇所が「高レベルの知覚・計画・行動生成スタック」へ移動し、性質も変わります。前記事の3ギャップに加えて、あるいはそれらを変質させる形で、生成AIモデル固有のギャップが現れます。本記事では、包括的サーベイ1を主軸に、RL向けサーベイ2・World Modelサーベイ3を補助線として、これを4種類に分類し、原因・具体的な発生事象・対策を整理します。
なお本記事では、前記事と用語をそろえるため、Sim(シミュレーション)/Real(実機)、Domain Randomization(DR)、System Identification(SysID)、Privileged Learning などの表記を引き継ぎます。
生成AIモデルにおけるSim2real gapの概要
前記事ではRLの学習ループ上の位置でギャップを分類しました。本記事では、基盤モデルの推論・デプロイのスタック上の位置で分類します。FMベースのロボットは、おおむね以下のスタックで動きます。
言語指示 + 観測(画像)
→ [知覚: VFM / VLM] 表現・意味理解
→ [計画: LLM] 行動計画・サブゴール分解
→ [行動生成: VLA] 低レベルアクション
→ 実機(アクチュエータ)
⤺ [World Model] が次状態を予測してループを閉じる
Sim2Real Gapは、このスタックのどこ(発生箇所)で乖離が生じるかによって、4種類へ分類できます。
| ギャップの種類 | スタック上の位置 | 乖離の主体 | 前記事(RL)との対応 |
|---|---|---|---|
| 表現ギャップ | 観測 → 表現・意味理解 | VFM / VLM | 観測ギャップの拡張 |
| 意味接地ギャップ | 指示・表現 → 行動計画 | LLM | (新規:FM時代の固有ギャップ) |
| 行動生成ギャップ | 表現 → 低レベル行動 | VLA | ダイナミクス+観測の複合 |
| World Model予測ギャップ | 行動 → 次状態の予測 | 生成的World Model | ダイナミクスギャップの拡張 |
前記事(RL)の3ギャップ(ダイナミクス/観測/報酬)が「制御ループ内」に位置していますが、本記事の4ギャップは「知覚→計画→行動生成」の流れに位置しています。両者は独立ではなく、下層(前記事の物理的ギャップ)が上層(本記事のFMギャップ)へ伝播するという入れ子構造になっています。
そして本記事で最初に押さえるべき本質的な非対称性は次の点です。サーベイ1はVFMの限界として「物理世界ダイナミクスのモデル化不足(微妙な物理ダイナミクス・長距離の時間相関・因果的一貫性・幾何特性への頑健な汎化に弱い)」を挙げています。つまり、
- 表現ギャップ(視覚)は、頑健なVFMによって構造的に緩和
- 一方で、ダイナミクスに起因するギャップ(World Model予測ギャップ)は、FMを使っても残る
これが、対策の重心が「知覚は基盤モデルで、動力学はデータ合成と後訓練で」という配分の理由です。
① 表現ギャップ(Representation Gap)
発生箇所:知覚段(VFM / VLM)。前記事「観測ギャップ」を、FMの表現・埋め込み空間へ持ち上げたもの。
背景
FMは、Web規模データ・Simデータ・Realデータの混合から視覚表現を学習します。VFM(DINOv2、SAMなど)は「視覚的な歪み(ノイズ・照明変動)に対して従来モジュールより頑健」という強みを持ちますが、この表現がSimや特定ドメインに引きずられると、実機観測で埋め込みがずれ、下流の方策が劣化します。前記事の観測ギャップが「生の観測 o」の話だったのに対し、ここでは「表現 φ(o)」の話になります。
原因と事象
(a) ドメイン特化性
VFMは「比較的狭いドメインで十分に高性能」に留まる傾向があります1。Sim中心で表現を固定すると、学習外の実環境で劣化します。
- 発生事象:Sim学習した把持方策が、実機の照明・背景で物体検出に失敗する
(b) 物理世界ダイナミクスのモデル化不足
VFM/VLMは、微妙な物理ダイナミクス・長距離の時間相関・因果的一貫性・幾何特性への頑健な汎化に弱い、とサーベイは指摘しています1。静止画的な認識は強い一方、動き・接触・オクルージョンが絡む時系列では表現が崩れます。
- 発生事象:単フレームでは認識できるが、動作中・遮蔽下で表現が不安定になり、把持位置がずれる
(c) open-world性ゆえの過信
VLMはopen-vocabularyで未知物体を「それらしく」ラベル付けしますが、その意味出力が実機で誤っていることがあります。
- 発生事象:存在確度の低い物体を確信を持って認識し、誤った対象へ行動する
対策
頑健な事前学習VFMの利用(frozen backbone)
DINOv2のような、ドメインシフト下でも転移する密な視覚特徴をfrozenで使い、下流方策だけを学習します。視覚的歪みへの頑健性が表現ギャップの一次的な緩和になります。
ドメイン適応(Domain Adaptation, DA)
source(Sim/Web)→ target(Real)の分布整合により精度を維持します。VLA向けにはX-VLA(soft-promptによるクロス埋め込み適応)やMetaVLA(メタ協調学習による効率的適応)が提案されています1。
Real少量データでのfine-tuning / パラメータマージ
汎用FMをReal少量データで微調整します。頑健性を損なわない手法として、パラメータマージによるVLA方策のロバストfine-tuningが提案されています1。
前記事の観測対策の継承
Observation Noise Randomization と Privileged Learning(Teacher-Student) は、FM時代でも表現の入力側で引き続き有効です。特権情報でSim教師を訓練し、実センサ観測のみの生徒へ蒸留する構図は、表現ギャップにもそのまま効きます。
② 意味接地ギャップ(Semantic Grounding Gap)
発生箇所:計画段(LLM)。前記事の3ギャップ(RLループ内)には存在しなかった、FM時代の固有ギャップ。
背景
LLMは、物理環境と接続しない意味空間で行動計画を生成します。「もっともらしいが物理的に不可能な計画」を出しうるのが、この段の本質的な弱点です。前記事の報酬ギャップ(特に報酬ハッキングや成功基準のミスマッチ)を、高レベルの計画段へ持ち上げたものとも読めます。
原因と事象
(a) 接地(grounding)の欠如
LLMは物理環境への接続を持たない意味空間で動作するため、実行不能な行動計画を生成しうる、とサーベイは述べています1。
- 発生事象:「棚のコップを取って」に対し、アームの可達範囲外にある物体を掴む計画を出す
(b) 幻覚(Hallucination)
LLMの推論は、統語的・意味的には正しいが不合理な行動に帰結することがあります1。
- 発生事象:シーンに存在しない物体を操作対象とする計画、順序が物理的に破綻した手順
(c) 入力バイアス・感度
曖昧・不明瞭な指示は、予測不能あるいはバイアスした計画を招きます1。
- 発生事象:わずかな言い回しの違いで計画が大きく変わる
(d) sim/realの成功基準ミスマッチ(高レベル版)
前記事の報酬ギャップ(c)に対応します。LLMが想定する「タスク完了」と、実機での物理的完了がずれます。
- 発生事象:計画上は完了扱いだが、実機では対象が所定位置に収まっていない
対策
意味接地ギャップの対策は、**「計画を実機に触れる前に検証・制約する安全弁」**として整理できます。
アフォーダンス/価値によるフィルタ
SayCan型のアプローチでは、価値ベースのアフォーダンスで候補スキルをフィルタし、実行可能かつ文脈に沿ったものだけを残します1。
実行前検証(pre-execution verification)
AutoTAMPは要求をTask-and-Motion Planningの仕様へ翻訳し、記号プランナが幾何・運動学の実行可能性を検査します。VerifyLLMのように、実行前にタスク計画を検証する枠組みもあります1。
不確実性推定
ハードウェアで行動する前に、計画候補の不確実性を推定して緩和策を講じます1。
実行時のエラー処理・再計画
STATLER(状態・ツールフィードバックの解釈)、CAPE(前提条件エラーからの修正)、CoPAL(乖離検知時の再計画)は、実行中に生じた破綻を意味レベルで検知・回復します1。
前記事とのつながり:これらは、報酬ハッキング(Simの抜け穴を突く行動)の高レベル版=物理的に不合理な計画を、実行前に排除する役割を担います。報酬ギャップ対策の「Realで意味のある補助制約を加える」思想の、計画段への一般化です。
③ 行動生成ギャップ(Action Generation Gap)
発生箇所:行動段(VLA)。前記事のダイナミクスギャップと観測ギャップが、end-to-end方策では「行動の不安定化」として複合的に現れる。
背景
VLAは、視覚と言語を直接(end-to-end)に低レベルアクションへマップします。学習の主なソースはデモンストレーション(Sim生成またはteleoperation)であり、**学習分布と実行分布のズレ(共変量シフト)**が生じると、誤差が累積して行動が不安定化します。前記事のダイナミクス/観測ギャップが、モジュール分離されず一枚の方策の中で混ざって顕在化する、と捉えると分かりやすいです。
原因と事象
(a) デモ分布への過適合と共変量シフト
学習分布外の状態に入ると、行動誤差が累積します。
- 発生事象:初期の微小なずれが軌道全体に伝播し、動作が発散する
(b) 行動の不安定化(Action Destabilization)
前記事のアクチュエータ遅延・接触モデル誤差は、RL方策と同様にVLAでも効きます。大規模方策では高周波振動・チャタリングとして表面化します。
- 発生事象:Simでは滑らかな軌道が、実機では振動して破綻する
(c) embodimentギャップ
学習時と異なる実機(リンク長・関節数・エンドエフェクタ)へ行動が転移しません。
- 発生事象:クロスembodiment(別ロボット)で動作が破綻する
対策
生成合成データによる分布拡張(=DRの生成AI版)
生成学習は、大規模Realデータへの依存を減らすため、多様で高品質なロボット経験を人工的に合成します1。代表例としてSim2Real-VLA(合成スキルのゼロショット実機汎化)や、単一デモを生成的にスケールさせる手法があります1。前記事のDomain Randomizationが「パラメータ分布を広げてRealを包含する」発想だったのに対し、こちらは「Real近傍のデータそのものを生成して分布を埋める」発想です。
Domain Randomization(行動・観測)
摩擦・質量・遅延・観測ノイズのランダム化は、VLAでも引き続き有効です。前記事のマルチモーダル遅延ランダム化(MMDR)の考え方も継承できます。
ロバストfine-tuning / パラメータマージ
Real微調整で頑健性を損なわないよう、パラメータマージによるVLA方策のロバストfine-tuningを用います1。
クロスembodiment設計
RT-X(多数のロボット・タスクを単一アーキテクチャで扱う)やX-VLA(soft-promptによるスケーラブルなクロスembodiment)で、embodiment依存を低減します1。
オンライン適応
デプロイ時に実環境へ適応する枠組みは、前記事のRapid Motor Adaptation(RMA)の思想をFMスタックへ持ち込むものです。
④ World Model予測ギャップ(World Model Prediction Gap)
発生箇所:予測ループ(生成的World Model)。前記事のダイナミクスギャップを、「学習された予測器」へ持ち上げたもの。
背景
World Modelは、環境ダイナミクスをモデル化し行動の帰結を予測することで、FMの知識を「物理的にもっともらしい予測」へ接地します1。しかしSimで学習すると、その予測自体にSim2Real Gapが伝播します。World Modelサーベイ3は、Sim2Real Gapが視覚ドメインギャップと動力学ドメインギャップという、ほぼ直交する2軸に沿って現れると整理しています。
原因と事象
(a) 予測へ伝播する2軸のギャップ
World Modelの予測誤差は、視覚ドメインギャップ(レンダリング品質・照明・テクスチャ・センサ特性の差)と、動力学ドメインギャップ(接触モデルの不正確さ・摩擦や変形の簡略化・未モデル化の遅延やノイズ)の両方に由来します3。
- 発生事象:予測画像は妥当に見えるが、予測された接触・反力が実機と食い違う
(b) 固定物理エンジン内DRの限界
ドメインランダム化だけでは動力学ギャップに不十分な場合があります。DRは固定された物理エンジン内のパラメータを乱数化するに留まり、剛体接触モデルのような構造的仮定が現実と合わない場合には埋められないためです3。これは前記事の「接触モデルの誤差」を、予測器のレベルで再確認したものです。
(c) 長期ロールアウトの誤差蓄積
予測を多段に重ねると誤差が発散し、World Modelベースのplanningが破綻します。
- 発生事象:短期予測は当たるが、長horizonのplanningで軌道が非現実的になる
対策
実世界データでのpost-training
Simで学んだWorld Modelを、大規模Real動画で後訓練し、予測を実分布へ寄せます。トークン空間でvision/language/actionを統一し、大規模動画からworld-model post-trainingを行う方向が示されています1。
制御可能・適応可能なWorld Model
Ctrl-World(操作タスク向けの制御可能な生成的World Model)や、AdaWorld(潜在アクションで適応可能なWorld Model)が提案されています1。
事前学習視覚特徴上のWorld Model
DINO-WMは、事前学習済み視覚特徴の上にWorld Modelを構築し、ゼロショットplanningを可能にします1。①表現ギャップ対策(頑健VFM)と④の対策が同じ土台を共有する点が、FM時代ならではの設計上の妙味です。
Real経験によるランダム化域の更新(閉ループsim随伴)
Real経験でDRの分布を更新し、Simと実機を近づけ続ける閉ループは、前記事のダイナミクスギャップ対策の思想を予測器へ拡張したものです。
4種類のギャップの対策マトリクス
前記事と同様、実務では上流(知覚)から順に対応します。◎=主要な対策、○=副次的な効果。
| 対策手法 | 表現 | 意味接地 | 行動生成 | World Model予測 | 主要文献 |
|---|---|---|---|---|---|
| 頑健VFM(DINOv2等, frozen backbone) | ◎ | — | ○ | ○ | Oquab et al., 2024 |
| Domain Adaptation(X-VLA / MetaVLA) | ◎ | — | ○ | — | Zheng 2026 / Li 2026 |
| ロバストfine-tuning(パラメータマージ) | ○ | — | ◎ | — | Yadav et al., 2026 |
| 生成合成データ(Sim2Real-VLA) | — | — | ◎ | ○ | Zhao et al., 2026 |
| Domain Randomization / MMDR | ○ | — | ◎ | ○ | 前記事参照 |
| アフォーダンスフィルタ(SayCan型) | — | ◎ | ○ | — | Brohan et al., 2023 |
| 実行前検証(AutoTAMP / VerifyLLM) | — | ◎ | — | — | Chen 2024 / Grigorev 2025 |
| 不確実性推定・再計画(CAPE/CoPAL) | — | ◎ | — | — | Raman 2024 / Joublin 2024 |
| Privileged Learning(Teacher-Student) | ◎ | — | ○ | — | Lee et al., 2020 |
| 実Real動画でのpost-training | — | — | ○ | ◎ | Wang et al., 2026 |
| 制御可能/適応World Model(Ctrl-World/AdaWorld) | — | — | ○ | ◎ | Guo 2026 / Gao 2025 |
| DINO-WM(事前学習特徴上のWorld Model) | ○ | — | — | ◎ | Zhou et al., 2025 |
| LLM-guided sim2real(DrEureka) | — | ○ | ◎ | ◎ | Ma et al., 2024 |
前記事との橋渡し:DrEurekaは、高レベルのプロンプトからSim2Real訓練パイプライン全体を自動化し、報酬とDomain Randomizationを協調設計します1。前記事のダイナミクスギャップ対策(DR設計)が試行錯誤に依存していた部分を、LLMが担う——つまり、本記事の生成AIモデルが、前記事のRLギャップ対策の設計者になる、という接続点です。
実践上の優先順位
意味接地ギャップの対策(検証・フィルタ)は、全段に常時かける安全弁として直交的に配置し、転移そのものを成立させる手当ては知覚→行動→予測の順で進めるのが基本です。
Step 0.(常時)意味接地の安全弁を張る
└─ アフォーダンスフィルタ + 実行前検証 + 不確実性推定
Step 1. 表現ギャップを固める
└─ 頑健VFM(frozen backbone)
└─ Domain Adaptation + Real少量fine-tuning
└─ (継承)Observation Noise / Privileged Learning
Step 2. 行動生成ギャップを埋める
└─ 生成合成データ(Sim2Real-VLA)=DRの生成AI版
└─ Domain Randomization + ロバストfine-tuning
└─ クロスembodiment設計(X-VLA / RT-X)
Step 3. World Model予測ギャップを縮める
└─ 実Real動画でのpost-training
└─ 事前学習特徴上のWorld Model(DINO-WM, ①と土台共有)
└─ Real経験でのDR域更新(閉ループsim随伴)
前記事の「ダイナミクス → 観測 → 報酬」が低レベル制御ループの上流優先だったのに対し、本記事は知覚 → 行動 → 予測というFMスタックの上流優先になっている、という対応関係で覚えると整理しやすいです。
まとめ
- 生成AIモデルを導入しても、Sim2Real Gapは消えず、発生箇所がFMスタック(知覚→計画→行動生成→予測)へ移動する。
- 4分類:表現ギャップ(VFM/VLM)/意味接地ギャップ(LLM・FM時代の新規)/行動生成ギャップ(VLA)/World Model予測ギャップ。
- 表現(視覚)ギャップは頑健VFMで構造的に緩和されるが、動力学に起因するギャップ(World Model予測)は残るという非対称性が、対策配分を決める。
- 前記事の物理的3ギャップは消えず、下層から上層へ伝播する。DR・SysID・Privileged Learning・RMAはFM時代にも継承され、DrEurekaのようにFMがそれらの設計者になる流れが現れている。
出典
-
Aggelos Psiris et al., "Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions," arXiv:2604.15395, 2026. ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22
-
Longchao Da et al., "A Survey of Sim-to-Real Methods in RL: Progress, Prospects and Challenges with Foundation Models," arXiv:2502.13187, 2025. ↩
-
World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications, arXiv:2606.00133, 2026. ↩ ↩2 ↩3 ↩4
