はじめに
RSS2026 workshopより以下のSemantic World Models。
[1] C. Zhu, et. al. "Semantic World Models"
- プロジェクトページ:https://weirdlabuw.github.io/swm
- paper: https://weirdlabuw.github.io/swm/static/documents/swm.pdf
概要
- World Model の1つであり、VLMを再学習させ利用する
- 一般的な World Model は、未来の画像 $x_{t+1}$ や潜在状態 $s_{t+1}$ を予測するが、本論文では未来状態に関する質問に回答する
- さらに、未来の望ましい状態が実現する確率を評価し、行動系列を最適化する。これにより最適な行動を実行できる
- その結果、従来の画像生成型World ModelやOffline RLと比較して、ロボット操作タスクにおける成功率が向上
例えば、ロボットがブロックを移動させるタスクを考える。従来のWorld Modelでは、ロボットが動作した後の画像を生成します。一方、Semantic World Model(SWM)では、次のような質問に回答する。
- ロボットの手はブロックに近づいたか?
- 赤いブロックは青いブロックに接触したか?
- ブロックを持ち上げることができたか?
このような未来に関する質問への回答を利用して、ロボットの行動を計画する。
2. 背景
2.1 従来のWorld Model
World Modelは、環境の状態遷移を学習するモデルである。
一般的には、現在の観測 $o_t$ と行動 $a_t$ から、次の観測を予測する。
\hat{o}_{t+1}=f_\theta(o_t,a_t)
画像を扱うWorld Modelでは、将来の画像を予測する。代表的な研究として、PlaNet、Dreamer、動画生成型World Modelなどがある。
ただし、画像の再構成精度が高いことと、行動計画に必要な情報を正しく予測できることは必ずしも一致しない。例えば、背景や照明を正確に再現できても、ロボットの指先が対象物に接触しているかどうかを間違えれば、把持タスクでは失敗する可能性がある。
2.2 未来画像の生成は本当に必要か?
本論文では、World Modelの目的を再考している。ロボット制御において重要なのは、未来の画像を正確に生成することではなく、ある行動によって目的の状態が実現するかどうかを予測すること。
例えば、ロボットが赤いブロックを青いブロックの上に積むタスクにおいて重要なのは未来の画像全体ではなく、「赤いブロックは青いブロックの上に積まれたか?」という問いへの回答であろう。
そこで、本論文では未来予測をVisual Question Answering(VQA)の問題として定式化する。
2.3 VLMをWorld Modelとして利用する
一般的なVLMの入力は画像と文章(質問など)だが、Semantic World Modelでは、VLMの入力に行動系列を追加します。
入力例:
- 画像:現在のロボットとブロックの状態
- 行動:ロボットアームを右に動かし、ブロックを押す
- 質問:赤いブロックは青いブロックに接触するか?
回答例:
- Yes / No
つまり、通常のVLMが現在の状態を理解するのに対し、SWMは行動を条件として未来の状態を推論するモデルになる。このため、VLMをそのまま利用するだけではなく、ロボットの行動とその結果を学習させる必要がある。
3. 提案手法:Semantic World Models
3.1 全体構成
先に述べたように、Semantic World Modelの入力と出力は以下。
p_\theta(A\mid S,a_{t:t+h},Q)
- $S$:現在の観測画像(下図左上)
- $a_{t:t+h}$:行動系列(下図左中央)
- $Q$:未来についての質問(下図左下)
- $A$:質問への回答(下図右)
- $\theta$:モデルのパラメータ
例えば、現在の画像とロボットアームの行動系列を入力し、「行動後にブロックを把持できているか?」という質問に対して、Yesとなる確率を予測する。この確率が高い行動系列を選択することで、ロボットの行動計画を実現する。
3.2 学習データ:SAQA Dataset
SWMでは、State-Action-Question-Answer(SAQA)という形式の学習データを使用する。
\mathcal{D}_{SAQA}
=
\left\{
(S_i,a_{i:j},Q_{S_j},A_{S_j})
\right\}
- $S_i$:時刻 $i$ の状態
- $a_{i:j}$:時刻 $i$ から $j$ までの行動系列
- $Q_{S_j}$:未来の状態 $S_j$ に関する質問
- $A_{S_j}$:その質問の正解
まず、ロボットが環境内で行動した軌跡データを用意する。
T=\{(S_0,a_0),(S_1,a_1),\dots\}
このデータから、現在の状態、行動系列、未来の状態を取り出す。さらに、未来の状態に関する質問と回答を生成する。
例えば、以下のようなもの。
| 項目 | 内容 |
|---|---|
| 現在の状態 | ロボットの手が赤いブロックの左側にある |
| 行動系列 | ロボットの手を右方向に移動する |
| 質問 | 赤いブロックとロボットの手は接触するか? |
| 正解 | Yes |
論文では、シミュレーション環境から得られる物体位置などの正解情報(Oracle Information)を使って、質問と回答をプログラム的に生成している。また、専門家による成功行動だけでなく、ランダムな行動や失敗を含むSuboptimal Dataも学習に利用している。これにより、World Modelが成功する行動だけでなく、さまざまな行動によって環境がどう変化するかを学習する。
3.3 ネットワークのアーキテクチャ
本論文では、事前学習済みVLMとして PaliGemma 3B を採用している。PaliGemmaは、主に次の要素から構成されている。
- SigLIP:画像を特徴量に変換するVision Encoder
- Gemma:言語を処理するLLM
- Projection Layer:画像特徴量をLLMの入力空間に変換する層
SWMでは、これに加えて行動を埋め込み表現に変換するProjection Layerを導入している。
行動 $a$ は、次のようにLLMの埋め込み空間へ射影される。
e_a=Pa
ここで、
P\in\mathbb{R}^{d_{tok}\times d_{act}}
$d_{act}$ :行動ベクトルの次元数
$d_{tok}$ :LLMの埋め込み次元数
これら画像特徴量、行動特徴量、質問のトークンを結合し、LLMへ入力する。
3.4 学習方法
SWMの学習では、一般的な言語モデルと同様にCross Entropy Lossを使用する。
\mathcal{L}
=
-\log p_\theta(A_{S_j}\mid S_i,a_{i:j},Q_{S_j})
つまり、未来の状態に関する正しい回答の対数尤度を最大化する。このような学習を多数の状態・行動系列について実施することで、モデルは環境の状態遷移を意味的な形で学習する。なお、本論文ではPaliGemmaをEnd-to-EndでFine-tuningしている。
4. Semantic World Modelを使った行動計画
4.1 行動系列の評価
学習済みSWMを利用すると、ある行動系列を実行した場合に、目的の状態が実現する確率を予測できる。例えば、ブロックを把持するタスクでは、次のような質問を設定する。
- Q1:ロボットの手はブロックに接触するか?
- Q2:ブロックは把持されるか?
- Q3:ブロックは持ち上がるか?
それぞれに望ましい回答としてYesを設定する。タスクを質問・回答・重みの集合として定義する。
\mathcal{T}
=
\{(Q_i,A_i^*,w_i)\}_{i=1}^{k}
ここで、$A_i^*$ は望ましい回答、$w_i$ は質問の重要度を表す重み。行動系列の評価関数は、
V^{\mathcal{T}}(S,a_{1:n})
=
\sum_{i=1}^{k}
w_i
p_\theta(A_i^*\mid S,a_{1:n},Q_i)
となる。よって、この値が高いほど、目的を達成する可能性が高い行動系列と評価する。なお論文では、行動系列を途中まで実行した段階での達成確率も評価し、早い段階で目標を達成する行動を優先する工夫を導入している。
4.2 Sampling-Based Planning
行動計画の1つ目の方法は、Sampling-Based Planning。論文では、MPPI(Model Predictive Path Integral)を利用している。
処理の流れは以下。
- 複数の行動系列をサンプリングする
- 各行動系列についてSWMで未来の状態を予測する
- 望ましい回答が得られる確率から評価値を計算する
- 評価値の高い行動系列を重視してサンプリング分布を更新する
- この処理を繰り返し、行動を決定する
ここでSWMは、物理シミュレータの代わりに、行動の結果を評価するモデルとして機能する。ただし、VLMは比較的大規模なモデルであるため、多数の行動系列を評価する方法は計算コストが高くなる。
4.3 Gradient-Based Planning
そこで、論文では勾配を利用した行動系列の最適化も提案している。具体的には、まず Base Policy から初期の行動系列を生成する。
\mathbf{a}\sim\pi_b(S)
この行動系列をSWMで評価し、評価関数を最大化するように行動を更新する。
\mathbf{a}
\leftarrow
\mathbf{a}
+
\eta\nabla_{\mathbf{a}}V^{\mathcal{T},c}(S,\mathbf{a})
ここで、$\eta$ は更新幅、$V^{\mathcal{T},c}$ は行動系列の途中経過も考慮した評価関数。SWMの入力には連続値の行動ベクトルが含まれているため、評価値から行動への勾配を計算できる。
この方法では、ランダムに多数の行動を試すのではなく、目的を達成しやすい方向へ行動を直接修正する。本論文では、Base PolicyとしてDiffusion Policyを利用している。
したがって、SWMが最初から行動を生成するのではなく、既存のPolicyが生成した行動をSWMによって改善する構成になっている。
4.4 複数ステップのタスク
本論文では、複数のサブゴールを持つタスクにも対応している。例えば、ブロックを積み重ねるタスクでは、
- ブロックを把持する
- ブロックを別のブロックの上に積む
というサブゴールに分解する。各サブゴールの達成を質問への回答によって判定し、次のサブゴールへ移行する。
このように、意味的な状態を予測するだけでなく、現在の状態に関する質問にも回答することで、タスクの進行管理を実現している。
5. 実験・結果
5.1 実験環境
本論文では、主に2つのシミュレーション環境を使用している。
LangTable
- 言語指示に従って、テーブル上のブロックを操作する環境
- ブロックへの接近、ブロック同士の分離、ブロックの移動などを評価する
- 学習時と異なる色や形状の組み合わせを使用し、未知の条件への汎化性能も評価する
OGBench
- ロボットの操作タスクなどを含むベンチマーク
- 本論文では、キューブへの接近やキューブの積み重ねを評価
5.2 Policy Improvementの結果
SWMを利用してBase Policyの行動系列を改善した場合の結果は以下。
LangTable、OGBench いずれのタスクでも、大きく改善していて、既存のIDQLモデル, AVDモデルより精度が大きく優れている。
- IDQL:Offline Reinforcement Learning
- AVD:Action-Conditioned Video Diffusionによる未来画像予測
これは、未来画像を生成する代わりに、タスクに必要な意味的情報を直接予測することの有効性を示してる。
5.3 MPPIによる行動計画
SWMを利用したMPPIによる行動計画では、次の結果が得られている。
簡単なタスクでは SWMによる行動計画だけでも高い成功率が得られているが、複雑なタスクではMPPIの計算コストが大きいため、Base Policyと勾配ベースの最適化を組み合わせている。
5.4 Suboptimal Dataの効果
本論文では、Expert Data、Suboptimal Data、および両者を混合したデータで学習した場合の未来QA精度を比較している。
Expert Dataだけで学習するよりも、Suboptimal Dataを組み合わせた方が精度がわずかに高くなっています。
これは、成功例だけでなく、失敗例やランダムな行動を含むデータも、環境の状態遷移を学習する上で有用であることを示している。
5.5 未知の環境への汎化性能
学習時と異なる色や形状の組み合わせ、背景色の変化などに対する汎化性能も評価。
例えば、学習時に存在しなかった色と形状の組み合わせを持つブロックの操作や、背景色が変化した環境でのキューブの積み重ねなど。以下が結果。
これらのOut-of-Distribution(OOD)条件でもBase PolicyやAVDを上回る成功率を示している。これは、事前学習済みVLMが持つ視覚・言語に関する知識を、World Modelの学習後もある程度保持しているためと考えられる。ただし、今回の評価は限定されたシミュレーション環境であり、あらゆる未知の物体や実環境に汎化できることが示されたわけではない。
6. 考察
6.1 World Modelの役割を再定義した研究
本論文の重要な点は、World Modelの目的を「未来の観測を再構成すること」から「意思決定に必要な未来の情報を予測すること」へ転換した点である。従来のWorld Modelでは、未来画像や潜在状態を生成する方法が多く研究されてきた。一方、SWMでは、未来の状態に関する質問に回答できれば、行動計画に利用できると考えている。この考え方は、World Modelをより効率的に利用する方向性として興味深い。
ただし、すべてのロボット制御において意味的情報だけで十分というわけではない。例えば、精密な接触力制御や高速な動作では、位置・速度・力などの連続的な物理量の予測が重要になると考えられる。
6.2 VLMとVLAの関係
近年、Physical AIの分野では、VLA(Vision-Language-Action Model)が注目されている。VLAは、画像と言語指示から行動を生成する。
\text{VLA}:\quad
(\text{Image},\text{Language})
\rightarrow
\text{Action}
一方、SWMでは、画像と行動から未来の状態に関する言語的な回答を生成する。
\text{SWM}:\quad
(\text{Image},\text{Action},\text{Question})
\rightarrow
\text{Answer}
論文では、SWMをVLAの逆方向のモデルとして捉える見方も示されている。この2つは競合するだけでなく、組み合わせて利用することができるだろう。
例えば、
- VLAが候補行動を生成する
- SWMが行動後の結果を予測する
- SWMの評価に基づいて行動を修正する
- 修正した行動をロボットが実行する
という構成が考えられる。
6.3 今後の課題
1. 推論時の計算コスト
PaliGemma 3Bを利用しているため、多数の行動系列を評価するには計算コストがかかる。特に、MPPIのようなサンプリングベースの行動計画を高速に実行することは困難。
2. 学習データの生成
今回の実験では、シミュレーション環境から得られる正確な物体位置などの情報を利用してSAQAデータを生成している。しかし、実環境では、このような正解情報を大量に取得することは容易でない。
3. 実ロボットへの適用
本論文の主な評価はシミュレーション環境で実施されている。実環境でのセンサーノイズ、物体の遮蔽、接触力、未知の物理特性などに対して、どの程度の性能が得られるかは今後の検証が必要。
4. 意味的情報と物理的状態の統合
Semantic World Modelは、タスクに関連する意味的な状態の予測を得意とする。一方で、精密なロボット制御には、連続的な位置、姿勢、速度、接触力などの情報も必要。今後は、意味的なWorld Modelと物理的なDynamics Modelを組み合わせる方向も有望か?
参照
- Berg, J., Zhu, C., Bao, Y., Durugkar, I., Gupta, A. (2025). Semantic World Models.
- Beyer, L., et al. (2024). PaliGemma: A versatile 3B VLM for transfer.
- Hafner, D., et al. (2023). Mastering Diverse Domains through World Models.
- Chi, C., et al. (2023). Diffusion Policy: Visuomotor Policy Learning via Action Diffusion.







