新しいAIモデルが発表されるたび、決まって同じゲームの名前を見かける。「ポケモン赤を殿堂入りさせた」「ポケモンをクリアした最速記録」。GPT系、Gemini系、Claude系と、方式も企業もまったく異なるAIたちが、なぜか同じ土俵を選び続けている。
これは偶然ではない。ゲーム攻略という見出しの裏には、AIの性能を世に示すための、かなり合理的な計算がある。そしてその合理性の裏側に、見出しだけを読むと見落としてしまう落とし穴も潜んでいる。
なぜ「ゲーム攻略」が選ばれるのか
AIの能力を外部に示すための試験(ベンチマーク)として、ゲーム攻略には三つの都合のよさがある。
第一に、成功と失敗の基準がだれの目にも明らかで、しかも偽りにくい。難解な数学の証明や論文の質は専門知識がないと評価できないが、「殿堂入りした」「四天王を倒した」はゲームを知っている人なら一目で判定できる。ゴールは動かず、プレイ過程はログに残り、最終状態(倒したポケモン、手持ち、経過時間)も検証できる。おまけに盤面はプレイのたびに実行時に作られるため、静的な問題集で疑われがちな「学習データに問題と正解が最初から混ざっている(ベンチマーク汚染)」も起きにくい。客観的に判定でき、外から結果を偽ることが難しい——この一点だけでも、発表の土俵として強い。
第二に、単発の賢さでは解けない構造になっている。一問一答のクイズに強いAIはいくらでもいるが、ゲーム攻略は数十時間にわたる計画・記憶・失敗からの立て直し・見知らぬ状況への対応を要求する。目の前の一手だけでなく、何時間も先を見据えた戦略を保ち続けられるか——賢さの「持続性」を測るのに向いている。
第三に、単純に絵になる。棒グラフの数字よりも、「AIがゲームをクリアした」という一文の方が、専門家でない人にも一瞬で伝わり、共有される。技術的な成果を世に見せるための「装置」として機能する。
その裏で、測ったものが曖昧になる
ここまでは、ゲーム攻略が測る側にとって都合のいい理由だ。しかし同じ理由が、見出しの読み手にとっては別の顔を見せる。
たとえば直近では、AI企業のTypeSafe AIが、大規模言語モデル(LLM、文章を生成する形式のAI)とは異なる「意思決定モデル」という方式のAI「Jev」を使い、「ポケットモンスター 赤」を37時間40分で殿堂入りさせたという発表があった。下した判断は計16,150回、途中で16回も全滅しながらの到達だった(費用はおよそ1.65ドル)。数字だけ見れば、たしかに長時間・大量の判断を経た達成に見える。
だがこの発表には、もう一つ重要な情報が添えられている。Jevは単体でこのゲームをクリアしたわけではない。ゲームボーイのエミュレータのメモリから状態を読み取る仕組みや、マップ上の移動を担う経路探索アルゴリズム(A*、目的地までの最短ルートを機械的に計算する手法)が別に用意されており、Jev自身が担っていたのは戦闘中の選択や次の目的地の決定といった、ゲーム進行上の判断部分だけだった。しかも攻略ガイドはあらかじめ設定として与えられている。もしこうした補助(足場、英語ではスキャフォールディングと呼ばれる、AI本体の周りに用意する支援の仕組み)を一切外し、モデルに完全な自律行動をさせたら、マサラタウンから一歩も出られないという注記まで公開されている。ソースコード自体はGitHubで公開されており、この構成は誰でも確認できる。
つまり「クリアした」という一文の中には、モデル本体がやったことと、周りに用意された足場がやったことが混在している。もし足場を厚くすればするほどクリアが容易になるなら、「クリアできた」という結果だけでは、モデルの実力がどこにあるのかがむしろ見えにくくなる。ゲーム攻略は、成功をだれの目にも分かる形で可視化する装置であると同時に、その成功のうちどこを誰が担ったのかを覆い隠しうる装置でもある。
見出しを読むときに問うべきこと
だから、「AIが〇〇をクリアした」という見出しに出会ったとき、最初に浮かぶべき問いは「すごいのか、すごくないのか」ではない。それはむしろ、この達成がモデルの何を・どこまで示しているのかという問いのはずだ。具体的には、次の二点を分けて見る。
一つは、足場が何を肩代わりしたか。状態の認識(いま何が起きているかを把握する処理)、移動やルート計算のような機械的に解ける部分、事前に与えられた攻略知識。これらはモデルの「賢さ」ではなく、周囲の設計の巧みさを反映している部分だ。
もう一つは、モデル自身が何を担ったか。今回の例で言えば、戦闘での技の選択や、次に何を目指すかという意思決定の連続。ここにこそ、そのAI方式が持つ長期の計画力や判断の質が表れている。ただし、その「次に何を目指すか」も、あらかじめ与えられた攻略ガイドにどこまで沿っただけなのかは、公開情報からは切り分けにくい。モデルの手柄に見える部分にも、足場の影は及びうる——だからこそ、両者を分けて見る意味がある。
この二つを分けて見る癖がつくと、似たような見出しが続いたときの解像度が上がる。「今回はどこまでを機械的な補助に任せ、どこからをモデルの判断に任せたのか」を確認するだけで、複数の発表を横並びで比較できるようになる。逆に、足場の情報が公開されていない発表に出会ったら、それ自体が一つの警戒信号になる——検証可能性を差し出さない成功は、そもそも比較の土台に乗らない。
派手な見出しに心を動かされるのは自然なことだ。ただ、その先で「何が測られたのか」を一段掘って確かめる視点を持つ人と持たない人では、次に似た発表を見たときの受け取り方がまるで違ってくる。
発表の見出しをそのまま受け取らず、実際に開発者の現場で何が使われ・参照されているのかを自分で確かめたい人へ。そうした裏づけを、技術記事での被引用データから定点観測している場所がある。
(本文中の数値・仕組みの記述は、GIGAZINE 2026年9月28日の記事で公開された内容にもとづく。それ以外の固有の数値・主張は本記事内で創作していない。)