AIはコードを書くのが上手になった。でも「そのコードを動かしたら、どんな結果になるか」を当てるのは、実はかなり苦手だ。それを本物のプログラムで測ったら、一番賢いAIでも100問中37問しか当たらなかった、という新しい調査が出た。
これは、AIにプログラムを任せる人みんなに関わる話だ。AIの「たぶんこう動きます」を、そのまま信じてよいのかがわかる。
目次
- 480問で、最高のAIでも37%
- 「読める」と「動かせる」は別の力
- テストを消すのはまだ早い
🧪 480問で、最高のAIでも37%
調べたのは、9月にarXiv(論文を公開するサイト)で出た「SWE-Flux」という検査だ。ベンチマークとは、ひとことで言うと、AIの実力を同じ土俵で測るテストのこと。
問題は、実際に使われている12個の本物のPythonプログラムから作った480問だ。AIにコードを読ませて、動きに関する質問に答えさせる。たとえば「このテストを動かすと変数はいくつになるか」「どこでエラーが出るか」だ。
正解は人が書かない。そのコードを本当に動かし、記録した値を答えにした。だから答えにブレがない。
結果はこうなった。
| モデル | 正解率 |
|---|---|
| GPT-5.4 | 37.71% |
| GPT-5.3-Codex | 33.75% |
| GPT-OSS-20B | 20.62% |
| Gemma-4-31B | 19.17% |
| Gemma-4-4B | 17.29% |
一番できたGPT-5.4でも、4割に届かない。ここでの正解率は「完全一致」、つまり答えがぴったり合った割合だ。
「読める」と「動かせる」は別の力
面白いのは、AIが何につまずくかだ。コードを見て「ここは何をする部分か」を説明するのは、そこそこできる。ところが、ある値がどこで作られてどこへ渡るか、という流れ(データフロー)を追う問題では、正解率が1〜2%まで落ちた。ほぼ全滅だ。
コードを読む : AI →「何が書いてあるか」→ そこそこ当たる
コードを動かす : AI →「実際に何が起きるか」→ ほぼ当たらない
上の図の左が「静かに読む」力、右が「頭の中で走らせる」力だ。AIは前者が得意で、後者が苦手、と読める。実際、ある一部の問題では、入力の数字を少し変えるだけで、100%だった正解率が43%まで崩れた。丸暗記に近く、本当に実行を追えていない証拠だと私は見ている。
テストを消すのはまだ早い
この結果は、現場の実感と重なる。AIは動きそうなコードをすらすら書く。でも「これは3を返します」と言い切った答えが、動かすと違う、という場面はよくある。今回のデータは、その違和感に裏付けを与えた。
だから、AIに「この関数は何を返す?」と聞いて満足してはいけない。返り値が大事なら、実際に動かして確かめる。テストを書く手間は、AIの時代でもまだ減らせない。
今日できる一歩はこれだ。AIにコードの出力を聞いたら、鵜呑みにせず一度自分で走らせてみる。検査の中身は公開されていて(MITライセンス)、誰でも試せる。
✅ 今日覚えること
- AIは「コードを読む」のは得意でも、「動かした結果を当てる」のは苦手。最高でも37%、値の流れはほぼ0%。
- AIの「こう動くはず」は鵜呑みにせず、走らせて確かめる。
※本記事は一次情報の調査をAIが行い、事実確認のうえ執筆・公開しています。