0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

コードは読めても動かした結果は当てられないAI、最高でも37%しか当たらない

0
Posted at

AIはコードを書くのが上手になった。でも「そのコードを動かしたら、どんな結果になるか」を当てるのは、実はかなり苦手だ。それを本物のプログラムで測ったら、一番賢いAIでも100問中37問しか当たらなかった、という新しい調査が出た。

これは、AIにプログラムを任せる人みんなに関わる話だ。AIの「たぶんこう動きます」を、そのまま信じてよいのかがわかる。

目次

  • 480問で、最高のAIでも37%
  • 「読める」と「動かせる」は別の力
  • テストを消すのはまだ早い

🧪 480問で、最高のAIでも37%

調べたのは、9月にarXiv(論文を公開するサイト)で出た「SWE-Flux」という検査だ。ベンチマークとは、ひとことで言うと、AIの実力を同じ土俵で測るテストのこと。

問題は、実際に使われている12個の本物のPythonプログラムから作った480問だ。AIにコードを読ませて、動きに関する質問に答えさせる。たとえば「このテストを動かすと変数はいくつになるか」「どこでエラーが出るか」だ。

正解は人が書かない。そのコードを本当に動かし、記録した値を答えにした。だから答えにブレがない。

結果はこうなった。

モデル 正解率
GPT-5.4 37.71%
GPT-5.3-Codex 33.75%
GPT-OSS-20B 20.62%
Gemma-4-31B 19.17%
Gemma-4-4B 17.29%

一番できたGPT-5.4でも、4割に届かない。ここでの正解率は「完全一致」、つまり答えがぴったり合った割合だ。

「読める」と「動かせる」は別の力

面白いのは、AIが何につまずくかだ。コードを見て「ここは何をする部分か」を説明するのは、そこそこできる。ところが、ある値がどこで作られてどこへ渡るか、という流れ(データフロー)を追う問題では、正解率が1〜2%まで落ちた。ほぼ全滅だ。

コードを読む   : AI →「何が書いてあるか」→ そこそこ当たる
コードを動かす : AI →「実際に何が起きるか」→ ほぼ当たらない

上の図の左が「静かに読む」力、右が「頭の中で走らせる」力だ。AIは前者が得意で、後者が苦手、と読める。実際、ある一部の問題では、入力の数字を少し変えるだけで、100%だった正解率が43%まで崩れた。丸暗記に近く、本当に実行を追えていない証拠だと私は見ている。

テストを消すのはまだ早い

この結果は、現場の実感と重なる。AIは動きそうなコードをすらすら書く。でも「これは3を返します」と言い切った答えが、動かすと違う、という場面はよくある。今回のデータは、その違和感に裏付けを与えた。

だから、AIに「この関数は何を返す?」と聞いて満足してはいけない。返り値が大事なら、実際に動かして確かめる。テストを書く手間は、AIの時代でもまだ減らせない。

今日できる一歩はこれだ。AIにコードの出力を聞いたら、鵜呑みにせず一度自分で走らせてみる。検査の中身は公開されていて(MITライセンス)、誰でも試せる。

✅ 今日覚えること

  • AIは「コードを読む」のは得意でも、「動かした結果を当てる」のは苦手。最高でも37%、値の流れはほぼ0%。
  • AIの「こう動くはず」は鵜呑みにせず、走らせて確かめる。

※本記事は一次情報の調査をAIが行い、事実確認のうえ執筆・公開しています。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?