新しいモデルが出たとき、「お、なんか賢くなったらしい」で済ませていませんか。
公式サイトの棒グラフは目に入るものの、数字が大きいことをなんとなく確認して閉じる。実際の選定は触った印象や界隈の評判、要するに感覚で決めている。私もそうでした。
ただ、あの棒グラフはどれも同じことを測っているわけではありません。 そして厄介なことに、どのモデルが一番賢いかという問いには、答えがありません。 コードを直すのが得意なモデルと、書類を作るのが得意なモデルは、実際に別だからです。
この記事では、ベンチマークを大まかに理解し、自分の用途に合うモデルを判断できるようになることを目指します。
先に結論:用途別のおすすめ
| やりたいこと | おすすめ |
|---|---|
| コードの修正 | GPT-5.6 Sol |
| 環境構築・ターミナル作業 | GPT-5.6 Sol、Claude Fable 5 の2強 |
| 総合力で1つ選ぶ | Claude Fable 5 |
| 報告書や資料づくり | Claude Opus 5 |
| ゲーム制作 | Claude |
| 業務システムのルール通りの操作 | Qwen3.8 Max、Grok 4.6 |
| とにかく安く回す | GPT-5.6 Luna、DeepSeek V4 Flash 0731 |
| 1つで全部そこそこ | Grok 4.6 |
FableとSolが強いあたりは、感覚とだいたい一致すると思います。ベンチマークもそう言っています。
問題はその先です。用途を変えると顔ぶれが入れ替わります。 業務システムの操作で首位を取るのはQwen3.8 Max、コスト効率ではGPT-5.6 Lunaが上位に迫る。どちらも普段の会話ではあまり名前が挙がらないモデルです。
なぜこうなるのかを、以下で見ていきます。
ざっくり2系統に分けて見る
ベンチマークは無数にあって、全部追うのは現実的ではありません。
なので、実際にAIに任せることが多い作業から2系統だけ絞ります。コードまわりと、書類や業務まわり。この2つで大半の用途はカバーできるはずです。
コーディング系(DeepSWE、Terminal-Bench)
バグを直させる、環境を構築させる。テストが通れば正解なので、採点に人間の主観が入りません。
73%と69%なら、本当に73%のほうが多く解けています。
実務・エージェント系(τ³-Banking、GDPval)
報告書を作らせる、顧客対応をさせる。こちらは正解が一つに決まらないので、誰かが優劣を判定しないと点数がつきません。
GDPvalは人間の専門家が見比べて判定します。ただしモデル比較でよく使われる派生版は、その判定を別のAIにやらせています。順位の傾向は追えますが、数字そのものはコーディング系ほど厳密ではありません。
まずは自分の用途がどちらに近いかを決めて、その系統の表だけ見る。ざっくり掴むにはこれで十分だと思います。
コーディング系
コード修正:DeepSWE
実在するリポジトリのバグ報告を渡して、実際に直させます。パッチを書き、既存のテストが通れば正解。
| モデル | スコア | 備考 |
|---|---|---|
| GPT-5.6 Sol | 73% | 独立集計(1タスク$8.39) |
| Claude Fable 5 | 70% | 独立集計(1タスク$21.63) |
| Kimi K3 | 69% | 独立集計(1タスク$4.65) |
| GPT-5.6 Luna | 67.2% | 公式発表 |
| GLM-5.3 | 66.9% | 公式発表 |
| Grok 4.6 | 65.9% | 公式発表 |
| DeepSeek V4 Flash 0731 | 54.4% | 公式発表 |
上位3つは全モデルを同じ条件で回した独立集計です。4位以下は各社の公表値で、測定環境がそれぞれ違うため参考値になります。
スコアは割合に直して見る
Lunaの67.2%が高いのか低いのか、この数字だけでは判断が難しいと思います。
トップを100として何%かに直すと分かりやすいです。67.2 ÷ 73 で92%。Lunaはこのベンチにおいて首位の9割強の能力とざっくり考えればOKです。そして価格は25分の1です。
環境作業:Terminal-Bench
ターミナルの中で作業を完遂させます。パッケージを入れる、ビルドを通す、サーバー設定を直す。採点対象はコードではなく、作業後の環境の状態です。
数字は最新版(v3.0)のものです。ひとつ前のv2.1だと全員が9割前後に張り付いて差が出ないので、こちらを見てください。
| モデル | スコア | 割合 |
|---|---|---|
| GPT-5.6 Sol | 34.6% | 100% |
| Claude Fable 5 | 34.1% | 99% |
| GLM-5.3 | 28.3% | 82% |
| Grok 4.6 | 26% | 75% |
SolとFable 5の2強です。
コード修正では最下位でも9割ありましたが、こちらは3位で8割、4位で4分の3まで落ちます。ここは差がはっきり出る領域なので、安いモデルで代替するという判断が成立しにくいと思います。
なお3位と4位は測定条件が違う(上位2つは最大性能設定、GLM-5.3は別環境で3回平均)ので、順位は確定的ではありません。
番外編
ゲーム制作は専用ベンチを見る
ここまでのベンチはWebフレームワークやコマンドライン作業が題材です。ゲーム制作は画面を見ないと正しさが判断できない作業が多いので、別のベンチが用意されています。
GameCraft-Bench(Godot、140タスク)
自然言語の仕様から遊べるゲームを丸ごと作らせて、実際にプレイして採点します。
| モデル(エージェント) | 総合 | 割合 | 入力 |
|---|---|---|---|
| Claude Opus 5(Claude Code) | 68.44 | 100% | 画像あり |
| Claude Fable 5(Claude Code) | 65.72 | 96% | 画像あり |
| GPT-5.6 Sol(Codex) | 60.50 | 88% | 画像あり |
| Kimi K3(Kimi Code) | 56.96 | 83% | 画像あり |
| DeepSeek V4 Flash 0731(Claude Code) | 40.61 | 59% | テキストのみ |
| GPT-5.5(Codex) | 39.49 | 58% | 画像あり |
| GLM-5.2(Claude Code) | 39.12 | 57% | テキストのみ |
上位2つをClaudeが独占しています。 Opus 5は他の表にほとんど出てこないモデルですが、ここでは首位。画面の見た目や演出まで含めて評価される領域では、Claude系が強いようです。
顔ぶれ自体は汎用ベンチと近いものの、点差は開きます。安く済ませたい場合はDeepSeek V4 Flash 0731が選択肢で、テキスト入力のみでGPT-5.5を上回っています。
トップでも68.44。遊べるゲームを丸ごと作らせるのは、まだ3分の1が欠ける水準です。
非公式テスト:Three.jsで街づくりゲーム
同じ3Dアセットを渡してFable 5・Kimi K3・GPT-5.6 Solを比較した検証があります(Composio)。個人・企業が独自条件で行ったものなので、公式ベンチとは別物として読んでください。
Fable 5が最上位。 ゾーン設置後に段階的に建つ建物、車線に沿って走る車、昼夜モード、電力の需給まで動く状態。影の不具合を直すとき、検証用の小さなシーンを別に作って原因を切り分けた挙動も記録されています。コストは1課題で$73。
Kimi K3が$15でこれに次ぐ結果。 影、車、交通の質感がSolより上で、動作も安定。
GPT-5.6 Solは苦戦。 最初のビルドはCPU使用率が90%を超えて検証者のPCが2回落ち、修正後も車がガタつく状態。ただし速さは圧倒的で22分でした。
Solの順位だけ公式ベンチと食い違いますが、どちらもClaudeを最上位に置く点は一致しています。
画面を見せられるかが効く
GPUカーネルを書かせる検証では、難易度の高い6課題をFable 5・Kimi K3・GPT-5.6 Solのいずれも全問正解しました。差が出るのは速度で、動くものは書けるが最適化はまだ人間の仕事です。
一方でもうひとつの専用ベンチGameDevBenchでは、エディタのスクリーンショットや実行中の動画を見せると成績が上がりました。 上の表で上位が画像入力に偏っているのとも一致します。
モデル選びより先に、画面を見せる仕組みを作れるかを考えたほうがリターンは大きそうです。
実務・エージェント系
コードではなく、仕事そのものを任せられるかを測ります。性格の違う2つがあります。
τ³-Banking:ルール通りに操作できるか
顧客と会話しながら、社内規定に従って業務システムを操作させます。銀行業務が題材です。
難しいのは操作の仕方ではなく、操作していいかの判断のほうです。規定で認められていない要求をされたときに、断ったうえで代替案を出せるか。手順の順序を守れるか。操作そのものが正しくても、やってはいけない場面でやれば失点します。
| モデル | スコア | 割合 |
|---|---|---|
| Qwen3.8 Max | 51.3% | 100% |
| Grok 4.6 | 50.7% | 99% |
| Kimi K3 | 33.4% | 65% |
| GPT-5.6 Sol | 33.0% | 64% |
| GPT-5.6 Luna | 27.2% | 53% |
上位2つが頭ひとつ抜けています。 ただしトップでも51%。半分しか成功しないので、カスタマーサポートを丸ごと任せるにはまだ早い水準です。
GDPval:成果物を作れるか
米国GDPの上位9業種から44職種を選び、実務家(平均14年の経験)が作った1,320件のタスク集です。中身は財務分析のスプレッドシート、コンサルの報告書、法務メモ、看護計画書といった実際の納品物。1件あたり人間なら7〜9時間かかる規模です。
採点は、モデルの成果物と人間の成果物をブラインドで見比べて優劣を付け、勝敗をElo(レーティング)にします。ただしモデル比較でよく使われるGDPval-AA v2では、その判定を人間ではなく別のAIがやっています。 「人間のプロと見分けがつかない」証明ではなく、モデル同士の相対順位として見てください。
| モデル | Elo |
|---|---|
| Claude Opus 5 | 1849 |
| Grok 4.6 | 1753 |
| Claude Fable 5 | 1741 |
| GPT-5.6 Sol | 1728 |
| Kimi K3 | 1679 |
| GPT-5.6 Luna | 1584 |
| DeepSeek V4 Flash 0731 | 1559 |
上位数モデルは誤差の範囲が重なっていて、実質的な差はありません。Qwen3.8 Maxは具体的な数値が公表されておらず、上位陣と区別がつかないとだけ発表されています。
システムを操作させたいならτ³、書類を作らせたいならGDPval。書類づくりはすでに任せられる水準ですが、ルール通りの操作はまだ半分しか成功しません。
スコアと製品が一致している例
この2つで上位に入っているGrok 4.6は、コーディング系だと中位です。数字だけ見ると中途半端に見えるかもしれません。
ただリリースと同じ週に、xAIは実務代行エージェント(Grok Bot)をベータ公開しています。クラウド上に専用の作業環境を持ち、ユーザーの認証情報で既存ツールにログインし、承認が必要なときだけ人間を呼ぶという設計。τ³とGDPvalが測っている能力を、そのまま製品にした形です。
ベンチマークのスコアと、同時に出てくる製品の方向性が一致している。そのモデルが何を狙って作られたのかが、数字と製品の両方から読めるわけで、こういうのが読み解けると面白いですよね。
価格
見るべきはキャッシュ入力の単価です。同じ内容を繰り返し送るとき2回目以降を割引する仕組みで、コードを扱う用途では入力の9割以上がこの価格になります。
| モデル | 入力 | キャッシュ入力 | 出力 |
|---|---|---|---|
| Claude Fable 5 | $10 | $1.00 | $50 |
| GPT-5.6 Sol | $5 | $0.50 | $30 |
| Claude Opus 5 | $5 | $0.50 | $25 |
| Kimi K3 | $3 | $0.30 | $15 |
| Grok 4.6 | $2 | $0.30 | $6 |
| Qwen3.8 Max | $2 | $0.25 | $6 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 |
| DeepSeek V4 Flash 0731 | $0.14 | $0.0028 | $0.28 |
100万トークンあたり。Opus 5のキャッシュ単価は「入力の10%」という規則からの計算値、Grok 4.6のそれは前世代の公表値です。
Fable 5とDeepSeekの差は350倍。 Lunaでも50倍あります。同じ「安い」でも桁が違います。
※ DeepSeek V4 Flash 0731は値上げアナウンスがありますが、公式以外のプロバイダの料金がどうなるか不明なので旧価格で記載しています。
速度
| モデル | 出力速度 |
|---|---|
| DeepSeek V4 Flash 0731 | 121 tok/s |
| GLM-5.3 | 未公表(5.2は108.1 tok/s) |
| Grok 4.6 | 65.8 tok/s |
| GPT-5.6 Sol | 55.7〜65.5 tok/s |
| Kimi K3 | 40.8 tok/s |
推論設定が揃っていないので厳密な横並びではありませんが、Kimi K3が遅い側なのは確かです。同じタスクを終えるのに使うトークン量も多いという測定があり、速さと量が掛け算になるので、待ち時間の体感はスコア差よりも開くかもしれません。
いまのベンチマークは全部が正確性の指標です。エージェント用途では同じ仕事を何分で終えるかのほうが効くはずで、そういう指標が出てきたら評価はまた変わると思います。
ベンチマークはどんどん難しくなっている
ここで一度、数字の前提の話をさせてください。
ベンチマークは、上位モデルが解けるようになると新しい版に差し替わります。最初は小学生のテストで何点取れるかを見ていたのが、中学、高校と基準そのものが上がっていくイメージです。
Terminal-Benchがまさにそれで、ひとつ前の版なら全員が9割前後を取ります。最新版ではトップでも34.6%。モデルの実力は変わっていないのに、テストが変わっただけで数字が3分の1になります。
そして最近は、実務ではまず出会わない水準まで難しくしているベンチもあるように感じます。モデル間の差を測るには、全員が解けてしまう問題では意味がないので、当然といえば当然なのですが。
筆者の体感としても、新しいモデルが出たときの性能差は年々小さくなっています。数字の上では差がついていても、普段の作業で違いを感じる場面は減りました。
だから安くて速いモデルが効いてくる
この前提を踏まえると、低いスコアを見て「使えない」と判断するのはもったいないです。ベンチはモデル同士を比べるための物差しであって、実務の成功率ではありません。
そう考えたとき、DeepSeek V4 Flash 0731のようなモデルの価値が上がります。トップから見れば下位ですが、難化し続けるベンチでこの位置につけているなら、実務の大抵のタスクは片付くはずです。しかもキャッシュ単価は最上位の350分の1、出力速度は最速。
「安いから簡単な作業用」と思っていると本当にそういう使い方しかしなくなるし、一度「大抵のことは片付く」と思って使ってみると、また違った印象になるかもしれません。
まとめ:目的別の組み合わせ
1つのモデルに全部やらせる必要はありません。役割を分けたほうが安く済みます。
性能優先:Claude + OpenAI
| 契約 | 任せる作業 |
|---|---|
| Claude | 報告書や資料づくり、ゲーム制作、全体の司令塔 |
| OpenAI | コード修正、環境構築やターミナル作業 |
得意分野がきれいに分かれるので、この2つでほぼ埋まります。司令塔はFable 5が無難です。総合首位に加えて環境作業でも2位と、長い手順を崩さず運べることが複数のベンチで確認できています。
コスパ優先:xAI + OpenAI
| 契約 | 任せる作業 |
|---|---|
| xAI(Grok 4.6) | 司令塔、環境作業、業務システム操作 |
| OpenAI(Luna) | コード修正 |
Grok 4.6を軸に、コード修正だけ25分の1のLunaに落とす組み方です。コード修正はテストが落ちれば失敗が分かるので、安いモデルでリトライさせても事故りません。逆に環境作業は失敗が検出しづらく、壊れた状態を人間が直す羽目になるので、ここは妥協しないほうがいいと思います。
1つで済ませるなら
開発中心ならOpenAI、資料づくりやゲーム制作が中心ならClaude、全部そこそこで安く済ませたいならxAI。予算を極限まで削るならDeepSeekという手もあります。
ちなみにオープンモデル(DeepSeek, Qwen, Kimi)を使うなら OpenCodeGo のサブスクがおすすめです。初月5ドル(翌月以降10ドル)で、毎月60ドル分使えます。上記はアフィリエイトリンクで、お互いに5ドルボーナスがもらえますので良ければ。
おわりに
数字を並べてみて分かるのは、「どれが一番賢いか」には答えがないということでした。
コード修正の首位はSol、書類づくりはOpus 5、業務システムの操作はQwen3.8 Max、ゲーム制作はClaude勢。用途を変えるたびに顔ぶれが入れ替わります。感覚で選ぶと、ここが見えません。
だから立てるべき問いは「どれが賢いか」ではなく、「自分がやりたいことに合うのは」になります。それさえ決まれば、見るべき表は1つに絞れます。
来月にはこの表も古くなっているはずです。ただ、新しいベンチを見たときに「これはどっちの系統だろう」と一度考える癖さえつけば、次のモデルが出ても自分で判断できます。感覚から一歩出るというのは、たぶんそういうことだと思います。
※スコアは2026年8月時点の公開値です。ベンダー自己申告と第三者測定が混在し、ハーネス・バージョン・推論設定で大きく動きます。判断の前に各ベンチの公式リーダーボードで測定条件ごと確認してください。



