いちばん高いAIモデルが、いちばん賢いのでしょうか。AIモデル23種の性能スコアとAPI料金を1つのグラフに並べて確かめました。答えは「いいえ」です。1位のモデルは2位の約半額で、1位の5%の料金のモデルが1位と13ポイントしか違いません。
性能スコアには Epoch AI の Epoch Capabilities Index(ECI) を使いました。数学、コーディング、科学、推論など数十のベンチマークを1つの尺度にまとめたスコアです。料金は2026年10月4日時点のAPI定価です。
緑の点線上のモデルが コスパのライン です。「もっと安くてもっと賢いモデル」が存在しないモデルです。ラインより下のモデルは、同じかそれ以上のスコアを持つライン上のモデルより高くつきます。
まとめ
| 区分 | モデル | ECI | チャット1万回 |
|---|---|---|---|
| 最高性能 | Claude Opus 5.5 | 167.3 | $182 |
| コスパ | Claude Sonnet 5.5 | 165.2 | $91 |
| 安くて強い | Gemini 3.8 Flash | 156.9 | $25 |
| 最安 | DeepSeek V4 Flash | 154.5 | $9 |
チャット1回は英語で入力1,500 + 出力400トークンです。モデルごとのトークナイザーの差も反映しています。Claude は同じ文章で GPT より約30%多くトークンを使いますが、その差はすでに金額に含まれています。
意外だった3つの点
1. 1位は最も高いモデルではない。 Claude Opus 5.5(167.3)が GPT-6 Astra(166.5)をわずかに上回り、2つは誤差の範囲内です。ところが定価は Astra が $10 / $50、Opus が $4 / $20 なので、チャット1万回で Astra は $350、Opus は $182 です。
2. 「十分に良い」モデルが1位にとても近い。 Claude Sonnet 5.5 は Opus より2.2ポイント低いだけで料金は半分です。Gemini 3.8 Flash と DeepSeek V4 Flash は1位より10〜13ポイント低いものの、費用は7〜20分の1です。分類、情報抽出、要約、一般的なチャットボットならこれで十分なことが多いです。
3. よく使われるモデルにもラインの外がある。 Claude Fable 5.1(チャット1万回 $455)と GPT-5.5($195)はどちらも Sonnet 5.5($91)よりスコアが低く、Gemini 3.1 Pro($74)は Gemini 3.8 Flash($25)より低いです。特定の作業では強いこともありますが、なんとなく使っているなら、まず安いモデルを試してみてください。
GPT-6 Sol は?
Epoch AI はまだ Sol のスコアを出していません。別の尺度の Artificial Analysis Intelligence Index(v4.3.2、最大推論、9月30日)では GPT-6.1 Sol が 51.8、GPT-6 Astra の 52.7 にほぼ並び、料金は5分の1です。Epoch のスコアでも同様なら、Sol は定価が同じ Claude Sonnet 5.5 の隣、コスパのライン上に乗る可能性が高いでしょう。尺度が違うためグラフには載せていません。
リアルタイム版
グラフと表は Epoch のデータと最新の定価から毎日作り直しています。最高性能 / コスパ / 最安の表示をボタンで切り替えられます。
👉 AIモデルの性能と価格ランキング(無料・登録不要)
「料金のわりに物足りないモデル」の表まで入った全文:AIコスパランキング 2026年10月
日本語は英語の約1.79倍のトークンを使うので、日本語のサービスなら上の金額より高くなります。自分のプロンプトがモデルごとにいくらかかるかはトークンカウンターで確認できます。
性能スコア:Epoch AI の Epoch Capabilities Index(CC BY 4.0)。料金:API定価、キャッシュ・バッチ割引なし。
