はじめに
こんにちは、やしまです。
先月の記事(Cursorで使えるAIモデル比較 2026/09)から更新です。
今月は本当に動きが激しく、正直ついていくだけで一苦労でした。(実はついていけてない気がします)
Claude Opus 5.5・Sonnet 5.5という新世代がわずか数週間でFable 5.1をベンチマークで追い抜き、GPT-6 AstraもOpenAIから登場しました。
さらにxAIは正式にSpaceXAIへと社名変更し、Grok 4.7を投入。
MetaまでCursorにMuse Spark 1.3を送り込んできて、ついに主要プレイヤーが一通り揃った感があります。
加えてCursor自身の評価基準であるCursorBenchがバージョン4.0に刷新され、数値の見え方も大きく変わりました。
前提
前回と同じく、CursorでAPIキーを設定せずに使えるモデル(のうち使いそうなもの)をAIに比較してもらいます。
比較はもちろん、この記事自体も大半をClaude Sonnet 5に書いてもらっています。
それっぽく載せていますが、前回と同様あくまで自分用の参考です。
(とはいえ最近は課金の都合でほぼほぼAutoで使っています;;)
なお今月からCursorBenchが3.2.0系から4.0系に刷新されており、評価タスクそのものが変わったため、過去の記事に載せていたスコア(70%台など)とは単純比較できません。今回からは4.0系のスコアとして読んでください。
Cursorで使えるAIモデル比較(2026年10月)
Anthropic — Claude
| モデル | コンテキスト | CursorBench 4.0(max) | 得意領域 | API単価(入力/出力 /1Mトークン) | 特徴・備考 |
|---|---|---|---|---|---|
| Claude Opus 5.5 ★ | 1M トークン | 57.8%(トップ) | 自律型コーディング・長期エージェントワークフロー・知識労働 | $4 / $20 | 9/22リリース。Claude 5.5ファミリーの第一弾。Terminal-Bench 4.0で66.4%を記録しGPT-6 Astraの57.9%を上回る。Fable 5.1をほぼ全方面で上回りながら、Opus 5比でも約20%、Fable 5.1比では約60%安い |
| Claude Sonnet 5.5 | 1M トークン | 55.5% | 日常コーディング・ドキュメント作成・エージェント処理 | $2 / $10 | 9/28リリース。Claude 5.5ファミリーの第二弾で、Sonnet 5と同価格のまま性能向上。CursorBench 4.0ではOpus 5(旧世代)を上回る |
| Claude Fable 5.1 | 1M トークン | 51.8% | サイバーセキュリティ・バイオ領域など高リスク/高難度タスクの最高性能 | $10 / $50(キャッシュ読込$0.25) | 9/1リリース。Mythos級ならではの強みは健在だが、Opus 5.5の登場でコスパ面での優位性は大きく薄れた |
| Claude Haiku 4.5 | 200K トークン | — | 補完・分類・高速タスク処理 | $1 / $5 | Claudeラインナップの最軽量モデル。低レイテンシ・低コストで大量の定型タスクを高速に捌く用途に向く |
OpenAI — GPT
| モデル | コンテキスト | ベンチマーク | 得意領域 | API単価(入力/出力 /1Mトークン) | 特徴・備考 |
|---|---|---|---|---|---|
| GPT-5.6 Sol | 1.05M トークン | Terminal-Bench 4.0 37.3% | 最難関コーディング・複雑なエージェントワークフロー | $4 / $20 | 変わらずCursorで利用可能。後述のGPT-6 AstraはCursorには来ないため、OpenAI系の実質フラッグシップはこちらのまま |
| GPT-5.6 Terra | — | — | 日常開発のバランス型 | $2 / $12 | Sol比でかなり安価な中間モデル。日常タスクのデフォルト候補として使いやすい価格帯 |
| GPT-5.6 Luna | — | — | 最速・最安の反復編集向け | $0.20 / $1.20 | GPT-5.6ファミリーの最安モデル。高速・高ボリューム処理に振り切った位置づけ |
Google — Gemini
| モデル | コンテキスト | 得意領域 | API単価(入力/出力 /1Mトークン) | 特徴・備考 |
|---|---|---|---|---|
| Gemini 3.8 Flash ★ | 1M トークン | エージェント・マルチステップツール処理・コーディング | $0.75 / $3.75(〜2026/12/31の導入価格) | 9/2リリース。Flashの急ピッチな改良は一段落し、今月は大きな動きなし |
| Gemini 3.1 Pro | 1M トークン | 全リポジトリ解析・長文脈・科学推論 | $2 / $12 | 変わらず。上位のGemini 3.5 Proは事実上お蔵入りの状態が続いている |
SpaceXAI・Meta・Cursor
| モデル | プロバイダー | コンテキスト | CursorBench 4.0 | 得意領域 | API単価(入力/出力 /1Mトークン) | 特徴・備考 |
|---|---|---|---|---|---|---|
| Grok 4.7 ★ | SpaceXAI | 500K トークン | 46.3%(xhigh) | 長期コーディング・知識労働・自己検証を伴うタスク | $2 / $6 | 9/21リリース。Grok 4.6と同価格・同速度のまま、より大きなベースモデルと長めの強化学習で性能向上。xAIはこの間に正式に「SpaceXAI」へ社名変更 |
| Grok 4.6 | SpaceXAI | 500K トークン | — | 長期エージェント・インタラクティブ/ビジュアル系タスク | $2 / $6 | 変わらずCursorに残っている |
| Grok 4.5 | SpaceXAI | 500K トークン | — | インタラクティブ・エージェントコーディング | $2 / $6 | 変わらずCursorに残っている |
| Muse Spark 1.3 | Meta | 1M トークン | — | 長期・多段階タスク、vibecoding向けの指示追従 | $1.25 / $4.25 | 9/2リリース、9/8にCursorへ追加。CursorにMetaのモデルが加わるのは今回が初 |
| Composer 2.5 | Cursor | — | — | エージェント実行・日常コーディング・高ボリューム処理 | $0.50 / $2.50(スタンダード)/ $3.00 / $15.00(高速) | Cursor自社の対話型コーディングモデル。Kimi K2.5ベースで、日常のエージェント実行や高ボリューム処理に強い |
★ = 各プロバイダーの推奨主力モデル
API単価はトークンベース(Cursor経由では異なる場合あり)
CursorBench 4.0のスコアはCursor公式ドキュメント・各社発表資料に基づく(2026年10月2日時点)
出典: Cursor公式・Anthropic公式・各種ベンチマーク(2026年10月2日時点)
前回からの主な変更点
前回(2026年9月版)との差分をまとめておきます。今月は量が多いです。
- CursorBenchがバージョン4.0に刷新:評価タスクの難度・性質が変わり、スコアの絶対値が全体的に下がった(例:旧版でFable 5.1が73.4%だったところ、新版のmax効果でも51.8%)。前回までの数字と並べての比較は意味をなさなくなったので注意。
- Claude Opus 5.5・Sonnet 5.5 が新登場:9/22・9/28リリース。Opus 5.5はCursorBench 4.0でトップの57.8%、Terminal-Bench 4.0でもGPT-6 Astraを上回る66.4%を記録しつつ、価格はOpus 5比で2割安。Fable 5.1の存在意義がサイバーセキュリティなど一部領域に絞られてきた。
- Claude Opus 5・Sonnet 5 は表から削除:5.5系に置き換わったため除外。
- GPT-6 Astra が登場、ただしCursorには来ない:9/3-9/4にOpenAIがGA。しかし8/28時点でOpenAIは「AstraはCursorには供給しない」と明言しており、実際にCursorの選択肢には追加されていない。詳細は次章。
- Grok 4.7 が新登場:9/21リリース。xAIは今月から正式に「SpaceXAI」へ社名変更。
- Meta「Muse Spark 1.3」がCursorに初参戦:9/2リリース、9/8にCursor対応。これまでAnthropic・OpenAI・Google・xAI系だったラインナップにMetaが加わった。
今後の注目(まだCursorには来ていない/来ないもの)
- GPT-6 Astra(Cursorには供給されない):OpenAIの最新フラッグシップですが、8/28の時点でOpenAI自身が「Astraをモデルとして供給しない先」としてCursorを名指ししています。CursorがSpaceXAI傘下になったことによる競合関係が背景にあると見られ、今後もCursor上でAstraを選べるようになる見込みは薄そうです。ChatGPTやGitHub Copilot経由では使えるので、Cursor以外のワークフローで試すことになりそうです。
- Composer 3:6月のCompileイベントで発表された、SpaceXのColossusクラスタを使った大規模な新モデルの話は継続中ですが、具体的な提供時期はまだ見えていません。
- Grok 5:xAI改めSpaceXAIは「Grok 4.8・4.9を挟んでから」という話をしており、まだ訓練中とのことです。
選び方のポイント
- バランス重視の最上位候補 → Claude Opus 5.5(CursorBench 4.0トップ、価格もFable 5.1よりかなり安い)
- サイバーセキュリティ・バイオなど特殊領域の最高性能 → Claude Fable 5.1(Mythos級の強みはこの領域で健在)
- 日常コーディングのデフォルト → Composer 2.5、Claude Sonnet 5.5、GPT-5.6 Terraあたりのコスパ勢
- 最難関コーディング(OpenAI系で) → GPT-5.6 Sol(Astraが使えない以上、実質的な最上位)
- 長期タスクで自己検証させたい → Grok 4.7(同価格のままGrok 4.6より賢くなった)
- コスト優先・高ボリューム → GPT-5.6 Luna、Gemini 3.8 Flash、Muse Spark 1.3
個人的に使うモデル
今月も正直ベースで書いておきます。
-
普段使いの主力:Claude Sonnet 5.5
- 先月までのSonnet 5から乗り換え中。価格が変わらないままCursorBench 4.0でも旧Opus 5を上回っているので、不満なく移行できている
-
簡単な修正・ルーティン作業:Auto
- 課金の都合もあり、軽いタスクはAutoに任せることが多い。相変わらず一番出番が多い立場は揺るがない
-
変更が多そうなとき:Claude Opus 5.5
- 先月まではOpus 5で様子を見ていたが、5.5がFable 5.1にほぼ並ぶ性能を2割安く出してきたので、もうこちらが第一候補になりそう
終わりに
今月はClaude 5.5ファミリー、GPT-6 Astra、Grok 4.7、Muse Spark 1.3と、主要プレイヤーが一斉に手札を切ってきた印象でした。
中でもGPT-6 AstraがCursorに供給されないという話は、SpaceXAI傘下になったCursorを取り巻く力学を感じさせる出来事で、単なるモデル更新以上に気になるニュースでした。
CursorBenchのバージョンも変わったことですし、来月以降は新しい基準でまた淡々と追いかけていこうと思います。
そういえばClaude AIを開発してるAnthropicさんも「AIは人類にとって破滅的・実存的なリスクになりうる」と書いていました。本家がそう言うくらいのペースで進化しているわけで、このまま突っ走っていいのか、逆に急に規制なんかで止まってしまうのか、ちょっと気になるところです。
内容についての文句は受け付けていませんが、アドバイスや表に追加した方が良さそうな項目などは受け付けていますので気軽に言ってください。
ではでは。