Claude Opus 5登場!ベンチマーク分析・価格・Fable 5 / GPT-5.6との徹底比較
Anthropic社から、新たなフラッグシップ級モデル Claude Opus 5 が正式にリリースされました。
「フロンティア級の知性を備えながら、上位モデル Claude Fable 5 の半額」という非常に魅力的な価格設定(100万 input tokenあたり$5 / 100万 output tokenあたり$25)で提供されています。
さらに注目すべきは、単なる低価格化にとどまらず、Frontier-Bench や GDPval-AA などのコーディングおよびナレッジワーク系ベンチマークにおいて、格上の Fable 5 を凌駕するパフォーマンスを叩き出している点です。
本記事では、Claude Opus 5 の概要、各種ベンチマーク結果、競合モデル(GPT-5.6、Gemini 3.6 等)との詳細な比較、ならびに開発者向けの新機能について徹底解説します。
📌 エグゼクティブ・サマリー(主要ポイント)
- 発売日・価格: 2026年7月24日リリース。入力 $5 / 出力 $25 (100万トークンあたり)。Fable 5 の半額。
- GDPval-AA v2 で首位: 1,861 Elo を記録し、Fable 5 (1,747) や前世代の Opus 4.8 (1,593) を大幅に上回る。
- ARC-AGI-3 での圧倒的飛躍: Opus 4.8 の 1.5% から 30.2% へと約20倍の大幅向上。
- 最高の安全性・アライメント: 逸脱行動(Misaligned-behavior)監査スコアで 2.3 を記録し、同社史上最高の安全性を達成。
- 実務に強いエージェント性能: 単にそれらしい回答で終わらせず、目標達成まで自律的に試行錯誤を繰り返す粘り強さ(Agentic Persistence)を実装。
💡 Claude Opus 5 とは?
Opus 5 は、Anthropicのモデルポートフォリオにおいて Mythos 5 に次ぐ位置づけ(Sonnet や Haiku の上位)となるモデルです。
Anthropicは本モデルを「思慮深く、能動的(Thoughtful and Proactive)」と表現しており、AIエンジニアや日常的な自動化タスクにおいて常時稼働させるエージェントとしての利用を想定しています。
特にコーディングや知識労働評価(Frontier-Bench、GDPval-AAなど)においては、サイバーセキュリティ専用タスクを除き、Anthropicの提供する利用可能なモデルの中で最高峰の性能を示しています。
🚀 Claude Opus 5 の主な新機能と進化点
Opus 5 の進化において特に顕著なのが 「タスク完遂への粘り強さ(Agentic Persistence)」 と 「ビジュアル出力精度の向上」 です。
1. タスクを最後までやり遂げる自律性(Agentic Persistence)
従来のモデルは、一見正しそうな回答を出力した段階で処理を終了してしまう傾向がありました。しかし Opus 5 は、課題が解決するまで自律的にループと検証を繰り返す姿勢が大幅に強化されています。
-
ケーススタディ 1 (コンピュータビジョン):
CAD等の設計図を直接閲覧するツールがない環境において、Opus 5 は生のピクセルデータから幾何学構造を抽出するコンピュータビジョン・パイプラインを自らコード化して解決しました。 -
ケーススタディ 2 (オープンソースのバグ修正):
人気パッケージマネージャーの既存バグ修正依頼に対し、表面的なパッチを当てるのではなく、根本原因(Root Cause)を特定して修正を完了させました。 -
ケーススタディ 3 (金融データパイプライン):
取引企業のエンジニアが Opus 5 を使用し、新取引所向けの市場データパイプラインとロジック検証用のテストハーネスを1セッション内で構築完了させました。
2. 生成ビジュアル出力の質的向上
風洞(Wind-tunnel)シミュレーションのような、流体力学や空力流線の可視化コード・ダイアグラムの生成能力が格段に向上しました。設計図やアーキテクチャ図、各種チャート生成タスクにおいて高い表現力を発揮します。
📊 Anthropic 社内モデルとのベンチマーク比較
Opus 5 と、Anthropic の歴代・現行モデルとの比較は以下の通りです。
| ベンチマーク | Haiku 4.5 | Sonnet 4.6 | Opus 4.7 | Opus 4.8 | Sonnet 5 | Fable 5 | Claude Opus 5 |
|---|---|---|---|---|---|---|---|
| SWE-bench Verified | 73.3% | 79.6% | 87.6% | 88.6% | — | 95.0% | 96.0% |
| SWE-bench Pro | — | 58.1% | 64.3% | 69.2% | 63.2% | 80.3% | 79.2% |
| Terminal-Bench 2.1 | 41.0% | 67.0% | 69.4% (2.0) | 74.6% | 80.4% | 88.0% | 未公開 |
| Frontier-Bench v0.1 | — | — | — | 18.7% | — | 33.7% | 43.3% |
| GDPval-AA v2 (Elo) | — | — | 1,753 (v1) | 1,593 (v2) | 1,618 (v2) | 1,747 (v2) | 1,861 (v2) |
| 逸脱行動監査スコア (低いほど良) | — | — | — | 未公開 | 未公開 | 未公開 | 2.3 (過去最高) |
| 価格 (USD / 1M token in/out) | $1 / $5 | $3 / $15 | $5 / $25 | $5 / $25 | $2-3 / $10-15 | $10 / $50 | $5 / $25 |
Fable 5 および Opus 4.8 との比較考察
- vs Fable 5: 価格が Fable 5($10/$50)の**半額($5/$25)**でありながら、Frontier-Bench v0.1(43.3% vs 33.7%)や GDPval-AA v2(1,861 vs 1,747)で Fable 5 を明確に凌駕しています。
- vs Opus 4.8: わずか2ヶ月前にリリースされた Opus 4.8 と比較しても、ARC-AGI-3 で 1.5% → 30.2%、Frontier-Bench で 18.7% → 43.3% と、異次元の世代間ジャンプを遂げています。
⚔️ 競合モデルとの比較(GPT-5.6 / Gemini 3.6)
主要AIラボ(Anthropic, OpenAI, Google)の公式発表数値を元にした比較一覧です。
| カテゴリ | ベンチマーク | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Sol Ultra | GPT-5.6 Terra | GPT-5.6 Luna | GPT-5.5 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|---|---|---|---|
| ナレッジ | GDPval-AA v2 (Elo) | 1861 | 1736 | — | 1593 | 1591.8 | 1493.7 | 1421 | — | 1348.8 | 962.3 |
| Coding | SWE-Bench Pro | 79.2% | 64.6% | — | 63.4% | 62.7% | 59.4% | — | 54.2% | — | 54.2% |
| Coding | DeepSWE v1.1 | 68.8% | 72.7% | — | 69.6% | 67.2% | 67.0% | 49.0% | — | 37.0% | 11.8% |
| Coding | Terminal-Bench 2.1 | — | 88.8% | 91.9% | 87.4% | 84.7% | 85.6% | — | 54.0% | — | 70.7% |
| Coding | Frontier-Bench v0.1 | 43.3% | 37.5% | — | — | — | — | — | — | — | — |
| Computer Use | BrowseComp | 90.8% | 90.4% | 92.2% | 87.5% | 83.3% | 84.4% | — | — | — | 85.9% |
| Computer Use | OSWorld 2.0 | 70.6% | 62.6% | — | 50.2% | 45.6% | 47.5% | — | — | — | — |
| 抽象推理 | ARC-AGI-3 | 30.2% | 7.78% | — | 0.8% | 0.18% | 0.43% | — | — | — | 0.42% |
| ツール利用 | AutomationBench | 26.0% | 18.1% | — | 15.2% | 14.9% | 12.9% | — | — | 14.5% | — |
⚠️ 注記: 各数値は各AIラボが自社発表した評価ハーネスやプロンプト設定に基づく測定値です。相対的な傾向を示す参考指標としてご活用ください。
各モデルとの対比分析
-
vs GPT-5.6 Sol:
- Opus 5の強み: 抽象的思考・未知のタスク(ARC-AGI-3、Frontier-Bench、AutomationBench、OSWorld 2.0)で大きくリード。オープンエンドな問題解決に優れる。
- GPT-5.6 Solの強み: 長期的なコーディングタスク(DeepSWE v1.1)や特定ターミナル操作で優勢。
-
vs Gemini 3.6 Flash:
- 近年の Gemini は Flash 系のコスト効率モデルに注力しているため、フラッグシップ級である Opus 5 とは直接の競合となっていません。
🛠️ 価格・API仕様および開発者向け機能
1. APIアクセス・価格
-
モデル識別子 (Model String):
claude-opus-5 - 標準料金: 入力 $5.00 / 100万トークン、出力 $25.00 / 100万トークン
- Fast Mode: 通常速度の約2.5倍で動作する高速モード(API料金は基本の2倍)。
2. 会話途中のツール切り替え(Mid-conversation Tool Switching - Beta)
Claude Platform において、セッションの途中で利用可能なツール定義を変更できるようになりました。重要なポイントとして、ツール定義を変更しても プロンプトキャッシュ(Prompt Cache)が無効化されません。長文コンテキストを保持したまま柔軟なマルチステップワークフローを構築可能です。
3. 自動セーフティ・フォールバック(Automatic Safety Fallback - Beta)
Opus 5 や Fable 5 のセーフティ分類器によってフラグが立ったリクエストについて、エラーで完全ブロックするのではなく、利用可能な別モデルへ自動リレー処理(ルーティング)を行う機能が導入されました。APIトラフィックの可用性が大きく向上します。
📝 まとめ
Anthropic はモデル性能の底上げと価格破壊を同時に進めています。今回リリースされた Claude Opus 5 は、上位モデル Fable 5 の半額のコストでありながら、実際の高度なコーディングや自律エージェント型タスクでそれを上回る成果を実証しました。
特に ARC-AGI-3 での 30.2% 達成 や エージェント的粘り強さ(Agentic Persistence) は、今後のAIアプリケーション開発において大きなパラダイムシフトをもたらすと考えられます。
本記事は AI 業界の最新動向に基づいて作成されています。