Claude Opus 5.5 は、Opus 5 や Fable 5.1 と比べて本当に速くて安いのでしょうか。effort は low・medium・high のどれを選べばよいのでしょうか。当社では Claude Code に小さな 6 課題と難しい 4 課題を各 3 回解かせ、成功数・時間・費用 (API 換算) を測りました。この記事では、その数字をモデルと effort を選ぶ基準にまとめます。
先に結論です。当社の課題の範囲では、Opus 5.5 は既定の medium で足りました。
- 小さな 6 課題では、Opus 5 (high) と成功数が同じで、時間も費用も少なく済みました。
- 難しい 4 課題では、effort を上げても Fable 5.1 に替えても、成功数に差と言える違いは出ませんでした。
- 増えたのは時間と費用のほうでした。
どんな条件で何を測った?
Claude Code 2.1.283 の非対話モード (claude -p) を macOS で使い、モデルと effort の組ごとに同じ課題を解かせました。実行日は 2026年9月28日 (日本時間) です。
- どの課題も、依存の無い小さな Node.js のプロジェクトです。
- 課題ごとに 3 回ずつ実行しました。1 回の上限は 60 ターン・20 分です。
- 成否はテストの合否だけで判定しました。
- 時間は CLI の起動から終了までで、費用とともに 1 回あたりの中央値です。失敗した回も中央値に含めています。
- 費用は Claude Code が記録した値で、API の定価で換算したものです。実行は Claude の Max プランなので、実際の請求額ではありません。
課題は次の 10 個です。
| 課題の組 | 番号 | 中身 |
|---|---|---|
| 小さな 6 課題 | 1 | 時間の文字列を秒に変える関数を、仕様に合わせて直す |
| 小さな 6 課題 | 2 | CSV の 1 行を仕様どおりに分割する関数を書く |
| 小さな 6 課題 | 3 | 重複している割引の処理を別モジュールに切り出す |
| 小さな 6 課題 | 4 | コマンドライン引数の解析にある不具合 4 件を直す |
| 小さな 6 課題 | 5 | 在庫と注文の 2 モジュールにまたがる不具合を直す |
| 小さな 6 課題 | 6 | 金額を小数のドルから整数のセントへ移行する |
| 難しい 4 課題 | 1 | スナップショットつきの LSM ツリー型キーバリューストアを、コンパクションの規則どおりに作る |
| 難しい 4 課題 | 2 | WHATWG URL 標準に沿って、ブラウザと同じ規則で URL を解析する関数を作る |
| 難しい 4 課題 | 3 | JavaScript と同じ結果を返す正規表現エンジンを作る |
| 難しい 4 課題 | 4 | Node.js の path.win32 と同じ結果を返す Windows パス関数を作る |
小さな 6 課題で Opus 5.5 は Opus 5・Fable 5.1 より速く安い?
はい、当社の実測では速くて安くなりました。Opus 5 (high) を基準にすると、Opus 5.5 (medium) は時間が 0.49 倍、費用が 0.62 倍で、成功数は同じでした。Fable 5.1 (high) と比べても、時間・費用ともに下回っています。
| モデル (effort) | 成功 | 時間 (中央値) | 費用 (中央値・API 換算) | Opus 5 との比 (時間 / 費用) |
|---|---|---|---|---|
| Opus 5.5 (high) | 18/18 | 31 秒 | $0.15 | 0.50 倍 / 0.60 倍 |
| Opus 5.5 (medium・既定) | 18/18 | 30 秒 | $0.16 | 0.49 倍 / 0.62 倍 |
| Opus 5.5 (low) | 18/18 | 23 秒 | $0.12 | 0.37 倍 / 0.49 倍 |
| Opus 5 (high・既定) | 18/18 | 62 秒 | $0.25 | 基準 |
| Fable 5.1 (high・既定) | 18/18 | 39 秒 | $0.34 | 0.63 倍 / 1.34 倍 |
表から読み取れることは 3 つです。
- 成功数に違いがない: 5 つの組がどれも全回で成功しました。この規模の課題では、モデルや effort を変えても成功数は変わりませんでした。
- Opus 5 より安いのは安定している: 課題別に見ても、Opus 5.5 (medium) の費用は 6 課題すべてで Opus 5 (high) を下回りました。各回の範囲も重なっていません。
- medium と high の差は小さい: 時間の差は、多くの課題でばらつきの範囲に収まりました。課題 1 では medium の費用のほうが高く、課題 5 では medium のほうが時間・費用とも低くなりました。どちらが安いかは課題によって変わります。
難しい 4 課題で effort を上げると成功数は増える?
当社の実測では増えませんでした。effort を上げても Fable 5.1 (high) に替えても、差と言える成功数の違いはありませんでした。成功率の差はいちばん大きい組の間で 8 ポイントで、20 ポイント未満のため差としては扱いません。時間と費用の中央値は、effort を上げるほど大きくなりました。
| モデル (effort) | 成功 | 時間 (中央値) | 費用 (中央値・API 換算) | Opus 5.5 (medium) との比 (時間 / 費用) |
|---|---|---|---|---|
| Opus 5.5 (low) | 11/12 | 120 秒 | $0.50 | 0.80 倍 / 0.89 倍 |
| Opus 5.5 (medium・既定) | 12/12 | 150 秒 | $0.57 | 基準 |
| Opus 5.5 (high) | 12/12 | 205 秒 | $0.87 | 1.36 倍 / 1.52 倍 |
| Fable 5.1 (high・既定) | 11/12 | 386 秒 | $2.93 | 2.57 倍 / 5.15 倍 |
課題別に見た effort ごとの傾向は次のとおりです。
- high: 4 課題のすべてで、時間と費用の中央値が medium を上回りました。課題 2 (URL の解析) と課題 4 (Windows のパス関数) では、各回の範囲も重なっていません。
- medium: 12 回のすべてで成功しました。
- low: 4 課題のすべてで、時間の中央値が medium より短くなりました。1 回の失敗は課題 3 (正規表現エンジン) で起きています。
課題ごとの実行は 3 回で、統計的な検定はしていません。low と Fable 5.1 がそれぞれ 1 回失敗したことが、偶然なのか傾向なのかは判断できません。
Fable 5.1 に移る価値はある?(料金と実測の費用)
当社の課題の範囲では、Fable 5.1 に移る理由は見つかりませんでした。定価も実測の費用も Opus 5.5 より高く、成功数は増えなかったためです。
まず定価です。Opus 5.5 の料金は、2026年9月29日 (日本時間) 時点の公式のモデルのページの値です。同じページでは、API のモデル ID は claude-opus-5-5、既定の effort は medium です。公式の Models overview では、Fable 5.1 は入力 $10・出力 $50 / MTok です (MTok は 100 万トークン)。
| モデル | 入力 | 出力 |
|---|---|---|
| Opus 5.5 | $4 / MTok | $20 / MTok |
| Fable 5.1 | $10 / MTok | $50 / MTok |
実測の費用も、2 つの課題の組の両方で Fable 5.1 (high) のほうが高くなりました。
- 小さな 6 課題: Opus 5 との比で、Fable 5.1 (high) の費用は 1.34 倍でした。Opus 5.5 (medium) は 0.62 倍です。
- 難しい 4 課題: Opus 5.5 (medium) との比で、Fable 5.1 (high) は時間が 2.57 倍、費用が 5.15 倍でした。時間・費用の中央値は 4 課題すべてで Opus 5.5 (medium) を上回っています。ただし時間では、課題 3 だけ各回の範囲が重なり、ばらつきの範囲でした。
公式の Choosing a model の案内も、同じ向きです。
- 多くの用途は Opus 5.5 から始める。
- 難しい推論や長時間のエージェント型作業で、xhigh や max でも足りないときに Fable 5.1 へ移る。
- effort の調整は、モデルの切り替えより良い手段であることが多い。
ただし、Fable 5.1 が向くとされる数時間続く作業は、当社では測っていません。
公式発表の「40% 少ない」と実測はどう違う? 権限の拒否でハマる所は?
Anthropic の発表では、Opus 5.5 の費用は Opus 5 より 40% 少ないとされています。当社の 0.62 倍という数字は、この割合を確かめたものではなく、直接は比べられません。当社の比較は、各モデルを既定の effort のまま動かし、小さな課題で CLI の起動から終了までの時間と、API 定価で換算した費用 (請求額ではない) を並べたものだからです。
時間については、表の値とは別の指標も見ました。出力の生成の速さに近い API の時間 1 秒あたりの出力トークンでは、小さな 6 課題の中央値で Opus 5.5 (medium) が Opus 5 (high) の 1.45 倍でした。表の「時間」は CLI 全体の所要時間なので、この指標とは意味が違います。
次に、権限の拒否です。当社は非対話モードに、許可の確認をしない設定を付けて実行しました。
claude -p --permission-mode dontAsk
この形で回すと、ヒアドキュメントのように自動では許可されない形のコマンドが、途中で拒否される回がありました。拒否があった試行は、小さな 6 課題で Opus 5.5 (medium) が 18 回のうち 16 回、Fable 5.1 (high) が 6 回、Opus 5 が 1 回、難しい 4 課題で Opus 5.5 (medium) が 12 回のうち 8 回、Fable 5.1 (high) が 11 回です。測った組の試行の回数は、小さな 6 課題で各 18 回、難しい 4 課題で各 12 回です (Opus 5 は難しい 4 課題を測っていません)。
成否はテストの合否だけで決めています。そのため表の成功数には、拒否を挟みながらテストを通した回も含まれます。
当社の小さな 6 課題では、--permission-mode dontAsk で拒否があった試行は Opus 5.5 (medium) が 18 回のうち 16 回、Opus 5 が 1 回でした。当社の小さな 6 課題では Opus 5.5 のほうが拒否が多く出ましたが、その理由は分かっていません。対話モードで確認を求められる回数が増えるかどうかも未確認です。
結局どのモデルと effort を選べばよい?
Opus 5.5 を既定の medium で使い始め、自分の課題で評価してから上げ下げするのがよいと考えます。当社の実測と公式の案内の両方が、この選び方に合っています。
| 状況 | 選ぶもの | 根拠 |
|---|---|---|
| 通常の開発で、medium で足りる | Opus 5.5 (medium) | 公式は medium から始めるよう勧めています。当社の実測でも全回成功でした |
| medium で足りるが、時間や費用をさらに減らしたい | Opus 5.5 (low) を試す | Effort のページは low を、速さと低い費用が要る単純な作業向けとしています。当社では小さな 6 課題は全回成功、難しい 4 課題は 1 回失敗でした |
| medium で足りない | Opus 5.5 を high・xhigh・max に上げる | Effort のページは high を難しいコーディング向け、xhigh を 30 分を超える長時間の作業向けとしています |
| 数時間続く自律的な作業 | Opus 5.5 (xhigh) を評価する | Effort のページの案内です。当社は測っていません |
| xhigh・max でも足りない | Fable 5.1 へ移る | Choosing a model の案内です |
effort の段階は次のように指定します。起動時に渡した段階は、起動した 1 つのセッションだけに効きます。
claude --effort low
セッション中は /effort high のように段階の名前を続けると、その段階を既定として保存します。ただし -p の非対話モードでは、/effort はそのセッションだけに効き、既定には保存されません。max は、環境変数 CLAUDE_CODE_EFFORT_LEVEL で設定したとき以外は今のセッションだけに効きます。
Opus 5 から移る場合は、既定の effort が違う点に注意してください。Opus 5 の既定は high、Opus 5.5 の既定は medium です。effort を指定しない要求は、Opus 5.5 では 1 段低い medium で動きます。上の実測では、この既定のままで小さな 6 課題の成功数は Opus 5 (high) と同じでした。
この実測で分からないことは?
この記事の数字が当てはまるのは、上の 10 課題を各 3 回、low・medium・high で解かせた範囲だけです。次のような使い方をするなら、自分の課題で測り直す必要があります。
- xhigh と max: 当社では測っていません。Effort のページが長時間の作業に挙げる xhigh の時間と費用は未確認です。
- 長い作業と大きなリポジトリ: 数時間続く作業や、複数のリポジトリにまたがる作業には、この数字を当てはめられません。
- ほかの環境: 対話モードで使う、別の版の CLI を使う、API を直接呼ぶ、JavaScript 以外の言語で書く、といった場合は未確認です。
- 費用の実額: プロンプトキャッシュ・Batch API・Fast mode を使ったときの実額の違いは測っていません。
- 比べていないモデルと組: Sonnet 5・Haiku 4.5 との比較はありません。Opus 5 は小さな 6 課題だけ、Opus 5 と Fable 5.1 は high だけで測っています。
- コードの品質: 採点はテストの合否だけです。読みやすさや変更の大きさを重視するなら、別の評価が要ります。
- 思考の表示の設定: 表示を変えると時間や費用がどう変わるかは、公式の文書にも当社の実測にも情報がありません。
プロンプトキャッシュや Batch API を含む料金の一覧と、Claude Code での effort の設定の手順は、Claude Opus 5.5 完全ガイド|料金・使い方と実測の性能 にまとめています。