1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Claude Opus 5.5 比較|Opus 5・Fable 5.1 と実測、小さな課題で費用は Opus 5 の 0.62 倍

1
Posted at

Claude Opus 5.5 は、Opus 5 や Fable 5.1 と比べて本当に速くて安いのでしょうか。effort は low・medium・high のどれを選べばよいのでしょうか。当社では Claude Code に小さな 6 課題と難しい 4 課題を各 3 回解かせ、成功数・時間・費用 (API 換算) を測りました。この記事では、その数字をモデルと effort を選ぶ基準にまとめます。

先に結論です。当社の課題の範囲では、Opus 5.5 は既定の medium で足りました。

  • 小さな 6 課題では、Opus 5 (high) と成功数が同じで、時間も費用も少なく済みました。
  • 難しい 4 課題では、effort を上げても Fable 5.1 に替えても、成功数に差と言える違いは出ませんでした。
  • 増えたのは時間と費用のほうでした。

どんな条件で何を測った?

Claude Code 2.1.283 の非対話モード (claude -p) を macOS で使い、モデルと effort の組ごとに同じ課題を解かせました。実行日は 2026年9月28日 (日本時間) です。

  • どの課題も、依存の無い小さな Node.js のプロジェクトです。
  • 課題ごとに 3 回ずつ実行しました。1 回の上限は 60 ターン・20 分です。
  • 成否はテストの合否だけで判定しました。
  • 時間は CLI の起動から終了までで、費用とともに 1 回あたりの中央値です。失敗した回も中央値に含めています。
  • 費用は Claude Code が記録した値で、API の定価で換算したものです。実行は Claude の Max プランなので、実際の請求額ではありません。

課題は次の 10 個です。

課題の組 番号 中身
小さな 6 課題 1 時間の文字列を秒に変える関数を、仕様に合わせて直す
小さな 6 課題 2 CSV の 1 行を仕様どおりに分割する関数を書く
小さな 6 課題 3 重複している割引の処理を別モジュールに切り出す
小さな 6 課題 4 コマンドライン引数の解析にある不具合 4 件を直す
小さな 6 課題 5 在庫と注文の 2 モジュールにまたがる不具合を直す
小さな 6 課題 6 金額を小数のドルから整数のセントへ移行する
難しい 4 課題 1 スナップショットつきの LSM ツリー型キーバリューストアを、コンパクションの規則どおりに作る
難しい 4 課題 2 WHATWG URL 標準に沿って、ブラウザと同じ規則で URL を解析する関数を作る
難しい 4 課題 3 JavaScript と同じ結果を返す正規表現エンジンを作る
難しい 4 課題 4 Node.js の path.win32 と同じ結果を返す Windows パス関数を作る

小さな 6 課題で Opus 5.5 は Opus 5・Fable 5.1 より速く安い?

はい、当社の実測では速くて安くなりました。Opus 5 (high) を基準にすると、Opus 5.5 (medium) は時間が 0.49 倍、費用が 0.62 倍で、成功数は同じでした。Fable 5.1 (high) と比べても、時間・費用ともに下回っています。

モデル (effort) 成功 時間 (中央値) 費用 (中央値・API 換算) Opus 5 との比 (時間 / 費用)
Opus 5.5 (high) 18/18 31 秒 $0.15 0.50 倍 / 0.60 倍
Opus 5.5 (medium・既定) 18/18 30 秒 $0.16 0.49 倍 / 0.62 倍
Opus 5.5 (low) 18/18 23 秒 $0.12 0.37 倍 / 0.49 倍
Opus 5 (high・既定) 18/18 62 秒 $0.25 基準
Fable 5.1 (high・既定) 18/18 39 秒 $0.34 0.63 倍 / 1.34 倍

表から読み取れることは 3 つです。

  • 成功数に違いがない: 5 つの組がどれも全回で成功しました。この規模の課題では、モデルや effort を変えても成功数は変わりませんでした。
  • Opus 5 より安いのは安定している: 課題別に見ても、Opus 5.5 (medium) の費用は 6 課題すべてで Opus 5 (high) を下回りました。各回の範囲も重なっていません。
  • medium と high の差は小さい: 時間の差は、多くの課題でばらつきの範囲に収まりました。課題 1 では medium の費用のほうが高く、課題 5 では medium のほうが時間・費用とも低くなりました。どちらが安いかは課題によって変わります。

難しい 4 課題で effort を上げると成功数は増える?

当社の実測では増えませんでした。effort を上げても Fable 5.1 (high) に替えても、差と言える成功数の違いはありませんでした。成功率の差はいちばん大きい組の間で 8 ポイントで、20 ポイント未満のため差としては扱いません。時間と費用の中央値は、effort を上げるほど大きくなりました。

モデル (effort) 成功 時間 (中央値) 費用 (中央値・API 換算) Opus 5.5 (medium) との比 (時間 / 費用)
Opus 5.5 (low) 11/12 120 秒 $0.50 0.80 倍 / 0.89 倍
Opus 5.5 (medium・既定) 12/12 150 秒 $0.57 基準
Opus 5.5 (high) 12/12 205 秒 $0.87 1.36 倍 / 1.52 倍
Fable 5.1 (high・既定) 11/12 386 秒 $2.93 2.57 倍 / 5.15 倍

課題別に見た effort ごとの傾向は次のとおりです。

  • high: 4 課題のすべてで、時間と費用の中央値が medium を上回りました。課題 2 (URL の解析) と課題 4 (Windows のパス関数) では、各回の範囲も重なっていません。
  • medium: 12 回のすべてで成功しました。
  • low: 4 課題のすべてで、時間の中央値が medium より短くなりました。1 回の失敗は課題 3 (正規表現エンジン) で起きています。

課題ごとの実行は 3 回で、統計的な検定はしていません。low と Fable 5.1 がそれぞれ 1 回失敗したことが、偶然なのか傾向なのかは判断できません。

Fable 5.1 に移る価値はある?(料金と実測の費用)

当社の課題の範囲では、Fable 5.1 に移る理由は見つかりませんでした。定価も実測の費用も Opus 5.5 より高く、成功数は増えなかったためです。

まず定価です。Opus 5.5 の料金は、2026年9月29日 (日本時間) 時点の公式のモデルのページの値です。同じページでは、API のモデル ID は claude-opus-5-5、既定の effort は medium です。公式の Models overview では、Fable 5.1 は入力 $10・出力 $50 / MTok です (MTok は 100 万トークン)。

モデル 入力 出力
Opus 5.5 $4 / MTok $20 / MTok
Fable 5.1 $10 / MTok $50 / MTok

実測の費用も、2 つの課題の組の両方で Fable 5.1 (high) のほうが高くなりました。

  • 小さな 6 課題: Opus 5 との比で、Fable 5.1 (high) の費用は 1.34 倍でした。Opus 5.5 (medium) は 0.62 倍です。
  • 難しい 4 課題: Opus 5.5 (medium) との比で、Fable 5.1 (high) は時間が 2.57 倍、費用が 5.15 倍でした。時間・費用の中央値は 4 課題すべてで Opus 5.5 (medium) を上回っています。ただし時間では、課題 3 だけ各回の範囲が重なり、ばらつきの範囲でした。

公式の Choosing a model の案内も、同じ向きです。

  • 多くの用途は Opus 5.5 から始める。
  • 難しい推論や長時間のエージェント型作業で、xhigh や max でも足りないときに Fable 5.1 へ移る。
  • effort の調整は、モデルの切り替えより良い手段であることが多い。

ただし、Fable 5.1 が向くとされる数時間続く作業は、当社では測っていません。

公式発表の「40% 少ない」と実測はどう違う? 権限の拒否でハマる所は?

Anthropic の発表では、Opus 5.5 の費用は Opus 5 より 40% 少ないとされています。当社の 0.62 倍という数字は、この割合を確かめたものではなく、直接は比べられません。当社の比較は、各モデルを既定の effort のまま動かし、小さな課題で CLI の起動から終了までの時間と、API 定価で換算した費用 (請求額ではない) を並べたものだからです。

時間については、表の値とは別の指標も見ました。出力の生成の速さに近い API の時間 1 秒あたりの出力トークンでは、小さな 6 課題の中央値で Opus 5.5 (medium) が Opus 5 (high) の 1.45 倍でした。表の「時間」は CLI 全体の所要時間なので、この指標とは意味が違います。

次に、権限の拒否です。当社は非対話モードに、許可の確認をしない設定を付けて実行しました。

claude -p --permission-mode dontAsk

この形で回すと、ヒアドキュメントのように自動では許可されない形のコマンドが、途中で拒否される回がありました。拒否があった試行は、小さな 6 課題で Opus 5.5 (medium) が 18 回のうち 16 回、Fable 5.1 (high) が 6 回、Opus 5 が 1 回、難しい 4 課題で Opus 5.5 (medium) が 12 回のうち 8 回、Fable 5.1 (high) が 11 回です。測った組の試行の回数は、小さな 6 課題で各 18 回、難しい 4 課題で各 12 回です (Opus 5 は難しい 4 課題を測っていません)。

成否はテストの合否だけで決めています。そのため表の成功数には、拒否を挟みながらテストを通した回も含まれます。

当社の小さな 6 課題では、--permission-mode dontAsk で拒否があった試行は Opus 5.5 (medium) が 18 回のうち 16 回、Opus 5 が 1 回でした。当社の小さな 6 課題では Opus 5.5 のほうが拒否が多く出ましたが、その理由は分かっていません。対話モードで確認を求められる回数が増えるかどうかも未確認です。

結局どのモデルと effort を選べばよい?

Opus 5.5 を既定の medium で使い始め、自分の課題で評価してから上げ下げするのがよいと考えます。当社の実測と公式の案内の両方が、この選び方に合っています。

状況 選ぶもの 根拠
通常の開発で、medium で足りる Opus 5.5 (medium) 公式は medium から始めるよう勧めています。当社の実測でも全回成功でした
medium で足りるが、時間や費用をさらに減らしたい Opus 5.5 (low) を試す Effort のページは low を、速さと低い費用が要る単純な作業向けとしています。当社では小さな 6 課題は全回成功、難しい 4 課題は 1 回失敗でした
medium で足りない Opus 5.5 を high・xhigh・max に上げる Effort のページは high を難しいコーディング向け、xhigh を 30 分を超える長時間の作業向けとしています
数時間続く自律的な作業 Opus 5.5 (xhigh) を評価する Effort のページの案内です。当社は測っていません
xhigh・max でも足りない Fable 5.1 へ移る Choosing a model の案内です

effort の段階は次のように指定します。起動時に渡した段階は、起動した 1 つのセッションだけに効きます。

claude --effort low

セッション中は /effort high のように段階の名前を続けると、その段階を既定として保存します。ただし -p の非対話モードでは、/effort はそのセッションだけに効き、既定には保存されません。max は、環境変数 CLAUDE_CODE_EFFORT_LEVEL で設定したとき以外は今のセッションだけに効きます。

Opus 5 から移る場合は、既定の effort が違う点に注意してください。Opus 5 の既定は high、Opus 5.5 の既定は medium です。effort を指定しない要求は、Opus 5.5 では 1 段低い medium で動きます。上の実測では、この既定のままで小さな 6 課題の成功数は Opus 5 (high) と同じでした。

この実測で分からないことは?

この記事の数字が当てはまるのは、上の 10 課題を各 3 回、low・medium・high で解かせた範囲だけです。次のような使い方をするなら、自分の課題で測り直す必要があります。

  • xhigh と max: 当社では測っていません。Effort のページが長時間の作業に挙げる xhigh の時間と費用は未確認です。
  • 長い作業と大きなリポジトリ: 数時間続く作業や、複数のリポジトリにまたがる作業には、この数字を当てはめられません。
  • ほかの環境: 対話モードで使う、別の版の CLI を使う、API を直接呼ぶ、JavaScript 以外の言語で書く、といった場合は未確認です。
  • 費用の実額: プロンプトキャッシュ・Batch API・Fast mode を使ったときの実額の違いは測っていません。
  • 比べていないモデルと組: Sonnet 5・Haiku 4.5 との比較はありません。Opus 5 は小さな 6 課題だけ、Opus 5 と Fable 5.1 は high だけで測っています。
  • コードの品質: 採点はテストの合否だけです。読みやすさや変更の大きさを重視するなら、別の評価が要ります。
  • 思考の表示の設定: 表示を変えると時間や費用がどう変わるかは、公式の文書にも当社の実測にも情報がありません。

プロンプトキャッシュや Batch API を含む料金の一覧と、Claude Code での effort の設定の手順は、Claude Opus 5.5 完全ガイド|料金・使い方と実測の性能 にまとめています。

1
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?