0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

じゃあSonnet5で回していたタスクはどのモデルに変えればいいの?Sonnet5.5なの?Haiku5.5なの?effortは?どれに変えればいいの??

0
Posted at

はじめに

こんにちは、もんすんです。

Sonnet 5.5 と Haiku 5.5 が出ました。
そして世の中には、こういう比較記事が溢れていますね。

  • Sonnet 5.5 vs Sonnet 5
  • Sonnet 5.5 vs Haiku 5.5
  • Sonnet 5.5 vs GPT-6?6.1?

なるほど、新しいモデルは前のモデルより強いんですね〜!
ためになったねぇ〜〜〜!

???

いやいやいやいや、、本当にみんなこれで満足なのか!?
新モデルの発表のたびにただ公式サイトに書かれてることをそのままコピーしたような記事出すの、そろそろやめてくれません!?

正直Proプランで毎日 claude -p を cron で回している私が知りたいのは、そこじゃないなと思い、本記事を書くことにしました。

私が知りたいのは、

「これまでSonnet 5 の medium で回している仕事は、何に差し替えれば、同じ品質のまま安くなるのか」

です。
この問いに、誰も答えてくれません。。

公式のページは、世代が隣同士のモデルしか比べてくれません。

しかもグラフは「見て分かる」だけで、表になっていません。
というわけで、公式のグラフを SVG から数値に起こして、自分で置換表を作りました。
さらに、自分の cron を実際に各モデルで回して、答え合わせまでしてみました。

この記事の対象・ゴール・結論

  • 対象: claude -p や cron で、Sonnet 5 / Opus 5 を使い続けている個人(特にProプラン)
  • ゴール: 「Sonnet 5 の medium / high / xhigh、Opus 5 の medium / high / xhigh から、5.5 世代のどのモデル × effort に乗り換えるか」を決められること
  • 結論: コード変更系は Sonnet 5.5 へ、資料作成・調査・要約・定型処理は Haiku 5.5 へ。私の cron は Haiku 5.5 で 1 回あたりのコストが約 1/20 になりそう
  • データは 2026/10/08 時点で公式ページに載っていた値です

置換表

「今までの設定」に対して、同じ公式ベンチマークで、同等以上のスコアを、より低いコストで出せる 5.5 世代の設定を並べました。

今までの設定 コード変更・レビュー系 資料作成・調査・要約系 定型処理(分類・整形・抽出)
Sonnet 5 medium Sonnet 5.5 medium(約16倍安) Sonnet 5.5 low(約2倍安) Haiku 5.5(私の cron で約20倍安)
Sonnet 5 high Sonnet 5.5 high(約15倍安) Sonnet 5.5 low(約4.3倍安) Haiku 5.5 high(要検証)
Sonnet 5 xhigh Sonnet 5.5 high(約24倍安) Sonnet 5.5 medium(約4.6倍安) Haiku 5.5 high(要検証)
Opus 5 medium Opus 5.5 medium(約5.7倍安)※ Haiku 5.5 xhigh(約5.1倍安) ―
Opus 5 high Sonnet 5.5 high(約2〜18倍安)※※ Haiku 5.5 max(約3.5倍安) ―
Opus 5 xhigh Sonnet 5.5 high(約2.5〜21倍安)※※ Sonnet 5.5 xhigh(約2.6倍安) ―

※ FrontierCode では Sonnet 5.5 のどの effort も Opus 5 medium に届かず、Opus 5.5 medium が最安でした。CursorBench だけなら Sonnet 5.5 high(約4.2倍安)で足ります。

※※ 倍率の下限は Terminal-Bench 4.0(Sonnet 5.5 は high ではなく xhigh が必要で約2〜2.5倍安)、上限は FrontierCode です。

「約◯倍安」は 公式グラフの「1タスクあたりのコスト」の比 で、幅があるのは複数のベンチマークで結果が違ったためです。単位は API 単価換算の USD です。
(Pro の実際の制約は後述の使用枠)

表を作る上で。

  1. 公式の発表ページは、そのモデルと隣のモデルしか載せません。Sonnet 5.5 のページには Sonnet 5 と Opus 5.5、Haiku 5.5 のページには Haiku 4.5 と Sonnet 5.5。Opus 5 と Haiku 5.5 は、どのページにも同じグラフに出てきません。
  2. 載っているベンチマークがページごとに違います。
  3. グラフは見て分かるだけで、数値表がありません。

「Haiku 5.5 は Sonnet 5 の何に相当するのか」には、公式のどのページも直接答えてくれないのです。

公式グラフで effort 別の点が揃っているのは一部
各モデルについて、公式グラフに「effort 別の点」があるベンチマーク(色付き)と、ないもの(灰色)

この表のとおり、複数ページのグラフをつなぐと、はじめて次のことができます。

  • Opus 5 と Opus 5.5 は、Sonnet 5.5 のページと Opus 5.5 のページ両方に Opus 5.5 が載っているのでつながる
  • Haiku 5.5 と Opus 5 は、GDPval-AA と Terminal-Bench 4.0 で同じ物差しに乗る
  • 一方で、Haiku 5.5 を Sonnet 5 の effort 別に直接当てられる共通のベンチマークはない(ここは後で正直に書きます)

データはどう作ったか

公式ページのグラフは、ページ内のインライン SVG です。
点の座標と軸の目盛りの位置が残っているので、軸を逆算すれば数値に戻せます。

  1. SVG から「凡例(色と系列名)」「軸の目盛り」「各系列の折れ線の点」を取り出す
  2. y 軸は線形、x 軸(コスト)は対数として、目盛りの位置から最小二乗で逆算
  3. 公式の表に載っている公表値 28 件 と突き合わせて検証

これは公式が文字で公表した値ではなく、グラフからの逆算値です。

また、ページ間でコストが少しずれる箇所があります。
(Sonnet 5.5 の Terminal-Bench 4.0 は、Sonnet 5.5 ページと Haiku 5.5 ページで 4〜12%)
数倍の差を比べる分には影響しませんが、「±10% 程度」と思って読んでください。

置換の判定ルールは、シンプルにしました。

  1. 基準(例: Sonnet 5 medium)の、そのベンチマークでのスコアを取る
  2. 5.5 世代(Sonnet 5.5 / Opus 5.5 / Haiku 5.5)の全 effort のうち、スコアが基準以上のものを選ぶ
  3. その中で 1 タスクあたりのコストが最小のものを答えにする

結果:ベンチマーク別の置換先

破線の矢印は「基準点 → 同等以上で最安の 5.5 世代の点」です。

コード変更:FrontierCode

FrontierCode は「エージェントが出したコード変更が、そのままマージできるか」を測るベンチマークです。

FrontierCode

基準 基準のスコア@コスト 置換先 置換先のスコア@コスト コスト比
Sonnet 5 medium 35.2@\$3.82 Sonnet 5.5 medium 36.5@\$0.24 16.2倍安
Sonnet 5 high 39.4@\$6.10 Sonnet 5.5 high 49.4@\$0.42 14.6倍安
Opus 5 medium 53.4@\$4.61 Opus 5.5 medium 54.7@\$0.80 5.7倍安
Opus 5 high 48.0@\$7.63 Sonnet 5.5 high 49.4@\$0.42 18.3倍安

Sonnet 5.5 high(49.4)は、Sonnet 5 のどの effort(最大 42.7)よりも上で、しかも約 1/15 のコストです。ここは気持ちいいくらいの差でした。

一方で面白いのが Opus 5 の折れ線です。medium が 53.4 で、high は 48.0、xhigh は 43.7 と、effort を上げるほど下がっています。この評価は 1 回のブレが数 pt あるということで、Opus 5 high / xhigh の基準を厳密に信じすぎないほうがよさそうです。

複数ファイルの曖昧なタスク:CursorBench

CursorBench

基準 基準のスコア@コスト 置換先 置換先のスコア@コスト コスト比
Sonnet 5 medium 28.0@\$2.31 Sonnet 5.5 low 35.8@\$0.50 4.6倍安
Sonnet 5 high 30.8@\$3.48 Sonnet 5.5 low 35.8@\$0.50 7.0倍安
Opus 5 medium 43.4@\$6.94 Sonnet 5.5 high 47.8@\$1.67 4.2倍安
Opus 5 high 44.7@\$9.01 Sonnet 5.5 high 47.8@\$1.67 5.4倍安

ここでは Sonnet 5.5 high が、Opus 5 の xhigh(46.1)や max(46.6)まで上回っています。

資料作成・知識作業:AA-Briefcase と GDPval-AA

AA-Briefcase

基準 基準のスコア@コスト 置換先 置換先のスコア@コスト コスト比
Sonnet 5 medium 1056@\$1.73 Sonnet 5.5 low 1265@\$0.87 2.0倍安
Sonnet 5 high 1178@\$3.78 Sonnet 5.5 low 1265@\$0.87 4.3倍安
Sonnet 5 xhigh 1275@\$7.54 Sonnet 5.5 medium 1461@\$1.64 4.6倍安

Sonnet 5 xhigh(1275)に対して、Sonnet 5.5 low(1265)は 10 Elo 足りませんでした(ほぼ同等ですが、ルール上は不合格)。そのため medium を選んでいます。Opus 5.5 low(1285@\$1.15)なら届きます。

次に GDPval-AA です。ここに Haiku 5.5 が出てきます。

GDPval-AA

基準 基準のスコア@コスト 置換先 置換先のスコア@コスト コスト比
Opus 5 medium 1475@\$1.36 Haiku 5.5 xhigh 1513@\$0.27 5.1倍安
Opus 5 high 1581@\$3.03 Haiku 5.5 max 1620@\$0.87 3.5倍安
Opus 5 xhigh 1675@\$4.95 Opus 5.5 high 1691@\$1.55 3.2倍安

Haiku 5.5 の max は、Opus 5 の high を上回っています。
小型モデルが一世代前の最上位の high を、1/3.5 のコストで超えてきました。

ただし、Sonnet 5 には GDPval-AA の effort 別の点が公式にありません(最高値 1449 のみ)。
破線(1449)より上の Haiku 5.5 xhigh(1513)と max(1620)は「Sonnet 5 のどの effort よりも上」とは言えますが、「Sonnet 5 の medium と同等になるのは Haiku 5.5 の何 effort か」は公式データから今回は確認できませんでした。

Terminal-Bench 4.0

Terminal-Bench 4.0

Sonnet 5 は 3〜10% とスコアが低すぎて、比較がうまくできません。
代わりに Opus 5 を見ると、medium(41.2)は Sonnet 5.5 high(43.0)が 3.6 倍安く、high(47.1)は Opus 5.5 medium(57.7)が 3.6 倍安く超えます。

実測:私の cron を各モデルで回してみた

公式ベンチマークは、重いエージェント作業が中心です。私の cron はもっと地味なので、実際に回しました。

対象は、毎日 cron で回している「ビジネス・政経トレンド収集」の分析フェーズ(収集済みのニュース一覧を読み込んで、興味領域に沿って整理・要約する claude -p)です。

  • 入力は 1 回だけ収集して固定(全条件で同じ)
  • claude -p "/biz-trend-daily" --model <モデルID> --effort <effort> --output-format json で実行
  • コストは total_cost_usd、品質は構造・リンク・中身を確認

実測コスト

条件 コスト 所要時間 備考
Sonnet 5 medium(基準) \$0.360 86秒 ―
Sonnet 5 high \$0.340 105秒 ―
Sonnet 5.5 low \$0.236(1.5倍安) 55秒 最終応答で API エラー(後述)
Sonnet 5.5 medium \$0.303(1.2倍安) 66秒 ―
Sonnet 5.5 high \$0.274(1.3倍安) 76秒 最終応答で API エラー(後述)
Haiku 5.5 low \$0.013(28.5倍安) 53秒 ホスト名の書き換えが1件
Haiku 5.5 medium \$0.018(19.9倍安) 64秒 ―
Haiku 5.5 high \$0.023(15.8倍安) 88秒 ―

何が分かったか

  • Sonnet 5.5 は Sonnet 5 より 16〜34% 安い。
    • 公式の「最大 30% 安い」とだいたい整合
    • 所要時間も medium で 86秒 → 66秒でした(1 回ずつなので参考値)
  • Haiku 5.5 は 16〜29 倍安い。1 回 2〜3 円です。
  • 差が出たのはメイントピックの網羅性と表記です。
    • Sonnet 5 medium
      • メイントピック10 件
      • 英語記事のタイトルが英語のままの行が複数あり
    • Sonnet 5.5 medium
      • 19 件で最も網羅的
      • こちらも英語タイトルのままの行あり
    • Haiku 5.5
      • 11〜14 件
      • 日本語で要約されていて、複数ソースの同じ話題を 1 行にまとめていました

あくまで私個人で使用している自動化処理なので、完全主観ですが、この用途なら Haiku 5.5 で困りません。
Sonnet 5 medium より、日本語化されていて読みやすくすらありました。

注意点

❌ Sonnet 5.5 の Max effort を最強だと思う

公式脚注によると、FrontierCode では Sonnet 5.5 は Max(46.2)が Xhigh(52.1)より低い です。FrontierCode は範囲外の変更にペナルティがあり、Max では Claude Code のコードレビュー skill が多数のサブエージェントに分割されて、タイムアウトや余計な編集が出たためと説明されています。

❌ 1 回のスコア差を信じすぎる

Opus 5 の FrontierCode が medium > high > xhigh の順になっているように、この種の評価は単発のブレが大きいです。置換表は「複数のベンチマークで成立したもの」を優先して書いています。

❌ Haiku 5.5 に長いプロンプトを投げる

Haiku 5.5 は 100k トークンを超えるプロンプトだと単価が 5 倍(入力 \$0.10 → \$0.50)です。また、新しいトークナイザで、Haiku 4.5 より同じ文章が約 30% 多いトークン数になります。

:warning: グラフのコストは、API 単価換算の USD です

この記事のコストは、公式グラフの「1 タスクあたりの USD」です。
サブスクプランのの実際の制約は、金額ではなく使用枠です。

使用枠の減り方は公式に数式がないので、USD が小さいほど使用枠も減るという前提で読んでいます。

この前提が合っているかは、手元で total_cost_usd と使用枠の減り方を見比べて確かめてください。

:warning: Sonnet 5.5 のグラフは、少し高く見積もられている

2026-10-07 に Sonnet 5.5 のキャッシュ読取が \$0.20 → \$0.10 に半額になりました。Sonnet 5.5 ページのグラフは、旧価格での計算です。エージェント的な作業では約 20% 安くなると公式が書いているので、Sonnet 5.5 の置換先は、表よりさらに安くなります。

自分で測る方法

最小限は、これだけです。

# 条件を変えて、同じ入力で何回か回す
claude -p "/your-skill" \
  --model claude-haiku-5-5 --effort medium \
  --output-format json --no-session-persistence \
  | jq '{cost: .total_cost_usd, sec: (.duration_ms/1000), turns: .num_turns, model: (.modelUsage|keys)}'
  • total_cost_usd に 1 回あたりのコストが出ます
  • modelUsage のキーで、実際に使われたモデル ID を確認できます
  • 入力は 1 回だけ収集して固定してください。条件ごとに収集し直すと、入力の違いが混ざります

まとめ

  • コード変更系
    • Sonnet 5 medium → Sonnet 5.5 medium
    • Sonnet 5 high / xhigh → Sonnet 5.5 high
    • 公式ベンチマークで 約 15〜24 倍安い うえにスコアも上がります
  • 資料作成・調査・要約系
    • Sonnet 5.5 の low〜medium で足り、Haiku 5.5 は Opus 5 の medium〜high を超えるベンチマークもあります
  • 定型処理
    • Haiku 5.5で良さそう
    • 私の cron は 1 回 \$0.36 → \$0.018(約 1/20)でした
    • ただし 1 回ずつの実測で、画像を読ませる系は未検証です
  • Opus 5 の置き換え
    • コード系は Sonnet 5.5 high
    • 知識作業は Haiku 5.5 xhigh〜max / Sonnet 5.5 xhigh

数字はすべて 2026/10/08 時点です。

参考(2026/10/08 時点)

※ 価格・仕様・グラフは時期により変わり得ます。公開時点の公式情報で再確認を。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?