0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Claude Sonnet 5.5 vs Sonnet 5:同価格でタスク単価 80% 減

0
Last updated at Posted at 2026-09-30

この記事は Synthorai ブログの記事 Claude Sonnet 5.5 vs Sonnet 5:同価格でタスク単価 80% 減 の転載です。原文(多言語対応)はリンク先をご覧ください。

Claude Sonnet 5.5 vs Sonnet 5:同価格でタスク単価 80% 減

Claude Sonnet 5.5 と Claude Sonnet 5 の token 単価は同じで、入力 100 万 token あたり $2、出力 100 万 token あたり $10 だ。コスト差は、使う token 数の違いだけで決まる。API のデフォルト設定で 13 件の単発タスクを実行したところ、Sonnet 5.5 は 1 タスクあたり $0.0041、Sonnet 5 は $0.021 だった。Sonnet 5.5 のほうが 80% 安く、正答率はどちらも 100% だった。問題は出力形式だ。Sonnet 5.5 は xhigh 未満だと hidden reasoning を省略し、回答だけを求める prompt に対しても計算過程を reply に書くことがある。

TL;DR

  • API のデフォルト設定では、Sonnet 5.5 は 1 タスクあたり $0.0041、Sonnet 5 は $0.021 だった。39 回の呼び出しは両モデルともすべて正解した。
  • Sonnet 5.5 のコストは low、medium、high でほぼ同じだった。max はデフォルトの 3.5 倍だった。
  • Sonnet 5.5 は xhigh 未満だと、回答だけを求めた 156 件中 68 件で計算過程も reply に含めた。system prompt を追加しても改善しなかった。
  • 4 問の tool loop では、Sonnet 5.5 の max は 1 回あたり $0.042 かかり、Opus 5.5 のデフォルト設定($0.033)より高かった。

Anthropic は 2026-09-28 に Sonnet 5.5 をリリースし、Sonnet 5 より 30% 高速で、1 タスクあたりのコストを「最大 30% 削減」できると発表した。その翌日に測定した。

Claude Sonnet 5.5 で何が変わったか?

価格は変わっていない。thinking の制御方法と、複数の request parameter が変わった。Sonnet 5.5 は adaptive thinking を使う。回答前にどれだけ hidden reasoning を行うかはモデルが決め、その reasoning token は出力として課金される。制御には effort を使う。Messages API では output_config.effort に指定し、low から max まで 5 段階ある。API のデフォルトは high だ。

Sonnet 5.5 Sonnet 5 Opus 5.5
リリース日 2026-09-28 2026-06-30 2026-09-22
入力/出力、100 万 token あたり $2 / $10 $2 / $10 $4 / $20
cache read、100 万 token あたり $0.20 $0.20 $0.20
context window/最大出力 1M / 128K 1M / 128K 1M / 128K
knowledge cutoff(公開されているのは月のみ) 2026 年 6 月 2026 年 1 月 2026 年 6 月
API のデフォルト effort high high medium
thinking の最低設定 between_tools(high 以下) disabled 無効化できず、thinking は常に有効
cache 可能な prompt の最小サイズ 512 token 1,024 token 512 token

Sonnet 5 の $2 / $10 は当初、導入価格として提供された。しかし、現在の Anthropic の料金ページ では標準価格として掲載されている。予定されていた $3 / $15 への値上げは実施されなかった。

移行ガイド によると、次の request は Sonnet 5 では動作するが、Sonnet 5.5 では HTTP 400 を返す。

  • thinking: {"type": "disabled"}。代わりに thinking: {"type": "between_tools"} を使う。これは最初の回答前の reasoning を無効にし、high 以下でのみ利用できる。
  • tool の強制使用。tool_choice に any または特定の tool を指定する方法は使えない。auto のままにして、tool を使う条件を prompt に書く。
  • 手動の thinking budget(budget_tokens)、デフォルト以外の temperature、top_p、top_k、および事前入力した assistant turn(モデルの reply の書き出しをあらかじめ指定する方法)。
  • 2026-08-31 以降に作成されたアカウントで、system prompt、tool、または以前の message を変更した後に Sonnet 5.5 の thinking block を再送すること。
  • Claude API と Google Cloud で、旧版の computer use tool computer_20251124 を使うこと。

エラーにならない変更もある。tool call 間にモデルが書く短いメモは、今後 thinking block として返される。デフォルトの表示設定では中身が空になるため、これを streaming 表示していた interface では何も表示されなくなる。

リリース時の benchmark は何を示しているか?

Anthropic の比較表では、Sonnet 5.5 は token 単価が半分にもかかわらず、Opus 5.5 と数 point 差に収まっている。Sonnet 5 には大差をつけた。

Benchmark(評価対象) Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0(terminal 上での agentic coding) 70.6% 10.3% 66.4%(xhigh) 未報告
CursorBench 4.0(editor 上での coding) 55.5% 34.1% 57.8% 未報告
GDPval-AA v2.1(知識労働の文書、Elo rating、高いほど良い) 1844 1449 1846 1487
OSWorld 2.1(computer use、部分点あり) 80.1% 57.0% 81.8% 未報告
Humanity's Last Exam、tool 使用あり 64.5% 54.9% 67.7% 未報告

Artificial Analysis はコスト面の注意点も挙げている。max の Sonnet 5.5 は Intelligence Index で 56 を記録し、max の Opus 5.5 より 2 point 低かった。一方、1 タスクあたり約 193K output token を使った。これは同社の測定で最多であり、max の Opus 5.5 または Sonnet 5 より約 60% 多い。index task あたりのコストは約 $7.60 だった。

どのように測定したか?

正解が分かっている 13 件の単発タスクを 3 モデルすべてに送った。各タスクは 1 prompt、1 reply で、tool は使わない。内訳は短い問題が 8 件(60 未満の素数の合計、1 から 500 までに数字の 7 が現れる回数など)、複数段階の処理が必要な問題が 5 件(10 item の knapsack、障害物のある 8x8 grid の経路数、13 の 1,001 乗を 10,007 で割った余りなど)だ。正解はすべてローカルで総当たりして求めた。各 prompt の末尾には「整数を 1 つだけ返し、それ以外は何も書かないこと」と指定した。各タスクを API のデフォルト設定と 5 段階すべての effort で 3 回ずつ実行した。合計 702 call で、native Messages API を使用した。cache から response が返らないよう、各 prompt に一意のランダム文字列を付けた。コストは Anthropic の定価から計算した。最終回答が正しいか、reply が回答だけになっているかを採点した。

精度ではモデル間に差がつかなかった。Sonnet 5.5 は 234 call すべてに正解した。Sonnet 5 は response が返った 233 call すべてに正解したが、1 call は server error になった。Opus 5.5 は low とデフォルト設定で、それぞれ 1 タスクずつ間違えた。

Sonnet 5.5 のタスク単価は Sonnet 5 より安いか?

Sonnet 5.5 はデフォルト設定で Sonnet 5 より 80% 安く、low、medium、high では 77% から 78% 安かった。output token 数が約 5 分の 1 だったためだ。定価は同じなので、コスト削減分はすべて token efficiency による。Sonnet 5 はどの effort でも 1 タスクあたり約 1,800 から 2,100 token を出力した。Sonnet 5.5 は xhigh 未満なら約 400 token だった。

全 13 タスク、1 タスクあたり Sonnet 5.5 Sonnet 5 Opus 5.5
API デフォルト $0.0041(396 token) $0.0212(2,105) $0.0070(334)
low $0.0043(409) $0.0184(1,817) $0.0065(309)
medium $0.0040(383) $0.0180(1,780) $0.0082(393)
high $0.0043(416) $0.0188(1,858) $0.0088(421)
xhigh $0.0059(574) $0.0202(2,001) $0.0105(507)
max $0.0146(1,438) $0.0193(1,909) $0.0234(1,149)

effort 設定別のタスク単価を、1,000 タスクあたりの dollar で示した grouped bar chart。Claude Sonnet 5.5:デフォルト 4.1、low 4.3、medium 4.0、high 4.3、xhigh 5.9、max 14.6。Claude Opus 5.5:デフォルト 7.0、low 6.5、medium 8.2、high 8.8、xhigh 10.5、max 23.4。Claude Sonnet 5:デフォルト 21.2、low 18.4、medium 18.0、high 18.8、xhigh 20.2、max 19.3

token 数は 1 call あたりの平均 output token で、reasoning も含む。難しい 5 タスクでは、デフォルト設定で 84% 安かった($0.0057 に対して $0.0348)。tool loop では transcript 全体を turn ごとに再送し、input token がコストの大半を占めるため、削減率は 8% だった。今回のような単発 prompt に対して Anthropic の「最大 30%」は控えめだが、今回のような短い loop に対しては大きめの数字だ。

タスクは13件だけなので、デフォルト設定での80%減という値の幅は広い。タスクを再標本化した95%区間は66%から85%安い範囲で、low から xhigh までのどの設定でも下限は50%を上回った。

effort level ごとのコストは?

Sonnet 5.5 は low、medium、high のどれでも 1 タスクあたり約 $0.0042 だった。今回の測定では、デフォルトの high に追加コストはない。xhigh は約 40% 高く、max はデフォルトの 3.5 倍だった。max の Sonnet 5.5 は、デフォルト設定の Opus 5.5 より 1 タスクあたりのコストが 2 倍になった($0.0146 に対して $0.0070)。精度は向上しなかった。

どの workload でも同じ傾向になるわけではない。より長い DevOps タスクでは、別のテスター が high で medium の約 2 倍の output token を使ったと報告している。effort の影響を受ける workload では、個別に全設定を測定する必要がある。

Sonnet 5.5 はなぜ回答に計算過程を書くのか?

Sonnet 5.5 は xhigh 未満だと、thinking block を使わないことがある。その場合、reply の中で reasoning を行う。thinking block はモデルの reasoning を格納する response 内の独立した領域だ。デフォルトでは本文が空で、その後に text block として回答が続く。

Sonnet 5.5 の 234 reply のうち、thinking block があった 166 件はすべて回答だけだった。thinking block がなかった 68 件は、すべて最初に計算過程を書いた。たとえば「09:47 + 3:46 = 13:33 ... + 1:39 = 15:40」と書いた後に「15:40」と回答した。最終回答は毎回正しかったが、prompt で指定した形式には従っていなかった。

回答のみだった reply Sonnet 5.5 Sonnet 5 Opus 5.5
API デフォルト 22 / 39 38 / 39 38 / 39
low 12 / 39 37 / 39 38 / 39
medium 24 / 39 37 / 39 39 / 39
high 30 / 39 38 / 39 39 / 39
xhigh 39 / 39 35 / 38 39 / 39
max 39 / 39 37 / 39 39 / 39

この挙動はタスク単位で起きる。該当したタスクでは、Sonnet 5.5 は 3 回の繰り返しすべてで計算過程を書いた。例外はデフォルト設定の 1 タスクで、3 回中 2 回だった。該当したのは 13 タスク中、low で 9 件、デフォルトで 6 件、medium で 5 件、high で 3 件(いずれも短い算数の問題)だった。タスク単位で数えると 13 件しかないため、どの差も Holm 補正を通らない。これらの件数は今回観測した結果として読み、計画に使える発生率とはみなさないでほしい。Sonnet 5 の失敗は性質が異なり、正しい回答を太字で書いた後に短い説明を付けていた。xhigh が 38 call なのは、1 call が server error になったためだ。

「最終結果だけを返し、途中の処理は表に出さないこと」と system prompt で指定しても改善しなかった。low では短いタスク 24 件中 8 件、medium では 24 件中 9 件だけが回答のみだった。system prompt なしでは、それぞれ 6 件と 9 件だった。xhigh では毎回 thinking block が使われ、回答だけが返ったが、コストは low から high より約 40% 高かった。モデル出力を parse するコードでは、次の方法が使える。

  • 1 行だけを回答として受け取る必要があるなら、xhigh を使う。
  • または、最後の空でない行を回答として読む。今回の 68 件では、すべて正解だった。
  • Anthropic の structured outputs で reply を schema に制約する方法もある。今回は検証していない。
import anthropic

client = anthropic.Anthropic()
prompt = "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else."
resp = client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=16000,
    output_config={"effort": "xhigh"},  # low, medium, high (API default), xhigh, max
    messages=[{"role": "user", "content": prompt}],
)
text = "".join(block.text for block in resp.content if block.type == "text")
lines = text.strip().splitlines()
answer = lines[-1] if lines else None  # below xhigh, working can precede the answer
print(answer, resp.usage.output_tokens)  # output_tokens includes the reasoning

tool loop ではどうなるか?

デフォルト、low、medium の Sonnet 5.5 は、4 問のコード読解 loop をすべて解き、1 回あたりのコストは約 $0.011 だった。Opus 5.5 の約 3 分の 1 だ。max では tool call が 3 倍に増え、Opus 5.5 より高くなった。各モデルには、小さな合成 codebase に対して 3 種類の tool(file 一覧、file 読み込み、検索)を与えた。各回答には、複数 file をまたぐ 3 から 6 回の lookup が必要だった。

Tool loop、各 12 回 解決数 turn 中央値 1 回あたりの tool call 1 回あたりのコスト wall time 中央値
Sonnet 5.5、デフォルト 12 / 12 3 4.8 $0.0112 6.7 s
Sonnet 5.5、low 12 / 12 3 4.9 $0.0112 7.4 s
Sonnet 5.5、medium 12 / 12 3 5.1 $0.0113 6.8 s
Sonnet 5.5、max 12 / 12 4 14.7 $0.0422 20.1 s
Opus 5.5、デフォルト 12 / 12 4 5.3 $0.0332 25.3 s
Sonnet 5、デフォルト 11 / 12 3.5 4.2 $0.0122 15.8 s

VentureBeat が紹介した顧客のコメント では、Sonnet 5 より tool call が少なかったとされている。Lovable では 3 分の 1 少なかった。今回の loop は短すぎるため、その傾向は確認できなかった。Sonnet 5.5 は 1 回あたり 4.8 call、Sonnet 5 は 4.2 call だった。一方、コストは 8% 安く、完了までの時間は半分未満だった。

Sonnet 5.5 は高速か?

完了が早かった主な理由は、出力が短かったことだ。デフォルト設定の単発タスクで、request 送信から response 全体の受信までにかかった wall time の中央値は、Sonnet 5.5 が 3.9 秒、Sonnet 5 が 8.1 秒、Opus 5.5 が 5.5 秒だった。wall time 1 秒あたりの output token 数は 2 つの Sonnet でほぼ同じだった(88 に対して 91)。待ち時間が半分になったのは、token の生成速度が上がったからではない。Sonnet 5.5 の出力が 5 分の 1 だったためだ。難しいタスクでは 5.8 秒に対して 21.0 秒だった。

Sonnet 5 の token budget はそのまま使えるか?

Sonnet 5 向けに設定したコンテキスト予算や max_tokens の上限は、そのまま使えるはずだ。Anthropic の移行ガイドは Sonnet 5.5 が同じ tokenizer を使うとしており、私たちが試した 4 種類の固定テキスト(英文、Python コード、JSON のツール引数、中国語の文章)は、両モデルと Opus 5.5 で同じ token 数になった。たとえば英文は 1,270 token、中国語は 493 token だった。Sonnet 5.5 と Opus 5.5 はリクエストごとに固定で 2 token 多い。ツールを使うリクエストは入力が少し安くなる。Anthropic の料金ページによると、隠れたツール利用用システムプロンプトは Sonnet 5.5 で 286 token、Sonnet 5 で 354 token だ。

どれを使うべきか?

多くの Sonnet 5 workload は移行したほうがよい。残る判断は effort level の選択だ。

Workload 注意点 推奨 数値
コードで parse する出力:抽出、分類、単一値 xhigh 未満では reply に計算過程が入る Sonnet 5.5 の xhigh、または medium で最後の行を parse 回答のみは xhigh で 39 / 39、medium で 24 / 39。xhigh は約 40% 高い
chat とユーザー向けテキスト latency とコスト Sonnet 5.5 の medium 1 タスクあたり $0.0040、中央値 3.9 s
tool を使う agent loop max で tool call が増える Sonnet 5.5 のデフォルトまたは medium。Sonnet 5.5 の max を使う前に Opus 5.5 へ移行 デフォルトで 1 回あたり $0.011、max で $0.042、Opus 5.5 で $0.033
thinking を無効化する、または tool を強制する Sonnet 5 向けコード モデル変更後に HTTP 400 between_tools(high 以下)と tool_choice: auto Anthropic の移行ガイド

effort level にかかわらず、コードには 2 つの検査を入れるべきだ。reply が parser の想定する形式になっているかを確認し、request ごとに output token の上限を設定する。単発 prompt では max によってタスク単価が 3.5 倍になり、loop では tool call が 3 倍になった。

FAQ

Sonnet 5.5 は Opus 5.5 より安いか?
デフォルト設定では、Sonnet 5.5 の単発タスク単価は Opus 5.5 より 41% 安く、tool loop 1 回あたりでは 3 分の 1 だった。max では逆転する。Sonnet 5.5 は単発タスクでデフォルト設定の Opus 5.5 の 2 倍、tool loop 1 回あたりでは 27% 高かった。

Sonnet 5.5 ではどの effort level を使うべきか?
今回のタスクでは、Sonnet 5.5 の low、medium、high はほぼ同じコストだった($0.0040 から $0.0043)。chat と tool loop では medium から始めるのが無難だ。コードが reply を単一値として parse する場合は xhigh を使う。max はデフォルトの 3.5 倍かかった。

Sonnet 5.5 でも thinking を無効にできるか?
Sonnet 5.5 は thinking: {"type": "disabled"} を拒否し、HTTP 400 を返す。代わりに thinking: {"type": "between_tools"} を送る。利用できる effort は low、medium、high だ。

関連する測定結果:Claude Opus 5.5 と Opus 5 の比較、Claude Sonnet 5 の tokenizer、各 vendor の thinking 制御。

測定日はリリース翌日の 2026-09-29。Anthropic Messages API に接続する gateway 経由で実施した。採点した単発 call は 702 件(総当たりで正解を求めた 13 タスク、3 回の反復、6 種類の effort 設定、3 モデル)、出力形式に対する system instruction の検証は 48 call、tool loop は 72 回(複数段階の調査が必要な 4 問、3 回の反復、6 設定)、固定テキスト 4 種類の token 数もモデルごとに測定した。prompt には salt を付与し、コストは Anthropic の定価から計算した。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?