この記事は Synthorai ブログの記事 Claude Sonnet 5.5 vs Sonnet 5:同価格でタスク単価 80% 減 の転載です。原文(多言語対応)はリンク先をご覧ください。
Claude Sonnet 5.5 と Claude Sonnet 5 の token 単価は同じで、入力 100 万 token あたり $2、出力 100 万 token あたり $10 だ。コスト差は、使う token 数の違いだけで決まる。API のデフォルト設定で 13 件の単発タスクを実行したところ、Sonnet 5.5 は 1 タスクあたり $0.0041、Sonnet 5 は $0.021 だった。Sonnet 5.5 のほうが 80% 安く、正答率はどちらも 100% だった。問題は出力形式だ。Sonnet 5.5 は xhigh 未満だと hidden reasoning を省略し、回答だけを求める prompt に対しても計算過程を reply に書くことがある。
TL;DR
- API のデフォルト設定では、Sonnet 5.5 は 1 タスクあたり $0.0041、Sonnet 5 は $0.021 だった。39 回の呼び出しは両モデルともすべて正解した。
- Sonnet 5.5 のコストは
low、medium、highでほぼ同じだった。maxはデフォルトの 3.5 倍だった。 - Sonnet 5.5 は
xhigh未満だと、回答だけを求めた 156 件中 68 件で計算過程も reply に含めた。system prompt を追加しても改善しなかった。 - 4 問の tool loop では、Sonnet 5.5 の
maxは 1 回あたり $0.042 かかり、Opus 5.5 のデフォルト設定($0.033)より高かった。
Anthropic は 2026-09-28 に Sonnet 5.5 をリリースし、Sonnet 5 より 30% 高速で、1 タスクあたりのコストを「最大 30% 削減」できると発表した。その翌日に測定した。
Claude Sonnet 5.5 で何が変わったか?
価格は変わっていない。thinking の制御方法と、複数の request parameter が変わった。Sonnet 5.5 は adaptive thinking を使う。回答前にどれだけ hidden reasoning を行うかはモデルが決め、その reasoning token は出力として課金される。制御には effort を使う。Messages API では output_config.effort に指定し、low から max まで 5 段階ある。API のデフォルトは high だ。
| Sonnet 5.5 | Sonnet 5 | Opus 5.5 | |
|---|---|---|---|
| リリース日 | 2026-09-28 | 2026-06-30 | 2026-09-22 |
| 入力/出力、100 万 token あたり | $2 / $10 | $2 / $10 | $4 / $20 |
| cache read、100 万 token あたり | $0.20 | $0.20 | $0.20 |
| context window/最大出力 | 1M / 128K | 1M / 128K | 1M / 128K |
| knowledge cutoff(公開されているのは月のみ) | 2026 年 6 月 | 2026 年 1 月 | 2026 年 6 月 |
| API のデフォルト effort | high |
high |
medium |
| thinking の最低設定 |
between_tools(high 以下) |
disabled |
無効化できず、thinking は常に有効 |
| cache 可能な prompt の最小サイズ | 512 token | 1,024 token | 512 token |
Sonnet 5 の $2 / $10 は当初、導入価格として提供された。しかし、現在の Anthropic の料金ページ では標準価格として掲載されている。予定されていた $3 / $15 への値上げは実施されなかった。
移行ガイド によると、次の request は Sonnet 5 では動作するが、Sonnet 5.5 では HTTP 400 を返す。
-
thinking: {"type": "disabled"}。代わりにthinking: {"type": "between_tools"}を使う。これは最初の回答前の reasoning を無効にし、high以下でのみ利用できる。 - tool の強制使用。
tool_choiceにanyまたは特定の tool を指定する方法は使えない。autoのままにして、tool を使う条件を prompt に書く。 - 手動の thinking budget(
budget_tokens)、デフォルト以外のtemperature、top_p、top_k、および事前入力した assistant turn(モデルの reply の書き出しをあらかじめ指定する方法)。 - 2026-08-31 以降に作成されたアカウントで、system prompt、tool、または以前の message を変更した後に Sonnet 5.5 の thinking block を再送すること。
- Claude API と Google Cloud で、旧版の computer use tool
computer_20251124を使うこと。
エラーにならない変更もある。tool call 間にモデルが書く短いメモは、今後 thinking block として返される。デフォルトの表示設定では中身が空になるため、これを streaming 表示していた interface では何も表示されなくなる。
リリース時の benchmark は何を示しているか?
Anthropic の比較表では、Sonnet 5.5 は token 単価が半分にもかかわらず、Opus 5.5 と数 point 差に収まっている。Sonnet 5 には大差をつけた。
| Benchmark(評価対象) | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0(terminal 上での agentic coding) | 70.6% | 10.3% | 66.4%(xhigh) | 未報告 |
| CursorBench 4.0(editor 上での coding) | 55.5% | 34.1% | 57.8% | 未報告 |
| GDPval-AA v2.1(知識労働の文書、Elo rating、高いほど良い) | 1844 | 1449 | 1846 | 1487 |
| OSWorld 2.1(computer use、部分点あり) | 80.1% | 57.0% | 81.8% | 未報告 |
| Humanity's Last Exam、tool 使用あり | 64.5% | 54.9% | 67.7% | 未報告 |
Artificial Analysis はコスト面の注意点も挙げている。max の Sonnet 5.5 は Intelligence Index で 56 を記録し、max の Opus 5.5 より 2 point 低かった。一方、1 タスクあたり約 193K output token を使った。これは同社の測定で最多であり、max の Opus 5.5 または Sonnet 5 より約 60% 多い。index task あたりのコストは約 $7.60 だった。
どのように測定したか?
正解が分かっている 13 件の単発タスクを 3 モデルすべてに送った。各タスクは 1 prompt、1 reply で、tool は使わない。内訳は短い問題が 8 件(60 未満の素数の合計、1 から 500 までに数字の 7 が現れる回数など)、複数段階の処理が必要な問題が 5 件(10 item の knapsack、障害物のある 8x8 grid の経路数、13 の 1,001 乗を 10,007 で割った余りなど)だ。正解はすべてローカルで総当たりして求めた。各 prompt の末尾には「整数を 1 つだけ返し、それ以外は何も書かないこと」と指定した。各タスクを API のデフォルト設定と 5 段階すべての effort で 3 回ずつ実行した。合計 702 call で、native Messages API を使用した。cache から response が返らないよう、各 prompt に一意のランダム文字列を付けた。コストは Anthropic の定価から計算した。最終回答が正しいか、reply が回答だけになっているかを採点した。
精度ではモデル間に差がつかなかった。Sonnet 5.5 は 234 call すべてに正解した。Sonnet 5 は response が返った 233 call すべてに正解したが、1 call は server error になった。Opus 5.5 は low とデフォルト設定で、それぞれ 1 タスクずつ間違えた。
Sonnet 5.5 のタスク単価は Sonnet 5 より安いか?
Sonnet 5.5 はデフォルト設定で Sonnet 5 より 80% 安く、low、medium、high では 77% から 78% 安かった。output token 数が約 5 分の 1 だったためだ。定価は同じなので、コスト削減分はすべて token efficiency による。Sonnet 5 はどの effort でも 1 タスクあたり約 1,800 から 2,100 token を出力した。Sonnet 5.5 は xhigh 未満なら約 400 token だった。
| 全 13 タスク、1 タスクあたり | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| API デフォルト | $0.0041(396 token) | $0.0212(2,105) | $0.0070(334) |
low |
$0.0043(409) | $0.0184(1,817) | $0.0065(309) |
medium |
$0.0040(383) | $0.0180(1,780) | $0.0082(393) |
high |
$0.0043(416) | $0.0188(1,858) | $0.0088(421) |
xhigh |
$0.0059(574) | $0.0202(2,001) | $0.0105(507) |
max |
$0.0146(1,438) | $0.0193(1,909) | $0.0234(1,149) |
token 数は 1 call あたりの平均 output token で、reasoning も含む。難しい 5 タスクでは、デフォルト設定で 84% 安かった($0.0057 に対して $0.0348)。tool loop では transcript 全体を turn ごとに再送し、input token がコストの大半を占めるため、削減率は 8% だった。今回のような単発 prompt に対して Anthropic の「最大 30%」は控えめだが、今回のような短い loop に対しては大きめの数字だ。
タスクは13件だけなので、デフォルト設定での80%減という値の幅は広い。タスクを再標本化した95%区間は66%から85%安い範囲で、low から xhigh までのどの設定でも下限は50%を上回った。
effort level ごとのコストは?
Sonnet 5.5 は low、medium、high のどれでも 1 タスクあたり約 $0.0042 だった。今回の測定では、デフォルトの high に追加コストはない。xhigh は約 40% 高く、max はデフォルトの 3.5 倍だった。max の Sonnet 5.5 は、デフォルト設定の Opus 5.5 より 1 タスクあたりのコストが 2 倍になった($0.0146 に対して $0.0070)。精度は向上しなかった。
どの workload でも同じ傾向になるわけではない。より長い DevOps タスクでは、別のテスター が high で medium の約 2 倍の output token を使ったと報告している。effort の影響を受ける workload では、個別に全設定を測定する必要がある。
Sonnet 5.5 はなぜ回答に計算過程を書くのか?
Sonnet 5.5 は xhigh 未満だと、thinking block を使わないことがある。その場合、reply の中で reasoning を行う。thinking block はモデルの reasoning を格納する response 内の独立した領域だ。デフォルトでは本文が空で、その後に text block として回答が続く。
Sonnet 5.5 の 234 reply のうち、thinking block があった 166 件はすべて回答だけだった。thinking block がなかった 68 件は、すべて最初に計算過程を書いた。たとえば「09:47 + 3:46 = 13:33 ... + 1:39 = 15:40」と書いた後に「15:40」と回答した。最終回答は毎回正しかったが、prompt で指定した形式には従っていなかった。
| 回答のみだった reply | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| API デフォルト | 22 / 39 | 38 / 39 | 38 / 39 |
low |
12 / 39 | 37 / 39 | 38 / 39 |
medium |
24 / 39 | 37 / 39 | 39 / 39 |
high |
30 / 39 | 38 / 39 | 39 / 39 |
xhigh |
39 / 39 | 35 / 38 | 39 / 39 |
max |
39 / 39 | 37 / 39 | 39 / 39 |
この挙動はタスク単位で起きる。該当したタスクでは、Sonnet 5.5 は 3 回の繰り返しすべてで計算過程を書いた。例外はデフォルト設定の 1 タスクで、3 回中 2 回だった。該当したのは 13 タスク中、low で 9 件、デフォルトで 6 件、medium で 5 件、high で 3 件(いずれも短い算数の問題)だった。タスク単位で数えると 13 件しかないため、どの差も Holm 補正を通らない。これらの件数は今回観測した結果として読み、計画に使える発生率とはみなさないでほしい。Sonnet 5 の失敗は性質が異なり、正しい回答を太字で書いた後に短い説明を付けていた。xhigh が 38 call なのは、1 call が server error になったためだ。
「最終結果だけを返し、途中の処理は表に出さないこと」と system prompt で指定しても改善しなかった。low では短いタスク 24 件中 8 件、medium では 24 件中 9 件だけが回答のみだった。system prompt なしでは、それぞれ 6 件と 9 件だった。xhigh では毎回 thinking block が使われ、回答だけが返ったが、コストは low から high より約 40% 高かった。モデル出力を parse するコードでは、次の方法が使える。
- 1 行だけを回答として受け取る必要があるなら、
xhighを使う。 - または、最後の空でない行を回答として読む。今回の 68 件では、すべて正解だった。
- Anthropic の structured outputs で reply を schema に制約する方法もある。今回は検証していない。
import anthropic
client = anthropic.Anthropic()
prompt = "Compute 7 raised to the power 222, modulo 1000. Reply with a single integer, nothing else."
resp = client.messages.create(
model="claude-sonnet-5-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # low, medium, high (API default), xhigh, max
messages=[{"role": "user", "content": prompt}],
)
text = "".join(block.text for block in resp.content if block.type == "text")
lines = text.strip().splitlines()
answer = lines[-1] if lines else None # below xhigh, working can precede the answer
print(answer, resp.usage.output_tokens) # output_tokens includes the reasoning
tool loop ではどうなるか?
デフォルト、low、medium の Sonnet 5.5 は、4 問のコード読解 loop をすべて解き、1 回あたりのコストは約 $0.011 だった。Opus 5.5 の約 3 分の 1 だ。max では tool call が 3 倍に増え、Opus 5.5 より高くなった。各モデルには、小さな合成 codebase に対して 3 種類の tool(file 一覧、file 読み込み、検索)を与えた。各回答には、複数 file をまたぐ 3 から 6 回の lookup が必要だった。
| Tool loop、各 12 回 | 解決数 | turn 中央値 | 1 回あたりの tool call | 1 回あたりのコスト | wall time 中央値 |
|---|---|---|---|---|---|
| Sonnet 5.5、デフォルト | 12 / 12 | 3 | 4.8 | $0.0112 | 6.7 s |
Sonnet 5.5、low
|
12 / 12 | 3 | 4.9 | $0.0112 | 7.4 s |
Sonnet 5.5、medium
|
12 / 12 | 3 | 5.1 | $0.0113 | 6.8 s |
Sonnet 5.5、max
|
12 / 12 | 4 | 14.7 | $0.0422 | 20.1 s |
| Opus 5.5、デフォルト | 12 / 12 | 4 | 5.3 | $0.0332 | 25.3 s |
| Sonnet 5、デフォルト | 11 / 12 | 3.5 | 4.2 | $0.0122 | 15.8 s |
VentureBeat が紹介した顧客のコメント では、Sonnet 5 より tool call が少なかったとされている。Lovable では 3 分の 1 少なかった。今回の loop は短すぎるため、その傾向は確認できなかった。Sonnet 5.5 は 1 回あたり 4.8 call、Sonnet 5 は 4.2 call だった。一方、コストは 8% 安く、完了までの時間は半分未満だった。
Sonnet 5.5 は高速か?
完了が早かった主な理由は、出力が短かったことだ。デフォルト設定の単発タスクで、request 送信から response 全体の受信までにかかった wall time の中央値は、Sonnet 5.5 が 3.9 秒、Sonnet 5 が 8.1 秒、Opus 5.5 が 5.5 秒だった。wall time 1 秒あたりの output token 数は 2 つの Sonnet でほぼ同じだった(88 に対して 91)。待ち時間が半分になったのは、token の生成速度が上がったからではない。Sonnet 5.5 の出力が 5 分の 1 だったためだ。難しいタスクでは 5.8 秒に対して 21.0 秒だった。
Sonnet 5 の token budget はそのまま使えるか?
Sonnet 5 向けに設定したコンテキスト予算や max_tokens の上限は、そのまま使えるはずだ。Anthropic の移行ガイドは Sonnet 5.5 が同じ tokenizer を使うとしており、私たちが試した 4 種類の固定テキスト(英文、Python コード、JSON のツール引数、中国語の文章)は、両モデルと Opus 5.5 で同じ token 数になった。たとえば英文は 1,270 token、中国語は 493 token だった。Sonnet 5.5 と Opus 5.5 はリクエストごとに固定で 2 token 多い。ツールを使うリクエストは入力が少し安くなる。Anthropic の料金ページによると、隠れたツール利用用システムプロンプトは Sonnet 5.5 で 286 token、Sonnet 5 で 354 token だ。
どれを使うべきか?
多くの Sonnet 5 workload は移行したほうがよい。残る判断は effort level の選択だ。
| Workload | 注意点 | 推奨 | 数値 |
|---|---|---|---|
| コードで parse する出力:抽出、分類、単一値 |
xhigh 未満では reply に計算過程が入る |
Sonnet 5.5 の xhigh、または medium で最後の行を parse |
回答のみは xhigh で 39 / 39、medium で 24 / 39。xhigh は約 40% 高い |
| chat とユーザー向けテキスト | latency とコスト | Sonnet 5.5 の medium
|
1 タスクあたり $0.0040、中央値 3.9 s |
| tool を使う agent loop |
max で tool call が増える |
Sonnet 5.5 のデフォルトまたは medium。Sonnet 5.5 の max を使う前に Opus 5.5 へ移行 |
デフォルトで 1 回あたり $0.011、max で $0.042、Opus 5.5 で $0.033 |
| thinking を無効化する、または tool を強制する Sonnet 5 向けコード | モデル変更後に HTTP 400 |
between_tools(high 以下)と tool_choice: auto
|
Anthropic の移行ガイド |
effort level にかかわらず、コードには 2 つの検査を入れるべきだ。reply が parser の想定する形式になっているかを確認し、request ごとに output token の上限を設定する。単発 prompt では max によってタスク単価が 3.5 倍になり、loop では tool call が 3 倍になった。
FAQ
Sonnet 5.5 は Opus 5.5 より安いか?
デフォルト設定では、Sonnet 5.5 の単発タスク単価は Opus 5.5 より 41% 安く、tool loop 1 回あたりでは 3 分の 1 だった。max では逆転する。Sonnet 5.5 は単発タスクでデフォルト設定の Opus 5.5 の 2 倍、tool loop 1 回あたりでは 27% 高かった。
Sonnet 5.5 ではどの effort level を使うべきか?
今回のタスクでは、Sonnet 5.5 の low、medium、high はほぼ同じコストだった($0.0040 から $0.0043)。chat と tool loop では medium から始めるのが無難だ。コードが reply を単一値として parse する場合は xhigh を使う。max はデフォルトの 3.5 倍かかった。
Sonnet 5.5 でも thinking を無効にできるか?
Sonnet 5.5 は thinking: {"type": "disabled"} を拒否し、HTTP 400 を返す。代わりに thinking: {"type": "between_tools"} を送る。利用できる effort は low、medium、high だ。
関連する測定結果:Claude Opus 5.5 と Opus 5 の比較、Claude Sonnet 5 の tokenizer、各 vendor の thinking 制御。
測定日はリリース翌日の 2026-09-29。Anthropic Messages API に接続する gateway 経由で実施した。採点した単発 call は 702 件(総当たりで正解を求めた 13 タスク、3 回の反復、6 種類の effort 設定、3 モデル)、出力形式に対する system instruction の検証は 48 call、tool loop は 72 回(複数段階の調査が必要な 4 問、3 回の反復、6 設定)、固定テキスト 4 種類の token 数もモデルごとに測定した。prompt には salt を付与し、コストは Anthropic の定価から計算した。
