はじめに
Anthropic は 2026 年 10 月 7 日に Claude Haiku 5.5 を公開しました。Claude 5.5 ファミリーとして、Opus 5.5(9 月 22 日)、Sonnet 5.5(9 月 28 日)に続くリリースです。公式発表は「これまでで最も安く、最も速く、最も高性能な小型モデル」と説明しています。
価格表を見ると、入力 $0.10 / 出力 $0.50(100 万トークンあたり)で、Haiku 4.5 の $1 / $5 から 10 分の 1 になっています。ただし、この単価には「プロンプトが 100,000 トークン以下の場合」という条件が付いています。100,000 トークンを超えると、入力 $0.50 / 出力 $2.50 に上がります。Claude 4.6 以降のモデルは 1M トークンまで単価が変わらないため、Haiku 5.5 だけがこの段階料金の例外です。
もう 1 つの変化は、Haiku として初めて effort パラメーターと adaptive thinking を持ったことです。既定の effort は medium で、何も指定しなければ応答の前に考える場合があります。
本記事では、公式ドキュメントの内容を整理したうえで、Claude Code の非対話モード(claude -p)から Haiku 5.5 と Haiku 4.5 を実際に呼び出し、次の 3 点を確かめた結果をまとめます。
- 100,000 トークンの境界の前後で、料金の計算がどう変わるか
- effort を
low/medium/highに変えると、思考トークンと答えがどう変わるか - 同じ入力で、Haiku 4.5 と比べて速度とコストがどれだけ違うか
対象読者は、Claude API や Claude Code のサブエージェントで Haiku 4.5 を使っていて、Haiku 5.5 への切り替えを検討している開発者です。
検証の範囲
| 内容 | 根拠 |
|---|---|
| 100,000 トークン境界の前後の料金計算 | 実機(claude -p の total_cost_usd。Claude Code の算出値で請求額ではない) |
| effort 別の思考トークン・所要時間・正誤 | 実機(同じ入力で low / medium / high) |
| Haiku 4.5 との速度・コスト・入力トークン数の比較 | 実機(同じ入力・同じシステムプロンプト) |
| 400 エラーになる破壊的変更と移行手順 | 公式ドキュメント(API キーでの直接呼び出しは未実施) |
| ベンチマーク・平均 75% 安いという主張 | 公式発表(未検証) |
実機の環境は Claude Code 2.1.293 のクラウド実行環境(Linux)です。Messages API を API キーで直接呼ぶ環境は無いため、すべて claude -p 経由で呼び出しています。ツールは無効化し(--tools "")、システムプロンプトは 1 文に差し替えて、Claude Code 自身のシステムプロンプトが入力に混ざらないようにしました。
TL;DR
- Claude Haiku 5.5(
claude-haiku-5-5)は、プロンプト 100,000 トークン以下なら入力 $0.10 / 出力 $0.50 で、Haiku 4.5 の 10 分の 1 です - 100,000 トークンを超えると単価は 5 倍(入力 $0.50 / 出力 $2.50)になります。実測では、超えた分だけでなくプロンプト全体と出力が高い単価で計算されました
- キャッシュから読んだトークンも境界の判定に含まれました。キャッシュ読み込みだけで 13.9 万トークンを送ると、単価は $0.01 ではなく $0.05 で計算されています
- effort
lowでは、約 3.8 万トークンの日本語資料に対する有無判定で思考トークンが 0 になり、2 回とも誤答しました。mediumとhighは約 440 トークン考えて正答しています。同じlowでも、13.9 万トークンの資料では 260〜308 トークン考えており、lowが常に思考を省くわけではありません - 同じ分類プロンプトで、Haiku 5.5 は API 時間 460ms・$0.00028、Haiku 4.5 は 4,317ms・$0.0020 でした
- 移行で 400 エラーになるのは、
budget_tokens付きの thinking、temperatureなどのサンプリング指定、assistant の prefill、旧 computer use ツール、会話履歴の書き換えの 5 種類です
何が発表されたか
仕様と価格
公式のモデル概要ページと料金ページから、Haiku 5.5 と前後のモデルを並べます。
| 項目 | Claude Haiku 5.5 | Claude Haiku 4.5 | Claude Sonnet 5.5 |
|---|---|---|---|
| API モデル ID | claude-haiku-5-5 |
claude-haiku-4-5-20251001 |
claude-sonnet-5-5 |
| 入力(100 万トークンあたり) | $0.10(100K 超は $0.50) | $1 | $2 |
| 出力(100 万トークンあたり) | $0.50(100K 超は $2.50) | $5 | $10 |
| キャッシュ読み込み | $0.01(100K 超は $0.05) | $0.10 | $0.10 |
| コンテキスト | 1M | 200K | 1M |
| 最大出力 | 128K | 64K | 128K |
| Thinking | Adaptive(既定でオン) | Extended | Adaptive |
| 既定の effort | medium |
非対応 | high |
Haiku 5.5 の信頼できる知識カットオフは 2026 年 6 月で、Sonnet 5.5・Opus 5.5 と同じです。
claude-haiku-5-5 は日付を持たない固定の ID で、別のエイリアスはありません。Amazon Bedrock では anthropic.claude-haiku-5-5、Google Cloud・Microsoft Foundry・Claude Platform on AWS では claude-haiku-5-5 を指定します。Batch API は 50% 引きで、100K 以下なら入力 $0.05 / 出力 $0.25 です。
公式発表は「平均すると Haiku 4.5 より約 75% 安く動かせる」と説明しています。脚注によると、Haiku 4.5 のリクエストの約 90% を占める 100K 以下のリクエストで 90% 安く、それを超えるリクエストで 50% 安く、新しいトークナイザーで増えるトークン数も織り込んだ数字です。
公式ベンチマーク
公式発表に載っている数値の一部です(Haiku 5.5 の effort 条件は発表ページに記載がありません)。
| ベンチマーク | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 39.2% | 0.0% | 70.6% |
| OSWorld 2.1(オフライン部分集合) | 72.4% | 15.7% | 83.9% |
| Humanity's Last Exam(ツールなし) | 45.9% | 10.2% | 56.9% |
| GDPval-AA v2.1(Elo) | 1620 | 735 | 1840 |
用途として公式が挙げているのは、分類・ルーティング・抽出・要約・サブエージェントのように、件数が多く待ち時間に厳しい処理です。
最小の呼び出し方
モデル ID を差し替え、必要なら effort を指定します。以下は公式ドキュメントの形に沿ったコード例で、本記事の環境では API キーで実行していません。
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=1024,
# 指定しなければ adaptive thinking・effort medium で動く
output_config={"effort": "medium"},
messages=[{"role": "user", "content": "この問い合わせを billing / bug / feature / other に分類して"}],
)
# 応答の先頭が thinking ブロックになりうるので、位置ではなく type で取り出す
answer = next(b.text for b in response.content if b.type == "text")
print(answer)
Claude Code では、claude --model claude-haiku-5-5 で起動するか、サブエージェント定義の model に指定します。
Claude Code から呼び出して確かめたこと
100,000 トークンの境界で料金計算がどう変わるか
本リポジトリの運用ドキュメント(日本語の Markdown)を約 19 万文字つなげた資料を作り、--effort low で Haiku 5.5 に渡しました。同じ資料を続けて 2 回送り、1 回目はキャッシュへの書き込み、2 回目はキャッシュからの読み込みになっています。
claude -p --model claude-haiku-5-5 --effort low --output-format json \
--no-session-persistence --tools "" \
--system-prompt "あなたは簡潔に日本語で答えるアシスタントです。" < prompt-190k.txt
結果は次のとおりです(total_cost_usd は Claude Code が単価表から計算した値です)。
| 実行 | 入力の内訳 | 出力 | total_cost_usd |
|---|---|---|---|
| 1 回目 | キャッシュ書き込み 138,702 | 312 | $0.139483 |
| 2 回目 | キャッシュ読み込み 138,702 | 264 | $0.0075961 |
この値を単価から逆算すると、どちらの単価帯で計算されたかが分かります。claude -p のキャッシュ書き込みは 1 時間 TTL(ephemeral_1h_input_tokens)として記録されていたため、1 時間キャッシュの書き込み単価で計算します。
| 実行 | 100K 以下の単価で計算した場合 | 100K 超の単価で計算した場合 | 実測値 |
|---|---|---|---|
| 1 回目 | 138,702 × $0.20 + 312 × $0.50 = 約 $0.0279 | 138,702 × $1 + 312 × $2.50 = 約 $0.1395 | $0.139483 |
| 2 回目 | 138,702 × $0.01 + 264 × $0.50 = 約 $0.0015 | 138,702 × $0.05 + 264 × $2.50 = 約 $0.0076 | $0.0075961 |
(単価はすべて 100 万トークンあたり)
実測値は 2 回とも 100K 超の単価と一致しました。ここから読み取れるのは次の 3 点です。
- 100,000 トークンを超えた分だけでなく、プロンプト全体が高い単価で計算される
- 出力トークンの単価も $0.50 から $2.50 に上がる
- キャッシュから読んだトークンも「プロンプトの長さ」に含まれる。2 回目は新しく送った入力が 2 トークンしかないのに、高い単価で計算されている
公式の料金ページは「100,000 トークンを超えるプロンプトは高い価格を払う」とだけ書いており、キャッシュ分を含むかは明記していません。上の結果は Claude Code の計算がそう実装されていることを示すもので、実際の請求額で確かめたものではありません。
比較のため、約 5 万文字(38,082 トークン)の資料では、1 回目が $0.0076186 でした。これは 38,082 × $0.20 + 出力 4 × $0.50 の 100K 以下の単価と一致します。
Claude Code のサブエージェントで使うときの目安
Claude Code を既定の構成で claude -p --model claude-haiku-5-5 として 1 回呼び出したところ、短い質問 1 つでも入力は 33,297 トークン(キャッシュ読み込み 25,984・キャッシュ書き込み 7,311・新規 2)でした。システムプロンプトとツール定義だけで約 3.3 万トークンあることになります。
ファイルを何本か読むと、残り約 6.7 万トークンはすぐに埋まります。境界を超えたあとは、同じ会話を続けるかぎりキャッシュ読み込みも高い単価になります。サブエージェントで Haiku 5.5 を使うなら、1 つのサブエージェントに読ませる範囲を絞るか、長い調査は Sonnet 5.5 に任せるかを、トークン数の見積もりで決めるのが安全です。Sonnet 5.5 は入力 $2 ですが、1M まで単価が変わりません。100K 超の Haiku 5.5(入力 $0.50)はそれでも Sonnet 5.5 の 4 分の 1 なので、超えたら損というわけではありません。
effort で思考トークンと答えがどう変わるか
約 5 万文字(38,082 トークン)の日本語資料を渡し、「この資料の中に『投稿上限』という語は出てくるか。はい / いいえ の 1 語で答えて」と聞きました。資料にこの語は含まれていないので、正解は「いいえ」です。
| モデル | effort | 思考トークン | 出力 | API 時間 | 答え |
|---|---|---|---|---|---|
| Haiku 5.5 |
low(1 回目) |
0 | 4 | 610ms | はい(誤り) |
| Haiku 5.5 |
low(2 回目) |
0 | 4 | 488ms | はい(誤り) |
| Haiku 5.5 | medium |
436 | 442 | 2,505ms | いいえ |
| Haiku 5.5 | high |
460 | 466 | 2,637ms | いいえ |
| Haiku 4.5 | (Claude Code の既定) | 635 | 644 | 5,632ms | いいえ |
low では 2 回とも考えずに即答し、2 回とも誤りました。一方、前節の 13.9 万トークン資料(同じく low)では 260〜308 トークン考えて正答しています。公式の effort ドキュメントも、低い effort では簡単だと判断した問題で思考を省くと説明しており、「省くかどうか」はモデルが入力ごとに決めています。medium と high は約 440 トークン考え、正しく答えています。この入力では medium と high の差はほとんどありませんでした。試行回数は条件ごとに 1〜2 回なので、「low は必ず間違える」とまでは言えません。ただ、長い資料を読んで判断させる用途で low を選ぶと、思考を丸ごと省いた答えが返ることがある、という点は押さえておく必要があります。
公式の移行ガイドは、Haiku 4.5 で thinking を使っていなかった処理には低い effort を選ぶよう案内しています。分類のように答えが短く、入力を読めば決まる処理ではそれで問題ありません。下の分類プロンプトでは、high を指定しても思考トークンは 0 で、出力は同じでした。
なお、effort を low → medium → high と変えて同じ資料を送ったとき、キャッシュ書き込みが毎回 38,082 トークン発生しました。そのあと low に戻すとキャッシュ読み込みになっています。この環境では effort の値ごとにキャッシュが分かれて見えました。会話の途中で effort を切り替える設計にするなら、キャッシュの効き方を一度確かめておくとよいでしょう。
Haiku 4.5 と比べた速度とコスト
問い合わせ文を billing / bug / feature / other に分類させるプロンプトを、両モデルに同じシステムプロンプトで送りました。
| 項目 | Haiku 5.5 | Haiku 4.5 |
|---|---|---|
| 入力トークン | 1,388 | 1,108 |
| 思考トークン | 0 | 147 |
| 出力トークン | 4 | 183 |
| 初回トークンまで(TTFT) | 493ms | 4,076ms |
| API 時間 | 460ms | 4,317ms |
total_cost_usd |
$0.00028 | $0.0020 |
| 答え | billing | billing(理由の説明つき) |
この 1 プロンプトでは、Haiku 5.5 はコストが約 7 分の 1、API 時間が約 9 分の 1 でした。なお、Haiku 5.5 側の入力は 1 時間キャッシュの書き込み($0.20)として、Haiku 4.5 側は通常の入力($1)として計算されており、入力の課金条件は揃っていません。差の大部分は、Haiku 4.5 が 147 トークン考えたうえに説明まで付けたのに対し、Haiku 5.5 が 1 語で答えたことから来ています。単価の差(10 分の 1)とは別の要因が混ざっているので、自分のワークロードでは出力の長さも含めて比べる必要があります。
入力トークンは、同じテキストでも Haiku 5.5 の方が多くなります。この分類プロンプトでは 1,108 → 1,388(約 25% 増)、約 5 万文字の日本語資料では 34,824 → 38,084(約 9% 増)でした。公式ドキュメントは新しいトークナイザーで「約 30% 増える、増え方は内容による」と説明しています。max_tokens やコスト見積もりは、Haiku 4.5 の数字を流用せずに数え直すのが確実です。
Haiku 4.5 からの移行で直すこと
公式の移行ガイドにあるチェック項目を、400 エラーになるものと挙動が変わるものに分けて整理します(本記事の環境では Messages API を直接呼べないため、400 エラーは公式ドキュメントの記載です)。
| 変更 | 種類 | 対処 |
|---|---|---|
thinking: {"type": "enabled", "budget_tokens": N} |
400 エラー |
{"type": "adaptive"} にして output_config.effort で調整する |
temperature / top_p / top_k
|
400 エラー | 削除する。temperature は 1、top_p は 0.99 のみ受け付け、両方の同時指定と top_k は値に関係なくエラー |
| assistant の prefill(最後が assistant ターン) | 400 エラー | user ターンで終える。形式の固定は structured outputs かツールで行う |
computer_20250124 |
400 エラー(Claude API・Google Cloud) |
computer_toolset_20260801 に移る |
thinking ブロックを返すときの system・tools・過去メッセージの変更 |
400 エラー(2026-08-31 00:00 UTC より前に作成したアカウントは thinking.block_binding.prefix_mismatch_behavior を指定したときのみ) |
会話を追記のみにする |
| 応答の先頭が thinking ブロックになる | 挙動の変更 | content を type で選ぶ |
| thinking の本文が既定で空 | 挙動の変更 | 要約が必要なら thinking.display を "summarized" にする |
thinking トークンが max_tokens に含まれる |
挙動の変更 | 小さい max_tokens を引き上げるか effort を下げる |
| 安全分類器による拒否 | 新規 |
stop_reason: "refusal" を処理する(サーバー側のフォールバックなし) |
| Priority Tier | 非対応 | Haiku 4.5 で契約している場合は容量を別に計画する |
Claude Code を使っているなら、公式ドキュメントが案内している /claude-api migrate this project to claude-haiku-5-5 で、モデル ID の差し替えとパラメーターの修正をまとめて提案させることもできます。
新しく使えるようになった機能としては、ブラウザー操作ツール(browser_toolset_20260801)が Claude API と Google Cloud で使えるようになりました。Haiku 4.5 では使えなかったものです。
まとめ
Claude Haiku 5.5 は、100,000 トークン以下のリクエストでは Haiku 4.5 の 10 分の 1 の単価で動き、実測でも分類のような短い処理では 1 秒を切る応答でした。
一方で、料金は「プロンプト全体が 100,000 トークンを超えたかどうか」で 5 倍に変わります。Claude Code の計算では、キャッシュから読んだ分も長さに含まれていました。Claude Code のサブエージェントのように、最初から 3 万トークンを超える文脈を持つ使い方では、境界を超える前提でコストを見積もる必要があります。
effort の既定は medium です。コストを下げようとして low にすると、長い資料の判定では考えずに答えて誤ることがありました。切り替えるときは、モデル ID の差し替えと 400 エラーの対処に加えて、自分の入力で effort ごとの正誤を一度測っておくのが安全です。
関連記事
- Claude Sonnet 5.5リリース、移行で400エラーになる5つの変更点
- Claude Opus 5.5 リリース、Opus 5 からの移行で400エラーになる4つの破壊的変更と対処コード
- Claude CodeのExploreエージェント、コスト最大6.5倍に化けていた
- Claude Codeのモデル指定4経路を実測、haikuエイリアスだけ無言で無視された