0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Claude Haiku 5.5実測、100K超は単価5倍でeffort lowは誤答も

0
Posted at

はじめに

Anthropic は 2026 年 10 月 7 日に Claude Haiku 5.5 を公開しました。Claude 5.5 ファミリーとして、Opus 5.5(9 月 22 日)、Sonnet 5.5(9 月 28 日)に続くリリースです。公式発表は「これまでで最も安く、最も速く、最も高性能な小型モデル」と説明しています。

価格表を見ると、入力 $0.10 / 出力 $0.50(100 万トークンあたり)で、Haiku 4.5 の $1 / $5 から 10 分の 1 になっています。ただし、この単価には「プロンプトが 100,000 トークン以下の場合」という条件が付いています。100,000 トークンを超えると、入力 $0.50 / 出力 $2.50 に上がります。Claude 4.6 以降のモデルは 1M トークンまで単価が変わらないため、Haiku 5.5 だけがこの段階料金の例外です。

もう 1 つの変化は、Haiku として初めて effort パラメーターと adaptive thinking を持ったことです。既定の effort は medium で、何も指定しなければ応答の前に考える場合があります。

本記事では、公式ドキュメントの内容を整理したうえで、Claude Code の非対話モード(claude -p)から Haiku 5.5 と Haiku 4.5 を実際に呼び出し、次の 3 点を確かめた結果をまとめます。

  • 100,000 トークンの境界の前後で、料金の計算がどう変わるか
  • effort を low / medium / high に変えると、思考トークンと答えがどう変わるか
  • 同じ入力で、Haiku 4.5 と比べて速度とコストがどれだけ違うか

対象読者は、Claude API や Claude Code のサブエージェントで Haiku 4.5 を使っていて、Haiku 5.5 への切り替えを検討している開発者です。

検証の範囲

内容 根拠
100,000 トークン境界の前後の料金計算 実機(claude -p の total_cost_usd。Claude Code の算出値で請求額ではない)
effort 別の思考トークン・所要時間・正誤 実機(同じ入力で low / medium / high)
Haiku 4.5 との速度・コスト・入力トークン数の比較 実機(同じ入力・同じシステムプロンプト)
400 エラーになる破壊的変更と移行手順 公式ドキュメント(API キーでの直接呼び出しは未実施)
ベンチマーク・平均 75% 安いという主張 公式発表(未検証)

実機の環境は Claude Code 2.1.293 のクラウド実行環境(Linux)です。Messages API を API キーで直接呼ぶ環境は無いため、すべて claude -p 経由で呼び出しています。ツールは無効化し(--tools "")、システムプロンプトは 1 文に差し替えて、Claude Code 自身のシステムプロンプトが入力に混ざらないようにしました。

TL;DR

  • Claude Haiku 5.5(claude-haiku-5-5)は、プロンプト 100,000 トークン以下なら入力 $0.10 / 出力 $0.50 で、Haiku 4.5 の 10 分の 1 です
  • 100,000 トークンを超えると単価は 5 倍(入力 $0.50 / 出力 $2.50)になります。実測では、超えた分だけでなくプロンプト全体と出力が高い単価で計算されました
  • キャッシュから読んだトークンも境界の判定に含まれました。キャッシュ読み込みだけで 13.9 万トークンを送ると、単価は $0.01 ではなく $0.05 で計算されています
  • effort low では、約 3.8 万トークンの日本語資料に対する有無判定で思考トークンが 0 になり、2 回とも誤答しました。medium と high は約 440 トークン考えて正答しています。同じ low でも、13.9 万トークンの資料では 260〜308 トークン考えており、low が常に思考を省くわけではありません
  • 同じ分類プロンプトで、Haiku 5.5 は API 時間 460ms・$0.00028、Haiku 4.5 は 4,317ms・$0.0020 でした
  • 移行で 400 エラーになるのは、budget_tokens 付きの thinking、temperature などのサンプリング指定、assistant の prefill、旧 computer use ツール、会話履歴の書き換えの 5 種類です

何が発表されたか

仕様と価格

公式のモデル概要ページと料金ページから、Haiku 5.5 と前後のモデルを並べます。

項目 Claude Haiku 5.5 Claude Haiku 4.5 Claude Sonnet 5.5
API モデル ID claude-haiku-5-5 claude-haiku-4-5-20251001 claude-sonnet-5-5
入力(100 万トークンあたり) $0.10(100K 超は $0.50) $1 $2
出力(100 万トークンあたり) $0.50(100K 超は $2.50) $5 $10
キャッシュ読み込み $0.01(100K 超は $0.05) $0.10 $0.10
コンテキスト 1M 200K 1M
最大出力 128K 64K 128K
Thinking Adaptive(既定でオン) Extended Adaptive
既定の effort medium 非対応 high

Haiku 5.5 の信頼できる知識カットオフは 2026 年 6 月で、Sonnet 5.5・Opus 5.5 と同じです。

claude-haiku-5-5 は日付を持たない固定の ID で、別のエイリアスはありません。Amazon Bedrock では anthropic.claude-haiku-5-5、Google Cloud・Microsoft Foundry・Claude Platform on AWS では claude-haiku-5-5 を指定します。Batch API は 50% 引きで、100K 以下なら入力 $0.05 / 出力 $0.25 です。

公式発表は「平均すると Haiku 4.5 より約 75% 安く動かせる」と説明しています。脚注によると、Haiku 4.5 のリクエストの約 90% を占める 100K 以下のリクエストで 90% 安く、それを超えるリクエストで 50% 安く、新しいトークナイザーで増えるトークン数も織り込んだ数字です。

公式ベンチマーク

公式発表に載っている数値の一部です(Haiku 5.5 の effort 条件は発表ページに記載がありません)。

ベンチマーク Haiku 5.5 Haiku 4.5 Sonnet 5.5
Terminal-Bench 4.0 39.2% 0.0% 70.6%
OSWorld 2.1(オフライン部分集合) 72.4% 15.7% 83.9%
Humanity's Last Exam(ツールなし) 45.9% 10.2% 56.9%
GDPval-AA v2.1(Elo) 1620 735 1840

用途として公式が挙げているのは、分類・ルーティング・抽出・要約・サブエージェントのように、件数が多く待ち時間に厳しい処理です。

最小の呼び出し方

モデル ID を差し替え、必要なら effort を指定します。以下は公式ドキュメントの形に沿ったコード例で、本記事の環境では API キーで実行していません。

import anthropic

client = anthropic.Anthropic()

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=1024,
    # 指定しなければ adaptive thinking・effort medium で動く
    output_config={"effort": "medium"},
    messages=[{"role": "user", "content": "この問い合わせを billing / bug / feature / other に分類して"}],
)

# 応答の先頭が thinking ブロックになりうるので、位置ではなく type で取り出す
answer = next(b.text for b in response.content if b.type == "text")
print(answer)

Claude Code では、claude --model claude-haiku-5-5 で起動するか、サブエージェント定義の model に指定します。

Claude Code から呼び出して確かめたこと

100,000 トークンの境界で料金計算がどう変わるか

本リポジトリの運用ドキュメント(日本語の Markdown)を約 19 万文字つなげた資料を作り、--effort low で Haiku 5.5 に渡しました。同じ資料を続けて 2 回送り、1 回目はキャッシュへの書き込み、2 回目はキャッシュからの読み込みになっています。

claude -p --model claude-haiku-5-5 --effort low --output-format json \
  --no-session-persistence --tools "" \
  --system-prompt "あなたは簡潔に日本語で答えるアシスタントです。" < prompt-190k.txt

結果は次のとおりです(total_cost_usd は Claude Code が単価表から計算した値です)。

実行 入力の内訳 出力 total_cost_usd
1 回目 キャッシュ書き込み 138,702 312 $0.139483
2 回目 キャッシュ読み込み 138,702 264 $0.0075961

この値を単価から逆算すると、どちらの単価帯で計算されたかが分かります。claude -p のキャッシュ書き込みは 1 時間 TTL(ephemeral_1h_input_tokens)として記録されていたため、1 時間キャッシュの書き込み単価で計算します。

実行 100K 以下の単価で計算した場合 100K 超の単価で計算した場合 実測値
1 回目 138,702 × $0.20 + 312 × $0.50 = 約 $0.0279 138,702 × $1 + 312 × $2.50 = 約 $0.1395 $0.139483
2 回目 138,702 × $0.01 + 264 × $0.50 = 約 $0.0015 138,702 × $0.05 + 264 × $2.50 = 約 $0.0076 $0.0075961

(単価はすべて 100 万トークンあたり)

実測値は 2 回とも 100K 超の単価と一致しました。ここから読み取れるのは次の 3 点です。

  • 100,000 トークンを超えた分だけでなく、プロンプト全体が高い単価で計算される
  • 出力トークンの単価も $0.50 から $2.50 に上がる
  • キャッシュから読んだトークンも「プロンプトの長さ」に含まれる。2 回目は新しく送った入力が 2 トークンしかないのに、高い単価で計算されている

公式の料金ページは「100,000 トークンを超えるプロンプトは高い価格を払う」とだけ書いており、キャッシュ分を含むかは明記していません。上の結果は Claude Code の計算がそう実装されていることを示すもので、実際の請求額で確かめたものではありません。

比較のため、約 5 万文字(38,082 トークン)の資料では、1 回目が $0.0076186 でした。これは 38,082 × $0.20 + 出力 4 × $0.50 の 100K 以下の単価と一致します。

Claude Code のサブエージェントで使うときの目安

Claude Code を既定の構成で claude -p --model claude-haiku-5-5 として 1 回呼び出したところ、短い質問 1 つでも入力は 33,297 トークン(キャッシュ読み込み 25,984・キャッシュ書き込み 7,311・新規 2)でした。システムプロンプトとツール定義だけで約 3.3 万トークンあることになります。

ファイルを何本か読むと、残り約 6.7 万トークンはすぐに埋まります。境界を超えたあとは、同じ会話を続けるかぎりキャッシュ読み込みも高い単価になります。サブエージェントで Haiku 5.5 を使うなら、1 つのサブエージェントに読ませる範囲を絞るか、長い調査は Sonnet 5.5 に任せるかを、トークン数の見積もりで決めるのが安全です。Sonnet 5.5 は入力 $2 ですが、1M まで単価が変わりません。100K 超の Haiku 5.5(入力 $0.50)はそれでも Sonnet 5.5 の 4 分の 1 なので、超えたら損というわけではありません。

effort で思考トークンと答えがどう変わるか

約 5 万文字(38,082 トークン)の日本語資料を渡し、「この資料の中に『投稿上限』という語は出てくるか。はい / いいえ の 1 語で答えて」と聞きました。資料にこの語は含まれていないので、正解は「いいえ」です。

モデル effort 思考トークン 出力 API 時間 答え
Haiku 5.5 low(1 回目) 0 4 610ms はい(誤り)
Haiku 5.5 low(2 回目) 0 4 488ms はい(誤り)
Haiku 5.5 medium 436 442 2,505ms いいえ
Haiku 5.5 high 460 466 2,637ms いいえ
Haiku 4.5 (Claude Code の既定) 635 644 5,632ms いいえ

low では 2 回とも考えずに即答し、2 回とも誤りました。一方、前節の 13.9 万トークン資料(同じく low)では 260〜308 トークン考えて正答しています。公式の effort ドキュメントも、低い effort では簡単だと判断した問題で思考を省くと説明しており、「省くかどうか」はモデルが入力ごとに決めています。medium と high は約 440 トークン考え、正しく答えています。この入力では medium と high の差はほとんどありませんでした。試行回数は条件ごとに 1〜2 回なので、「low は必ず間違える」とまでは言えません。ただ、長い資料を読んで判断させる用途で low を選ぶと、思考を丸ごと省いた答えが返ることがある、という点は押さえておく必要があります。

公式の移行ガイドは、Haiku 4.5 で thinking を使っていなかった処理には低い effort を選ぶよう案内しています。分類のように答えが短く、入力を読めば決まる処理ではそれで問題ありません。下の分類プロンプトでは、high を指定しても思考トークンは 0 で、出力は同じでした。

なお、effort を low → medium → high と変えて同じ資料を送ったとき、キャッシュ書き込みが毎回 38,082 トークン発生しました。そのあと low に戻すとキャッシュ読み込みになっています。この環境では effort の値ごとにキャッシュが分かれて見えました。会話の途中で effort を切り替える設計にするなら、キャッシュの効き方を一度確かめておくとよいでしょう。

Haiku 4.5 と比べた速度とコスト

問い合わせ文を billing / bug / feature / other に分類させるプロンプトを、両モデルに同じシステムプロンプトで送りました。

項目 Haiku 5.5 Haiku 4.5
入力トークン 1,388 1,108
思考トークン 0 147
出力トークン 4 183
初回トークンまで(TTFT) 493ms 4,076ms
API 時間 460ms 4,317ms
total_cost_usd $0.00028 $0.0020
答え billing billing(理由の説明つき)

この 1 プロンプトでは、Haiku 5.5 はコストが約 7 分の 1、API 時間が約 9 分の 1 でした。なお、Haiku 5.5 側の入力は 1 時間キャッシュの書き込み($0.20)として、Haiku 4.5 側は通常の入力($1)として計算されており、入力の課金条件は揃っていません。差の大部分は、Haiku 4.5 が 147 トークン考えたうえに説明まで付けたのに対し、Haiku 5.5 が 1 語で答えたことから来ています。単価の差(10 分の 1)とは別の要因が混ざっているので、自分のワークロードでは出力の長さも含めて比べる必要があります。

入力トークンは、同じテキストでも Haiku 5.5 の方が多くなります。この分類プロンプトでは 1,108 → 1,388(約 25% 増)、約 5 万文字の日本語資料では 34,824 → 38,084(約 9% 増)でした。公式ドキュメントは新しいトークナイザーで「約 30% 増える、増え方は内容による」と説明しています。max_tokens やコスト見積もりは、Haiku 4.5 の数字を流用せずに数え直すのが確実です。

Haiku 4.5 からの移行で直すこと

公式の移行ガイドにあるチェック項目を、400 エラーになるものと挙動が変わるものに分けて整理します(本記事の環境では Messages API を直接呼べないため、400 エラーは公式ドキュメントの記載です)。

変更 種類 対処
thinking: {"type": "enabled", "budget_tokens": N} 400 エラー {"type": "adaptive"} にして output_config.effort で調整する
temperature / top_p / top_k 400 エラー 削除する。temperature は 1、top_p は 0.99 のみ受け付け、両方の同時指定と top_k は値に関係なくエラー
assistant の prefill(最後が assistant ターン) 400 エラー user ターンで終える。形式の固定は structured outputs かツールで行う
computer_20250124 400 エラー(Claude API・Google Cloud) computer_toolset_20260801 に移る
thinking ブロックを返すときの system・tools・過去メッセージの変更 400 エラー(2026-08-31 00:00 UTC より前に作成したアカウントは thinking.block_binding.prefix_mismatch_behavior を指定したときのみ) 会話を追記のみにする
応答の先頭が thinking ブロックになる 挙動の変更 content を type で選ぶ
thinking の本文が既定で空 挙動の変更 要約が必要なら thinking.display を "summarized" にする
thinking トークンが max_tokens に含まれる 挙動の変更 小さい max_tokens を引き上げるか effort を下げる
安全分類器による拒否 新規 stop_reason: "refusal" を処理する(サーバー側のフォールバックなし)
Priority Tier 非対応 Haiku 4.5 で契約している場合は容量を別に計画する

Claude Code を使っているなら、公式ドキュメントが案内している /claude-api migrate this project to claude-haiku-5-5 で、モデル ID の差し替えとパラメーターの修正をまとめて提案させることもできます。

新しく使えるようになった機能としては、ブラウザー操作ツール(browser_toolset_20260801)が Claude API と Google Cloud で使えるようになりました。Haiku 4.5 では使えなかったものです。

まとめ

Claude Haiku 5.5 は、100,000 トークン以下のリクエストでは Haiku 4.5 の 10 分の 1 の単価で動き、実測でも分類のような短い処理では 1 秒を切る応答でした。

一方で、料金は「プロンプト全体が 100,000 トークンを超えたかどうか」で 5 倍に変わります。Claude Code の計算では、キャッシュから読んだ分も長さに含まれていました。Claude Code のサブエージェントのように、最初から 3 万トークンを超える文脈を持つ使い方では、境界を超える前提でコストを見積もる必要があります。

effort の既定は medium です。コストを下げようとして low にすると、長い資料の判定では考えずに答えて誤ることがありました。切り替えるときは、モデル ID の差し替えと 400 エラーの対処に加えて、自分の入力で effort ごとの正誤を一度測っておくのが安全です。

関連記事

参考リンク

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?