0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

待望のClaude Haiku 5.5がリリース!! Lunaを超えるコスパモデルになり得るか?

0
Posted at

Claude Haiku 5.5が発表

image.png

2026年10月7日、AnthropicがClaude Haiku 5.5を正式リリースしました。

「史上最安、最速、最高性能の小型モデル」というキャッチコピーは誇張ではありません。前世代のHaiku 4.5と比べて最大90%のコスト削減を達成しながら、ベンチマーク上の性能は軒並み大幅に向上しています。

この記事では公式情報をもとに、Haiku 5.5が何を変えたのか、どんな用途に向いているのかを整理します。

何がそんなにすごいのか

まず数字で見てみましょう。

価格比較

項目 Haiku 5.5(~100k tokens) Haiku 5.5(100k超) Haiku 4.5 Sonnet 5.5
入力($/1M tokens) $0.10 $0.50 $1.00 $2.00
出力($/1M tokens) $0.50 $2.50 $5.00 $10.00
キャッシュ読み込み $0.01 $0.05 $0.10 $0.10
キャッシュ書き込み $0.125 $0.625 $1.25 $2.50

100,000トークン未満のリクエストでは、Haiku 4.5と比べて入力・出力ともに90%の値下がりです。

Anthropicによると、旧Haikuモデルへのリクエストのうち約90%がこのカテゴリに該当するとのことなので、実用上の恩恵は非常に大きいといえます。

トークナイザーの変更に注意
Haiku 5.5はSonnet 5.5やOpus 5.5と同じ新しいトークナイザーを採用しています。
同じテキストでも若干トークン数が増えるため、「1トークンあたり90%安い=コストが90%削減」とは単純にならない点に注意が必要です。実際のコスト削減幅は用途によって異なります。

性能はどれくらい上がったか

image.png

数字が並んでいるだけでは実感しにくいので、ベンチマークごとに何が変わったのかを掘り下げます。

知識作業:スコアが2倍超に

GDPval-AA v2.1は、44の職種を想定した実務シナリオでエージェントを評価するベンチマークです。

Haiku 4.5のスコアが735だったのに対し、Haiku 5.5は1620。2.2倍という伸び率です。AA-Briefcase v1.1でも614 → 1578と2.6倍に達しています。

GPT-6 LunaはGDPval-AA v2.1で1437、AA-Briefcase v1.1で1336のスコアを持ちますが、Haiku 5.5はそれぞれ12.7%・18.1%上回っています。

「小型モデルで実務タスクをこなす」という文脈では、コストを大幅に抑えながらGPT-6 Lunaを凌駕する実力があることを意味します。

コンピュータユース:一気に実用レベルへ

OSWorld 2.1(オフラインサブセット)は、実際のPC上でマルチステップのタスクをこなす能力を測るベンチマークです。Haiku 4.5のスコアは**15.7%で、率直に言えば実用に耐えない水準でした。それがHaiku 5.5では72.4%**まで跳ね上がっています。

伸び率は4.6倍。GPT-6 Lunaの48.9%を大きく引き離し、上位モデルのSonnet 5.5(83.9%)との差も11.5ポイントに縮まりました。Haikuクラスのモデルがブラウザ操作やデスクトップ自動化に使えるようになったのは、今回のリリースで最も大きな質的変化のひとつといえます。

コーディング:「0点」から「実用域」へ

Terminal-Bench 4.0は、コマンドラインで複雑な多段階タスクをこなす能力を評価するベンチマークです。

Haiku 4.5のスコアは0.0%でした。それがHaiku 5.5では39.2%に到達しています。
GPT-6 Lunaの16.4%と比べると2.4倍
の差があり、単純なコーディング補助としてはHaiku 5.5で十分な場面が多くなりそうです。

FrontierCode 1.1(Main)ではHaiku 5.5が46.4%に対してGPT-6 Lunaが42.4%。

こちらもHaiku 5.5のほうが上回っています。なおCognitionは、Devin FusionにHaiku 5.5をサイドキックとして組み込んだ結果、FrontierCodeスコア66.2を達成したと報告しています。

Opus 5.5などの上位モデルとの組み合わせで、コスト効率の高いコーディングパイプラインを構築できます。

視覚推論:7倍超の跳ね上がり

Chartography(ツールなし)ではHaiku 4.5が**6.4%だったスコアが、Haiku 5.5では46.4%**に到達しています。

伸び率は7.3倍で、今回のベンチマーク比較の中でも最も劇的な向上です。グラフや図表の読み取り、ビジュアルデータへの質問応答といった用途が現実的な選択肢になります。

世代間の変化まとめ

ベンチマーク Haiku 4.5 Haiku 5.5 倍率
GDPval-AA v2.1 735 1620 ×2.2
AA-Briefcase v1.1 614 1578 ×2.6
OSWorld 2.1 15.7% 72.4% ×4.6
HLE(ツールあり) 18.7% 57.4% ×3.1
Terminal-Bench 4.0 0.0% 39.2% (0→実用域)
Chartography 6.4% 46.4% ×7.3

コスト削減だけでなく、性能面でもHaiku 4.5とは別次元のモデルになっています。

新機能:努力量(effort)の調整が可能に

Haikuクラスのモデルとしては初めて、**adjustable effort setting(努力量の調整)**が搭載されました。
Low / Medium / High / Xhigh / Maxの5段階から選択でき、コスト優先か知性優先かをタスクごとに選べます。

公式のチャートを見ると、OSWorld 2.1ではeffortを上げるほどスコアが伸び、最高設定(Max)ではSonnet 5.5の低effort設定に迫るスコアを出せることがわかります。

一方でコストはeffortに比例して増加するため、用途に応じた選択が重要です。

実際の使い分けイメージとしては、次のようになります。

  • Low:大量の分類・タグ付け、定型文の要約など繰り返し処理
  • Medium:一般的なカスタマーサポートの問い合わせ対応
  • High / Xhigh:コード補完、ドキュメントの読み取りと抽出
  • Max:精度が優先される複雑なコンピュータ操作やマルチステップ推論

Sonnet 5.5やOpus 5.5はすでにeffort設定を持っており、今回Haiku 5.5がこれに加わったことで、全モデルでコストと性能をタスク単位でコントロールできる体制が整いました。

同じHaiku 5.5を使いながら、処理内容によってeffortを切り替えるだけで、支出を最適化できます。

どんな用途に向いているか

Anthropic自身は「高ボリューム・コスト重視のタスク向け」と位置づけています。具体的には次のような用途です。

  • 要約・圧縮(compaction):長い会話履歴や文書の要約
  • 分類・データ抽出:大量レコードへのラベル付け、感情分析
  • サブエージェント処理:Opus 5.5やSonnet 5.5の指示を受けて実作業をこなす役割
  • カスタマーサポートチャットボット:レスポンス速度が重要なリアルタイム対応
  • ブラウザ使用・コンピュータ操作:OSWorldスコアが示すように、マルチステップのUI操作にも実用的
  • 視覚データの読み取り:グラフや図表への質問応答(Chartographyで46.4%)

企業の実測データまとめ

公式ページには、早期テストに参加した企業からの実績コメントが掲載されています。ベンチマーク上の数字だけでなく、実運用での変化が具体的に示されているので引用します。

Asanaは、バグのトリアージやプロジェクト管理のエージェントタスクで評価を実施しました。
結果として、タスク完了までのレイテンシが30%以上削減し、エージェントのターンあたりの推論速度は最大2.5倍に向上したと報告しています。

HubSpotは、CRMタスク(案件レポートなど)のシミュレーション評価でHaiku 5.5を検証しました。
同社がテストした小型モデルの中で、平均**92.8%**という最高スコアを記録したとのことです。

また古くなった曖昧なレコードを識別するタスクでは、テストした全モデルの中で最速の処理速度・最高のヒット率・最低の誤検知率を達成したとしています。

AlphaSenseは週に約800万回のAPI呼び出しが発生する「ドキュメント内質問応答」機能で評価を行いました。
400クエリのテストセットでHaiku 4.5が0.76だったスコアがHaiku 5.5では0.84に改善し、統計的に有意な向上を確認しています。

Boxは大量のエンタープライズコンテンツを対象に評価を実施し、Haiku 4.5比で11ポイント高い精度かつ約半分のレイテンシを達成したと報告しています。

同時発表された追加アップデート

Haiku 5.5のリリースと同時に、いくつかの周辺アップデートも発表されました。

Sonnet 5.5のキャッシュ読み込み料金が半額に

Claude Sonnet 5.5のキャッシュ読み込み料金が$0.20/1Mから $0.10/1M に値下がりしました。キャッシュ読み込みはエージェントタスクでトークン消費の大きな割合を占めるため、ほとんどの長時間稼働タスクで約20%のコスト削減になります。

Max・Team向けに月次APIクレジットを追加

今週中に、MaxおよびTeamプランの全ユーザーに月次のAPIクレジットが付与されます。

  • Max 5x:月$100
  • Max 20x:月$200
  • Team:最大$500(チーム全体でプール)

Claude Codeなどを使ってアプリやエージェントを試し作りしたいユーザーには、うれしい追加です。

Python/TypeScript SDKのコンピュータ使用・ブラウザ使用サポート(ベータ)

Claude PlatformのPython/TypeScript SDKがアップデートされ、コンピュータ使用とブラウザ使用のベータサポートが追加されました。Haiku 5.5の速度と低コストは、これらの用途に特によくマッチします。

まとめ

Claude Haiku 5.5で変わったことを整理します。

観点 変化
コスト 100k未満のリクエストで最大90%削減(トークナイザー変更の影響は別途考慮)
性能 コーディング・コンピュータ使用・推論のいずれも大幅向上
競合比較 GPT-6 Lunaをコスト・性能ともに複数ベンチマークで上回る
新機能 effort設定(Low〜Max)の追加で用途別チューニングが可能に
向いている用途 大量処理、サブエージェント、分類、カスタマーサポート、ブラウザ操作

参考リンク

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?