0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Claude Haiku 5.5とGPT-6 LunaのAPI費用を比較する:トークン境界と合格率

0
Posted at

Beat API Team · 仕様・価格の確認日:2026年10月9日

短い要約、分類、抽出では、両モデルを同じ検証基準で評価します。入力が10万を超えて27万2,000以下なら、公式のトークン単価はLunaの方が低くなります。ツールを使う処理では、実際に利用するエンドポイントと呼び出しの流れを先に確認します。 公開ベンチマークは候補を絞る材料ですが、本番の選定には業務ごとの評価が必要です。

判断の軸は4つあります。

  • 短い入力に対する公式単価は、両方とも100万トークンあたり入力$0.10、出力$0.50です。
  • Haikuは入力10万超、Lunaは27万2,000超で上位の単価になります。
  • BeatAPIの掲載価格は、通常の入力・出力でHaikuが$0.05/$0.25、Lunaが$0.04/$0.20です。
  • JSONとして読めるだけでは合格にせず、処理の意味と根拠を検証します。

開示: 著者はBeatAPIの開発チームです。この記事では公式仕様、確認時点の公開価格、仮定に基づく計算を区別しています。品質・遅延の比較実験、認証付きの動作確認、価格境界をまたぐ精算実験は行っていません。

Claude Haiku 5.5とGPT-6 Lunaの比較は、処理の定義から始める

両モデルはテキストと画像を入力し、テキストを返します。Haikuの公表コンテキスト上限は100万、Lunaは105万トークンで、通常の最大出力はいずれも12万8,000です。容量は検索精度や、接続先での全機能への対応を保証しません。Haikuの仕様、Lunaの仕様を参照してください。

処理 採用できる条件 一般的な順位表では見えない失敗
顧客との会話を要約 約束、日時、未解決事項、根拠が正しい 提案しただけの期日を合意済みとする
問い合わせを分類 自社の分類規則に合い、判断保留も適切 規約の例外を通常の請求窓口へ回す
資料から値を抽出 正しい値を元資料の箇所に結びつける 別の会計期間の数字を返す
ツールを選ぶ 許可されたツール、正しい引数、権限の文脈 利用者が依頼していない処理を提案
長文を検索 関連箇所を横断した根拠が正しい 本則から離れた例外を見落とす

すべてを1つの平均点にまとめると、重要な差を隠します。1項目の抽出が得意でも、約束の意味を読む要約が得意とは限りません。処理ごとに合格条件を定義してください。

Haiku 5.5とGPT-6 LunaのAPI料金:10万と27.2万の境界

以下は通常APIの公式価格で、100万トークンあたりの米ドルです。バッチ処理などの割引、速度の追加料金、地域指定、別途課金されるツールは除きます。キャッシュ書き込みの比較は単価の比較であり、有効期限や管理方法が同じという意味ではありません。

課金項目 Haiku:10万以下 Haiku:10万超 Luna:27.2万以下 Luna:27.2万超
新規入力 $0.10 $0.50 $0.10 $0.20
キャッシュ読み取り $0.01 $0.05 $0.01 $0.02
キャッシュ書き込み $0.125、5分 $0.625、5分 $0.125 $0.25
出力 $0.50 $2.50 $0.50 $0.75

境界を超えると、超過分だけでなくリクエスト全体に上位単価が適用されます。Anthropicはキャッシュ読み取りと書き込みも入力長に含むと明記しています。Lunaも27万2,000を超える入力では全リクエストを上位単価にすると案内しています。Anthropic価格、OpenAI価格、Lunaの条件が出典です。

入力を3つの範囲に分けると、判断しやすくなります。

  1. 10万以下: 表にある課金項目の単価は同じです。
  2. 10万超〜27万2,000以下: 同じ使用量ならHaikuの単価はLunaの5倍です。
  3. 27万2,000超: 新規入力とキャッシュの単価比は2.5倍、出力は約3.33倍です。合計額の比率は構成で変わります。

同じ資料でもモデルごとのトークン数や生成する推論量は異なり得ます。「単価が同じ」と「請求額が同じ」は区別してください。

BeatAPIの掲載価格は別に確認する

10月9日の公開価格APIには、claude-haiku-5-5とgpt-6-lunaの以下の価格が掲載されていました。

項目 Haiku:通常 Haiku:long_context Luna:通常 Luna:272k_plus
新規入力 $0.05 $0.25 $0.04 $0.08
キャッシュ読み取り $0.005 $0.025 $0.004 $0.008
キャッシュ書き込み $0.0625 $0.3125 $0.05 $0.10
出力 $0.25 $1.25 $0.20 $0.30

Haikuの1時間キャッシュ書き込みは別項目で$0.10/$0.50です。

同じ短い入力と出力なら、掲載価格ではLunaがHaikuより20%安く、逆にHaikuはLunaより25%高くなります。分母が違うため、両方の割合は両立します。公式の2つの境界の間では、この掲載単価の比率は6.25倍です。

確認できたのは公開価格です。実際のキャッシュ、境界をまたぐ精算、出力の同等性、稼働率、モデル別のツール対応は未検証です。以下は公式の境界を予算上の仮定として計算しています。現在の価格を利用前に再確認してください。

境界が見える7つの計算例

重複しない課金項目で計算します。出力には該当する場合の推論を含め、画面に見える文章だけで計算しません。

費用 = (新規入力 × 入力単価
      + キャッシュ読み取り × 読み取り単価
      + キャッシュ書き込み × 書き込み単価
      + 課金対象の出力 × 出力単価) / 1,000,000
仮定した使用量 公式Haiku 公式Luna BeatAPI Haiku BeatAPI Luna
新規2,000+出力500 $0.00045 $0.00045 $0.000225 $0.00018
新規100,000+出力2,000 $0.011 $0.011 $0.0055 $0.0044
新規100,001+出力2,000 $0.0550005 $0.0110001 $0.02750025 $0.00440004
新規150,000+出力2,000 $0.080 $0.016 $0.040 $0.0064
キャッシュ190,000+新規10,000+出力2,000 $0.0195 $0.0039 $0.00975 $0.00156
新規272,001+出力2,000 $0.1410005 $0.0559002 $0.07050025 $0.02236008
新規400,000+出力5,000 $0.2125 $0.08375 $0.10625 $0.0335

実測した請求額ではありません。 両モデルのトークン数を同じと仮定し、ツール、検証、再試行、人の確認を除いています。キャッシュの例には以前の書き込み費用も含みません。

入力20万の例では、新規入力は1万だけでもHaikuは上位単価です。新規入力だけを表示する画面では、費用の原因が見えなくなります。40万の例では、Haiku/Lunaの合計比率は公式価格で約2.54倍、BeatAPIの掲載価格で約3.17倍です。入力単価の比率だけで合計を説明しないようにします。

長文の分割にも追加費用がある

入力15万・出力2,000を直接処理すると、公式価格ではHaikuが$0.080、Lunaが$0.016です。

別のHaiku構成として、総入力50,000・出力500の抽出を3回行い、総入力5,000・出力1,000の統合を1回行うとします。抽出は合計$0.01575、統合は$0.001で、全体は**$0.01675**です。BeatAPIの掲載価格では$0.008375で、Luna直接処理の$0.0064より高くなります。

直接Haikuより安くなっても、Lunaより安いとは限りません。さらに、分割をまたぐ根拠が失われたり、統合で誤りが増えたりします。独立した抽出と統合で合格基準を満たせる場合に評価し、重複入力、指示の再送、検索漏れ、再試行、最終確認まで含めて判断します。

Haikuの正確さは、どれだけ高ければ価格差を埋められるか

C_HとC_Lを失敗した試行も含む入力1件あたりの平均総費用、s_Hとs_Lを採用できた処理の割合とします。

Haikuの採用1件あたりの費用 = C_H / s_H
Lunaの採用1件あたりの費用  = C_L / s_L

Haikuが安くなる条件:s_H / s_L > C_H / C_L

採用率がゼロの場合はこの比率を計算できません。

短い入力のBeatAPI例では費用比が1.25です。Lunaの採用率が仮に70%なら、Haikuは87.5%を超える必要があります。Lunaが90%なら必要なHaiku採用率は112.5%となり、採用率の改善だけでは価格差を埋められません。

入力15万の掲載価格比は6.25です。Lunaの採用率を80%と仮定すれば、Haikuは500%が必要となり、同じく不可能です。これは両モデルの実測採用率ではなく、固定した使用量での損益分岐点です。

誤りが重大な費用につながる業務なら、高い精度に追加費用を払う判断はあり得ます。その場合は、推論費用だけの削減と混同せず、次を明示します。

総費用 = 推論 + ツール + 検証 + 修正 + 誤りの費用

採用1件あたりの費用には採用率を併記してください。難しい入力を捨てるだけの方式が、効率よく見えることを防げます。

公開ベンチマークを使える範囲

Anthropicの発表には次の比較があります。

公開評価 Haiku 5.5 GPT-6 Luna
OSWorld 2.1、オフライン部分集合 72.4% 48.9%
Terminal-Bench 4.0 39.2% 16.4%
FrontierCode 1.1 Main 46.4% 42.4%
GDPval-AA v2.1 1620 1437

ベンダー公表値であり、本記事による再現実験や同一予算の比較ではありません。OSWorldの部分集合という条件を保ち、GDPvalのElo形式の点数を成功率として扱わないようにします。

HaikuをAgent処理の評価候補に入れる根拠にはなりますが、自社の分類規則での正確さ、再試行、生成トークン数、速度は別に測ります。推論設定の名前が同じでも、同じ計算量や精度とは限りません。同じ設定の評価に加え、同じ合格水準へ調整した構成を比較してください。

APIの互換性も選定条件になる

HaikuのMessages形式はoutput_config.effort、LunaのResponses形式はreasoning.effortを使います。Lunaの公式仕様は組み込みツールと関数呼び出しにResponsesを案内し、Chat Completionsでの関数呼び出しをreasoning_effort: noneに限定しています。Lunaの仕様で確認できます。

Haikuの移行資料には、サンプリング引数、adaptiveな推論、assistantの事前入力に関する変更があります。先頭ブロックを回答と決めつけず、typeでテキストを選びます。推論が出力上限を消費する場合も扱います。

BeatAPIの公開契約には/v1/messagesと/v1/responsesがあります。経路の存在だけで、各社の組み込みツールと同じ機能や、すべての引数の転送を保証しません。実際の経路で小さな確認用呼び出しを行ってから利用してください。

短い分類では同じ意味の指示を使い、エンドポイントごとに別のリクエストを組み立てます。次の例は実行すると課金対象であり、本記事では認証付き実行をしていません。

Haiku、POST /v1/messages:

{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "output_config": {"effort": "low"},
  "messages": [{
    "role": "user",
    "content": "Classify the ticket as billing, bug, feature, or needs_review. Return only a JSON object with exactly label and evidence. Evidence must be a nonempty exact quote from the ticket. Use needs_review when intent is missing or conflicting. Do not execute any action. Ticket: I was charged twice for the same invoice."
  }]
}

Luna、POST /v1/responses:

{
  "model": "gpt-6-luna",
  "max_output_tokens": 4096,
  "reasoning": {"effort": "low"},
  "input": "Classify the ticket as billing, bug, feature, or needs_review. Return only a JSON object with exactly label and evidence. Evidence must be a nonempty exact quote from the ticket. Use needs_review when intent is missing or conflicting. Do not execute any action. Ticket: I was charged twice for the same invoice."
}

APIキーは通常の認証処理で渡し、公開記事や評価記録に書き込みません。引数の形はOpenAIの推論資料とHaikuの移行資料に基づきます。

JSONだけでなく意味を検証する

正解ラベルのある小さな評価用データでは、次のように不正な形式、誤分類、空の根拠、存在しない引用を却下できます。

import json

def accept(raw_text, ticket, expected_label):
    try:
        answer = json.loads(raw_text)
    except (ValueError, TypeError):
        return False
    if not isinstance(answer, dict) or set(answer) != {"label", "evidence"}:
        return False
    return (
        answer["label"] == expected_label
        and isinstance(answer["evidence"], str)
        and bool(answer["evidence"].strip())
        and answer["evidence"] in ticket
    )

引用が存在するだけで、主張を支持しているとは限りません。「請求書」という引用だけでは二重請求の証拠になりません。要約や抽出の検証では、根拠が主張を支えるかを別に確認します。

expected_labelは評価用の人手ラベルです。本番の任意の問い合わせに正解が既知という意味ではありません。形式を検証する処理と、正しさを採点する評価を区別し、誤答が通過する割合を監査します。

ツール呼び出しには専用の合格条件が必要

ツール名を許可リストと照合し、引数の型と範囲、対象レコードの存在、アプリ側の権限を確認します。そのうえで、選んだ処理が依頼の意味に合っているか採点します。

「二重請求の問い合わせを分類する」と「支払いを返金する」は別の処理です。完璧な形式の返金引数でも、分類しか求めていないなら誤りです。最初の評価では読み取り専用環境や模擬実行を使い、実行の成否とモデルの判断を分けます。

要約・分類・ツールを別々に評価する

通常の例、曖昧な例、既知の失敗例を含む未使用の評価用データを3種類用意します。小さな予備評価は接続や基準の修正に有用ですが、低い本番エラー率の立証には不十分です。

処理 主指標 追加で確認すること
要約 必須事実の網羅、根拠のない約束がない 日時、担当者、未解決の矛盾、資料の支持
分類 分類別の適合率・再現率、macro-F1 判断保留、少数分類、誤振り分けの重大さ
ツール呼び出し 許可された正しいツールと引数 権限、入力不足時の保留、実行側のエラー

同じ処理IDを両モデルへ渡し、指示、元資料、形式、出力上限、設定、全試行を保存します。可能ならモデル名を隠して採点し、出力打ち切りや不正JSONを分母から外しません。

課金項目別の使用量、キャッシュ作成を含む初回と再利用の費用、採用率、誤答の通過、再試行、人の確認、完了時間、全入力長と適用単価を記録します。ストリーミングでは最初のトークンまでの時間と処理完了までの時間を分けます。

同じ設定での比較と、同じ正確さ・待ち時間の基準を満たす最安の検証済み構成を、別に提示します。長文抽出はLuna、特定の短いAgent処理はHaiku、分類はどちらでもよい、という結果も成立します。

FAQ

安いモデルでもAgent処理の合計費用が高くなるのはなぜですか?

単価に加え、呼び出し回数、入力長、キャッシュ、課金対象の出力が費用を決めます。差を検証するには、各リクエストの使用量と料金区分を記録し、新規入力、読み込み、書き込み、出力を分けます。同じ資料、ツール、終了条件、合格基準を使い、前の試行で生成したファイルを再利用しない環境で比較してください。定額契約から換算したAPI相当額と、APIの請求書も異なります。上の費用表はトークン数を固定した計算で、話題の実演を再現した結果ではありません。

どちらが速いですか?

この記事では制御した遅延比較を実施していません。対話画面なら最初のトークンまで、Agentなら採用できる結果までの時間を測ります。ツールの待ち時間、再試行、検証も含めます。同じ推論設定名でも同じ計算量とは限りません。

HaikuはLunaより安いですか?

短い入力の公式単価は同じです。確認時点のBeatAPI掲載価格では同じ使用量ならLunaが20%安く、入力10万超〜27万2,000以下では差が広がります。実際の処理費用は使用量と採用率で変わります。

要約にはどちらが向いていますか?

自社資料で必須事実の網羅と根拠のない主張を評価します。約束や例外を変える要約は、安くても不合格です。

分類にはどちらが向いていますか?

自社の分類規則、正解ラベル、少数分類、判断保留で測ります。知識全般の点数だけでは選べません。

キャッシュでHaikuの上位単価を避けられますか?

いいえ。Anthropicはキャッシュ入力も含むと明記しています。新規入力だけで判断しません。

長文を分ければ必ず安くなりますか?

抽出、統合、重複、再試行、検証を足します。この記事の分割例は直接Lunaより高く、情報の流れも変えます。

同じAPIリクエストを使えますか?

エンドポイントとモデルごとの引数を区別し、実際の経路でツール対応と出力の読み取りを確認します。

公開スコアが高ければ追加費用を払うべきですか?

評価候補にする理由にはなります。本番の判断には、処理別の採用率、待ち時間、修正費用を使います。

BeatAPI経由の実測ですか?

公開価格は確認しましたが、費用表は計算例です。認証付きの品質、速度、境界精算の実測は主張していません。

Claude Haiku 5.5とGPT-6 Lunaの比較では、小さな処理を1つ選び、根拠を保ち、使える回答にいくらかかるか測ります。長文単価は最初の候補を選ぶ材料にし、合格基準は本番の経路を選ぶ材料にしてください。

著者とAPIの参照先

Haikuを評価候補にする場合は、BeatAPIのClaude Haiku 5.5 APIページで、モデルID、現在のトークン料金、最初の接続確認に使うリクエスト例を確認できます。自社の要約や分類の入力を少数試し、Lunaにも同じ合格条件を適用してください。料金表だけを理由にHaikuを選ぶ必要はありません。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?