判断特化AI「Jev」は、文章を書かずに選択肢ごとの確率と確信度だけを返すモデルです。
試そうとして、Cloudflare Workers AI から Jev を呼ぶと、こう返ってきました。
HTTP 402 {"errors":[{"message":"Insufficient balance; add money to your gateway or use BYOK","code":2021}]...}
Jev は無料枠の対象外でした。 そこで、同じ形式で使える Cloudflare 自身の判断モデル Clef を、無料枠で試しました。
比べる相手は、2026-10-07 に出た Claude Haiku 5.5(入力100万トークンあたり $0.10)です。
ニュース見出し306問を9カテゴリに振り分け(livedoor ニュースコーパス)
正解率 自信のある1割前後だけ自動で決めると
Clef 58.2% confidence 0.8以上(13%の問題)→ 正解率95.1%
Clef-flash 52.0% confidence 0.8以上(8%の問題) → 正解率96.2%
Haiku 5.5 60.8% 確率0.9以上(12%の問題) → 正解率89.2%
Clef が自信を持てた問題は Clef、それ以外は Haiku → 正解率61.4%、Haiku の呼び出しは半分
検証環境: Cloudflare Workers AI の無料枠で
@cf/cloudflare/clefとclef-flash/
Claude Code 2.1.293 のclaude -p --model haiku(Haiku 5.5、Claude Max)/ 測定は 2026-10-08。追加の支払いはゼロ
測り方
データは livedoor ニュースコーパス(2012年に集められた記事)です。9つのサイトから見出しを34本ずつ、乱数を固定して選びました。
問題は「この見出しは、どのニュースサイトに載っていたものか」です。
両方に同じ説明文を渡しています。各サイトに「家電チャンネル:家電・デジタル機器・IT業界の話題」のような1行を付けました。
-
Clef: Jev と同じ Choice 型の質問で聞きます。選択肢ごとの確率と
confidenceが返ります - Haiku 5.5: ツールを外し、選択肢ごとの確率を JSON で答えてと頼みました
確信度は、どちらも「選んだ選択肢の確率」で比べます。 Clef の confidence は別に見ます。
正解率は Haiku 5.5 が少し上
| 正解率 | 得意 | 苦手 | |
|---|---|---|---|
| Haiku 5.5 | 60.8%(186/306) | スポーツ 31/34 | ITライフハック 11/34 |
| Clef(27B) | 58.2%(178/306) | スポーツ 32/34 | 家電チャンネル 7/34 |
| Clef-flash(9B) | 52.0%(159/306) | スポーツ 32/34 | 家電チャンネル 5/34 |
家電・IT・スマホの3サイトは、どれとも読める見出しがあります。 モデルの差もここで逆向きに出ました(家電は Clef 7・Haiku 14、ITライフハックは Clef 18・Haiku 11、各34問中)。
TypeSafe のドキュメントも、日本語などは英語ほど正確でないと書いています(Clef も同じとは限りません)。
Other languages, including CJK scripts, are handled but not equally well
確信度が高い答えは、Clef のほうが当たる
| 確信度の帯 | Clef の正解率 | Haiku 5.5 の正解率 |
|---|---|---|
| 0.9以上 | 93.2%(44問) | 89.2%(37問) |
| 0.7〜0.9 | 65.1%(126問) | 75.9%(108問) |
| 0.5〜0.7 | 45.3%(95問) | 48.7%(115問) |
| 0.5未満 | 29.3%(41問) | 32.6%(46問) |
いちばん上の帯だけ Clef、それより下は Haiku のほうが当たりました。
確信度と正解率のずれ(4帯で計算した ECE)は Clef 0.125、Haiku 0.072 で、全体では Haiku のほうが確信度を正直に出しています。
Clef の confidence(確率とは別に返る値)で切ると、上の差がはっきりします。
| 切り方 | 自動で決める割合 | その正解率 |
|---|---|---|
Clef の confidence 0.5以上 |
51% | 73.1% |
Clef の confidence 0.8以上 |
13% | 95.1% |
| Haiku の確率 0.9以上 | 12% | 89.2% |
「ほぼ確実なものだけ機械に任せ、残りは人が見る」なら、Clef の confidence が使えます。
組み合わせると、Haiku の呼び出しが半分になる
テーマにある「LLM との組み合わせ」も試しました。Clef の confidence が0.5以上なら Clef の答えを使い、それ以外だけ Haiku に聞きます。
全体の正解率は61.4%で、Haiku だけ(60.8%)と同じくらいでした。Haiku を呼ぶのは49%で済みます。
費用は0円
| 306問の費用(API 換算) | 実際 | |
|---|---|---|
| Clef | $0.029 | Workers AI の無料枠内 |
| Clef-flash | $0.011 | 同上 |
| Haiku 5.5 | $0.146 | Claude Max の範囲 |
Clef は実測の入力トークン(1問約400)×単価です。単価から換算すると2つ合わせて約3,700 Neurons で、1日の無料枠(10,000)の4割弱です。
Haiku の額は Claude Code の total_cost_usd で、Claude Code が毎回付ける前置きの分を含みます。
言えないこと
- Clef は Jev ではありません。 Jev 本体は有料なので測っていません
- データは1種類(2012年の日本語の見出し)、各1回です。よく使われるコーパスなので、学習に含まれていた可能性もあります
- カテゴリの説明文は私が書いたものです。書き方で正解率は動きます
- Clef のページに
confidenceの計算方法は見当たりません(TypeSafe が説明している Jev の式とは合いませんでした) -
同じ「選んだ選択肢の確率」で比べると、0.8以上は Haiku 40%・83.6%、Clef 33%・79.4% で Haiku が上です。Clef の強みは
confidenceの値で切ったときに出ます - Haiku は Claude Code 経由なので、速さは比べていません
まとめ
- Jev は Cloudflare でも有料。 互換の Clef なら無料枠で試せる
- 正解率は Haiku 5.5 60.8%、Clef 58.2%。 日本語の振り分けでは大差なし
-
Clef の
confidence0.8以上(13%)は95%当たった。 同じくらいの割合で Haiku は89%。確実なものだけ任せる使い方に向く - Clef で自信のある半分を片付け、残りを Haiku に回すと、正解率はそのままで Haiku の呼び出しが半分
お金をかけずに判断AIを試すなら、まず Clef と Workers AI の無料枠から始めてみてください。
出典
- livedoor ニュースコーパス(株式会社ロンウイット配布、CC BY-ND 2.1 JP)https://www.rondhuit.com/download.html#ldcc
- Clef: https://developers.cloudflare.com/workers-ai/models/clef/
- TypeSafe のドキュメント: https://docs.typesafe.ai/models.md
関連記事
- Claude Code の Explore は、いつの間にか Haiku から本体と同じモデルに変わっていた。戻すと費用は21〜35%減 — Haiku を安く使う話
- Claude Sonnet 5.5 の「最大30%安い」は、手順のある仕事でだけ再現した — 発表の数字を実測で確かめた回
JQITのエンジニアの95%以上は未経験からの採用です。
よければコーポレートサイトにも遊びに来てください。
エンジニア採用も行っています。もしご興味あれば覗いてみてください。
▶ 採用サイト