100万件を、全部いちばん高いモデルに判定させますか
たとえば、社内の評価パイプラインです。チャットの品質、安全性、回答が根拠と合っているかを、毎日まとめて判定しています。件数が100万に届くと、問いはこうなります。その全部を、いちばん高い推論モデルに渡す必要があるのか。
この問いを費用と精度と待ち時間で測ったのが、カーネギーメロン大学のLiらによる論文 JEV-as-a-Judge: Accept When Confident, Escalate When Unsure(2026年9月26日)です。理由文を出さない判定器が自信を返し、高いときだけ採用し、低いときだけ上位モデルへ送る。論文自身は、新しい算法の提案ではなく、その測定だと書いています。
論文のtiming panelでは、測定時点の条件で GPT-6 Astra が1,000判定あたり約12.18ドル、中央値レイテンシ約1.89秒でした。比べた JEV 1.13(TypeSafeの判定サービス)は約0.044ドル、中央値0.15秒。およそ277倍安く、中央値では約13倍速い、という数字です。100万判定に引き直すと、高い側は論文の序文にあるとおり、およそ12,000ドルが評価のたびに乗ります。
高いモデルを難所だけに置く配置は、熱が冷めても残るのは「配置設計」です——AIバブルのあとにIT技術者が見るスモールAI でも扱いました。本稿はその型を、判定タスクの公開ベンチで見た数字に限って整理します。
この安さは、JEVがGPT-6並みに賢い、という意味にはなりません。実験では生成モデル側も、長い理由文ではなく判定とラベル確率だけを返す契約で答えていて、費用差はその契約に揃えたあとも残っています。何を返しているのかは、次で見ます。
JEVが返すのは、長い理由ではなく型の決まった判定です
前節の費用は、この入出力を前提にしています。JEVが受け取るのは、自然言語の判定条件と構造化入力です。返すのは、指定した型の判定と、各ラベルの確率です。長い回答や、なぜそう判断したかの文章は出しません。論文はこの形を decision-only judge と呼んでいます。
たとえば、2つの回答のどちらがよいかを選ばせると、返ってくるのは次のような値です。
入力: 評価ルール、回答A、回答B
↓
JEV
↓
A: 0.91
B: 0.06
その他: 0.03
verdict = A
q = 0.91
ここの 0.91 が、ゲートに使う自信 q です。論文では、各ラベル確率の最大値です。
q = max_k p_k
JEVは、ラベル分布から計算した独自のconfidenceも返します。RewardBench、JudgeBench、HaluEvalでは、それと最大確率の順位相関が 0.976、0.999、0.958 でした。ほかのモデルとも同じ定義で比べるため、研究ではこの最大確率を全judgeの q にしています。
この q がしきい値 τ 以上ならJEVの判定を採用し、未満なら高性能な推論モデルへ送ります。論文のFigure 2がこの構造で、τは対象のワークロードで決めます。
見ているのは、判定器を含むこのパイプラインです。安く済むかは、次の2点で決まります。どの仕事でJEVが強いのか。自信が、外れそうな案件を知らせるのか。
読む仕事と、導く仕事では、強さが分かれます
全体の順位だけ見ると、JEVは中位です。公開された4,850判定を15のLLM judgeでまとめると8位で、GPT-6より1.7ポイント、GPT-5.6 Solより2.8ポイント低い。差の出方は、仕事の種類でかなり違います。論文はこれを、文章から判定を読み取れるか、答えを導かないと判定できないか、という境界で見ています。
文章を読めば決まる判定
チャットの品質、有害な依頼の拒否、答えるべき依頼を拒否しないこと、根拠文書に照らした事実性。こうした「読めば決まる」判定では、JEVはGPT-6とおよそ2ポイント以内です。RewardBench全体では両者とも92.5%でした。根拠に照らすHaluEvalでは、JEV 87.3%、GPT-6 88.4%です。
計算や追跡が要る判定
専門知識、コード、数学、論理パズルでは差が開きます。論理パズルは JEV 68.4% に対して GPT-6 95.9% でした。JudgeBenchでは JEV 78.6%、GPT-6 93.1% です。争った項目を、ラベルを見せずに人が見直すと、69件中57件でGPT-6側、JEV側は1件でした。人が見直しても、差は残っています。
分類、照合、ルールに照らした判定はJEVが比較的得意です。計算、探索、コードの追跡、多段の推論は推論モデルが得意です。苦手な仕事があること自体は、その苦手を自信が知らせるなら、一次判定に使えます。
困るのは、間違えることより、自信があるのに間違えることです
前節の弱点が使えるのは、外れそうなときに q が下がる場合です。安いモデルが多少間違えること自体は、件数の設計で吸収できることがあります。困るのは、間違えているのに自信が高いときです。当たるときは q が高く、外しそうなときは q が低い。その性質があれば、一次判定器として使えます。
JEVでは、自信が上がるにつれて精度もおおむね上がりました。3つの公開タスクをまとめると、q < 0.6 の214件では55.1%、q = 1 の2,332件では97.8%です。q ≥ 0.9 で採用する範囲では、JEVとGPT-6はほぼ並びます(94.7%と94.4%)。送る側の1,106件では、GPT-6が7ポイントリードします。GPT-6の優位は、JEVが迷っている場所に寄っています。
ここで確認しているのは、自信が誤りを見つける信号になるかです。確信度が低い予測を棄権する selective classification と同じ考え方で、論文もその系譜を参照しています。この信号があるので、次のように採用と差し替えを分けられます。
自信が低い案件だけ、上位モデルの判定に置き換える
q が τ を下回った入力は、強いjudgeが改めて判定し、その結果を最終結果にします。JEVの回答を添削させる形にはなっていません。オフラインの数字は、別々に集めた出力を組み合わせたシミュレーションです。同じ方針を実際に呼び直したときも、ゲートが送った場合だけGPT-6を呼んでいます。
先行モデルの答えを上位モデルに見せると、先に見た判定へ寄る可能性があります。この論文がそのバイアスを測ったわけではないので、実装では「見せない」を既定にしておく方が無難です。
次の関数は、Figure 2のゲートをコードの形にしたものです。JEVのAPIは呼ばず、しきい値の位置だけを確認するスケッチです。τには、自社ラベルで先に決めた値を渡します。
def cascade(jev_probabilities: dict[str, float], tau: float, fallback):
"""q が tau 以上なら JEV を採用し、未満なら fallback の判定で置き換える。
fallback には JEV の確率も判定も渡さない。
ペア比較で提示順が結果を動かすなら、両順の確率を揃えて平均してから q を取る。
出力がスキーマ違反のときは、q に関係なく fallback へ送る。
"""
if not jev_probabilities:
return {"verdict": fallback(), "source": "fallback", "q": None}
q = max(jev_probabilities.values())
if q >= tau:
label = max(jev_probabilities, key=jev_probabilities.get)
return {"verdict": label, "source": "jev", "q": q}
return {"verdict": fallback(), "source": "fallback", "q": q}
動かすなら Python 3 で足ります。fallback は上位モデルを1回呼ぶ関数、という想定です。校正、料金計算、両順序の平均は入っていません。
この2段が扱うのは、回答の良しあしの判定です。コードがテストを通るか、操作が権限内かは、スキーマやテストで別に見ます。その話は 「LLMに任せきり」が危ない理由——数学が示す限界と、設計で補う3つの原則 に書いてあります。ここから先は、判定そのものを2段にしたとき、しきい値を先に固定すると何が起きたかです。
しきい値を先に固定すると、易しい仕事だけがJEVに残った
しきい値は、評価結果を見てから都合よく動かしていません。パイロットのうち、しきい値専用の96件で、上位モデルとの差を2ポイント以内に抑えつつ、JEVで処理できる割合が最大になるτを選び、そのあと未使用データで評価しています。凍結した方針のτは0.9でした。ペアは両順序で判定し、揃えた確率を平均してからゲートします。
未使用の1,610件では、約31%を上位へ送りました。精度はGPT-6単独の92.5%に対して93.4%で、0.9ポイント上です。区間はおよそ0.2から1.7ポイントなので、上積みは小さいです。下がったのは費用で、GPT-6単独の約41%までです。欠けた利用量を高めに見積もると、約44%です。
何がJEVに残り、何が上位へ行ったかは、ワークロードで割ると見えます。
| 条件 | 上位へ送った割合 | 精度 | 費用(GPT-6単独比) |
|---|---|---|---|
| RewardBench(1,340件) | 約25% | GPT-6より約1.3ポイント高い | 約27% |
| JudgeBench(270件) | 約65% | 92.2%(GPT-6は93.0%) | 約67% |
| 上記の合計(1,610件) | 約31% | GPT-6より0.9ポイント高い | 約41% |
| 新しい2ワークロード(570件) | 約74% | GPT-6と同じ | 約76%(削減は約25%) |
RewardBenchは易しい側です。約25%だけ送り、精度はGPT-6より約1.3ポイント高くなりました。両者の誤りが別の案件に分かれ、JEVの誤りが低い自信に寄っていたためです。JudgeBenchは難しい側です。約65%を送っても92.2%までで、GPT-6の93.0%には届きません。差の94%は埋まりますが、費用の削減は約33%です。難しい判定で先に守るのは、精度の方です。
難しい判定でも精度を落とさないかを、手順を決めてから測ったのが、新しいワークロードでの実測です。対象は、JEVが苦手な正しさ判定です。PPEの500件と、それまで判定していなかったJudgeBenchのClaude側270件から、各100件でしきい値を決め、残り570件で測りました。選ばれたτは0.95と0.99で、先に凍結した0.9とは別の値です。
ここではJEV単独がGPT-6より約14ポイント低い状態から始まっています(76.1%対90.2%)。カスケードは68%と89%、合わせて約74%を上位へ送り、両方でGPT-6と同じ精度になりました。費用はそれでも約25%減っています。
この570件が示しているのは、危ない案件を上位へ渡せているか、です。
分岐の鍵はファイルサイズではなく、判定器の自信です
易しい仕事はJEVで終わり、難しい仕事は上位へ行く。この振り分けは、ITでは見慣れた階層です。
これまでも、L1キャッシュの先にL2とメモリを置き、CDNの先にオリジンを置き、一次サポートの先に専門担当を置き、ルールエンジンの先に人手レビューを置いてきました。安い処理を手前に置き、難しいものだけ高い処理へ送る、という並びです。JEVのカスケードも、この並びです。
普段の分岐が ファイルサイズ > 10MB なら、ここでの分岐は q < τ です。仕事の難しさを、モデルが出した不確実性から推定して振り分けています。
経路を質問の長さだけで決めない、という見方は Claude Opus 5から読む、生成AI競争の次のステージ──性能競争から「コスト・信頼性・運用設計」へ でも書いています。今回の材料は、判定器自身の自信です。同じベンチの中でも、文章の長さより、その文章で何をしなければならないかの方が差に効いていました。
0.91は、91%正しいという意味ではない
ここまで q をゲートの鍵として使ってきました。実装で取り違えやすいのは、その読み方です。JEVが A = 0.91 と返しても、Aが91%の確率で正しい、とは読めません。
当たる頻度と揃っているかは、別に確認する
型どおりの確率を返すことと、その確率が当たり頻度と揃っていることは別です。論文はこの区別を明示し、精度だけでなく Brier score、NLL、ECE、誤り検出のAUROCも測っています。
AUROCは、自信の低さが誤りを上位に並べられるか、という指標です。JEVの1回判定では RewardBench 0.875、JudgeBench 0.745、HaluEval 0.827 でした。JudgeBenchではGPT-6の方が誤りをよく並べます。HaluEvalでは、人がラベルを直すと確率スコアの優劣が逆転する、という感度分析もあります。公開ラベルのままの数字を、校正済みとは扱わない方が安全です。
τは、ワークロードごとに自社ラベルで決める
当たり方がワークロードで変わるなら、τも1つの定数では足りません。論文のFigure 2にも、τはローカルのラベルで選ぶ、とあります。確認の前に、τをコードへ埋め込まない方が安全です。
0.70に寄せればJEVの採用が増えて安くなり、誤判定は増えやすいです。0.95に寄せれば上位へ多く流れ、費用は上がり、誤判定は減りやすいです。費用とリスクの交換です。
点推定で「2ポイント以内ならよい」と選ぶと、論文の再抽選では、2ポイントを超えて落とす方針がおよそ40%から50%の試行で出ました。精度差の片側95%下限がマイナス2ポイントを超えない、という条件に変えると、その割合は約100件でおよそ5%まで下がります。ワークロードごとにτを分けると、96件で0.6%でした。同じデータの再抽選なので、分布が変わったときの楽観は残ります。それでも「τ=0.9にしておく」より、この下限の方が判断材料になります。
自信が高くても、この経路が壊れる仕事がある
τを丁寧に決めても、自信が当たり外れと関係ない仕事では、ゲートは働きません。論文では、その条件が2つあります。
詳しい間違った文章に引っ張られる
内容が悪くても、長く、詳しく、もっともらしく書いてある回答へ寄ることがあります。RM-Benchで文体が揃っているとき、JEVは85.4%でした。誤った回答の方が詳しく書いてある条件では76.6%まで下がります。GPT-6は91.8%から90.1%で、動きは小さいです。この条件では差が13.5ポイントまで開きます。q ≥ 0.9 の誤り率も、易しいペアの1.5%から、この難しいペアでは7.9%へ上がりました。文体の誘導は、高い自信のまま残ることがあります。
根拠のない自然文では、どの判定器も自信だけが高い
根拠がある場合と、ない場合では結果が違います。根拠文書がある要約では、JEV、GPT-4.1 mini、GPT-5.4のラベル一致はおよそ70%でした。根拠のない自然文では53.5%、54.0%、56.0%で、どれも偶然に近いです。それなのに平均の最大確率は JEV 0.91、GPT-4.1 mini 0.94、GPT-5.4 0.96 です。JEVの誤り検出AUROCは0.498で、自信の高低が当たり外れを分けていません。
分からないのに自信がある。この条件では、confidence routingそのものが働きません。論文は、試したjudgeのどれも、根拠のない自然文には使えない、としています。自動判定を置く前に、根拠があるかを見る理由がここにあります。
試すなら、照合で終わる仕事と、導出が要る仕事を分ける
ここまでの流れは、全件を最良のモデルへ渡す並びから、易しい判定と難しい判定を分ける並びへの移り方です。この論文で効いているのは、安く判定すること、自信を出すこと、危ない判定を識別すること、そこだけ高性能モデルへ送ることです。高い処理を全リクエストへ均等に置かず、fast pathとslow pathを分ける。その原則が、LLMの判定でも数字になっています。
試すときは、自社の判定を先に2つに分けます。文章とルールを照合すれば終わる仕事には、この経路を載せます。計算やコード追跡が要る仕事は、最初から上位へ寄せます。τは100件ほどのラベルで下限を見て、同じワークロードの未使用分で確認します。文体で優劣がひっくり返る評価と、根拠のない文章の採点には、このゲートを使いません。
そのうえで残る問いは、どの仕事に、どの程度の知能を割り当てるか、です。
作成日: 2026-09-30
