はじめに
テキスト分類・スコアリング・問い合わせルーティングのような「判断」をLLMに任せたいとき、モデルごとに出力形式が違うと実装や比較が面倒です。最近、複数の決定系モデルを同じインターフェースで叩ける Decisions API を知ったので、試し方をメモしておきます。
概要
- Jev 1.13 / Liquid d1 / Solar Decide / Tev1 4B Experimental / Kev 4B / Span-01 / Span-01 Lite など、複数の決定系モデルを同じプレイグラウンドで比較できる
- Choice / Score / Noul という3種類の構造化出力に対応していて、確率や信頼度の情報も一緒に返ってくる
- サーバ統合は Bearer APIキーを付けてPOSTするだけ。ドキュメントに cURL / JavaScript / Python の例がある
- 新規アカウントには100クレジットが付与され、$1 = 10,000クレジット。出力トークンは課金対象外という料金設計
APIを叩いてみる
最小の例はこんな感じです(cURL):
curl -X POST https://decisions-api.dev/v1/systemone \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "solar-decide",
"question": {"type": "Choice", "text": "Classify the ticket priority", "choices": ["low", "normal", "high"]},
"input": "Payment page shows a blank screen after checkout"
}'
返却は構造化されたJSONで、選択結果と確率・信頼度が入ってきます。プロンプトを毎回工夫しなくても、質問テンプレートにテキストを流し込むだけで形が揃うのが楽なポイントです。
プレイグラウンドで比較する
コードを書く前に、各モデルの挙動をプラウドグラウンドで確認できます。例えば Solar Decicde model を開くと、UpstageのSolar Decideを選択した状態でサンプル質問を試せます。サポート対応のルーティング、引用の検証、コンテンツモデレーション、リードスコアリング、LLMガードレール向けのサンプルが最初から用意されているので、自分のユースケースに近いものを選んで比較すると早いです。
おわりに
「生成」ではなく「判断」に特化したモデルを複数持っておくと、用途ごとに使い分けやすそうです。料金はクレジット制で一回の成功リクエストが最低1クレジットなので、まずは無料クレジットで自分のタスクを流してみるのがおすすめです。