0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

GLM 5.3 API コスト:常時思考、回答単価は 5.2 の 2.5 分の 1

0
Last updated at Posted at 2026-09-15

この記事は Synthorai ブログの記事 GLM 5.3 API コスト:常時思考、回答単価は 5.2 の 2.5 分の 1 の転載です。原文(多言語対応)はリンク先をご覧ください。

GLM 5.3 API コスト:常時思考、回答単価は 5.2 の 2.5 分の 1

GLM 5.3 の料金は GLM 5.2 と同じで、入力 100 万 token あたり $1.40、出力 100 万 token あたり $4.40 です。ただし、思考は無効化できなくなりました。どの方法で無効化しても 400 エラーになり、デフォルトの effort は max です。正解を検証できる 11 タスクを各 3 回実行したところ、全 33 回に正解したのは max だけでした。正解 1 件あたりのコストは $0.00468 です。GLM 5.3 の推論量は約半分なので、max の GLM 5.2 と比べて 2.5 分の 1 になりました。low は正解 1 件あたりのコストを 63% 抑えられますが、33 回中 5 回失敗します。GLM 5.3 Flash は 10 分の 1 の価格で 33 回中 31 回正解しました。reasoning_effort は回答前にモデルが考える時間を指定するパラメータですが、今ではコストだけでなく精度も左右します。今回は 2 つの build を GLM 5.2 および DeepSeek V4.1 Flash と同じ batch で測定しました。

TL;DR

  • GLM 5.3 と GLM 5.3 Flash は thinking: disabled、reasoning_effort: none、medium を指定するとエラー 1210 を返します。使えるのは low、high、max のみで、デフォルトは max です。
  • max の GLM 5.3 は 33 回中 33 回正解し、正解 1 件あたり $0.00468 でした。max の GLM 5.2 は $0.01173 です。
  • low では、GLM 5.3 が 33 回中 28 回、GLM 5.3 Flash が 33 回中 24 回正解しました。
  • GLM 5.3 の両 build は厳密な json_schema を無視します。json_object では 8 回中 8 回、正しい値が返りました。

GLM 5.3 とは何か、料金はいくらか

同じ価格の GLM 5.2 を再学習したモデルと、その 10 分の 1 の価格で使える小型モデルです。Z.ai の ガイドによると、GLM 5.3 は「GLM-5.2 と同じ base model を使用し、すべての改善を post-training で実現」しており、入力は text のみです。GLM 5.3 Flash は「総 parameter 数 320B、うち 18B を有効化」しています。各 token の処理に使うのは 18B だけなので、低価格で提供できます。画像、動画、ファイルにも対応します。どちらも context は 1M token、最大出力は 128K です。Z.ai の 料金ページに記載された 100 万 token あたりの価格は次のとおりです。

モデル 入力 cache 済み入力 出力
GLM 5.3 $1.40 $0.26 $4.40
GLM 5.3 Flash $0.15 $0.03 $0.50
GLM 5.2 $1.40 $0.26 $4.40
DeepSeek V4.1 Flash $0.30 peak $0.006 peak $1.20 peak

Z.ai の model cardと Flash ガイドでは、agent と coding タスクの性能向上が示されています。

Benchmark 評価内容 GLM 5.2 GLM 5.3 GLM 5.3 Flash
Terminal Bench 3.0 terminal 上の agent タスク 4.6 28.3 記載なし
DeepSWE v1.1 実在する repository の修正 46.2 66.9 63.4
AutomationBench workflow automation 26.2 48.2 48.8
CyberGym security vulnerability タスク 77.2 84.5 記載なし
HLE with tools tool を使用できる難問 54.7 62.5 記載なし

ここからは、こちらで検証できた結果を示します。agent benchmark ではなく、正解を 1 つに特定できるタスクを使いました。

思考はまだ無効化できるか

できません。GLM 5.2 は thinking: {"type": "disabled"} を受け付けました。GLM 5.3 と GLM 5.3 Flash では、thinking: disabled、enable_thinking: false、または reasoning_effort に none、minimal、medium、xhigh を指定すると、error code 1210 の HTTP 400 が返ります。内容は「このモデルは常に思考するため、思考の無効化には対応していない。low、high、max のいずれかを使用すること」です。reasoning_effort を省略すると max になります。一部の provider が対応している思考 token の上限 thinking_budget は、GLM 5.3 では受理されますが無視されます。同じ質問に 0 から 1,024 までの値を指定しても、いずれも約 101 reasoning token が生成されました。

resp = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": prompt}],
    reasoning_effort="high",   # "low" | "high" | "max"; omitted means "max"
    max_tokens=8192,           # GLM 5.3 Flash rejects anything above 131,072
)
reasoning_tokens = resp.usage.completion_tokens_details.reasoning_tokens  # billed as output
thinking_text = resp.choices[0].message.reasoning_content                # the thinking itself, as text

以前の低コストな方法も、性能は十分ではありませんでした。思考を無効にすると、GLM 5.2 は 33 タスク中 10 タスク、DeepSeek V4.1 Flash は 22 タスクしか正解しませんでした。

正解を出せる effort 設定はどれか

GLM 5.3 では max だけです。GLM 5.3 Flash では、すべて正解できる設定はありませんでした。正解が検証可能な単一の数値になる 11 タスクを、それぞれ 3 回実行しました。素数の合計、数字の出現回数、grid 上の経路数、硬貨の組み合わせ、規則の 40 回適用、7 の 222 乗を 1000 で割った余り、基数変換、knapsack、3 つの制約を満たす 4 桁の数の個数を含みます。reasoning token は回答前に生成される非表示の思考で、出力として課金されます。正解 1 件あたりのコストは、list price での総費用を正解数で割った値です。

モデル Effort 正解 Reasoning token、中央値(最大値) 正解 1 件あたりのコスト
GLM 5.3 low 28/33 143 (1,826) $0.00173
GLM 5.3 high 29/33 226 (1,950) $0.00197
GLM 5.3 max(デフォルト) 33/33 538 (7,733) $0.00468
GLM 5.3 Flash low 24/33 120 (467) $0.00012
GLM 5.3 Flash high 29/33 196 (1,582) $0.00021
GLM 5.3 Flash max(デフォルト) 31/33 419 (5,024) $0.00040
GLM 5.2 max 33/33 1,129 (21,917) $0.01173
DeepSeek V4.1 Flash low 33/33 337 (6,797) $0.00102
DeepSeek V4.1 Flash max 33/33 386 (10,769) $0.00138

GLM 5.3、GLM 5.3 Flash、GLM 5.2、DeepSeek V4.1 Flash について、effort が low、high、max の場合の正解 1 件あたりのコストを比較した棒グラフ。33 回中の正解数も併記。GLM 5.3 が 33 回中 33 回正解するのは max のみで、コストは $0.00468。max の GLM 5.2 は $0.01173。GLM 5.3 Flash は最安だが、最高でも 33 回中 31 回

GLM 5.2 と比べて 2.5 分の 1 になった理由は、reasoning token の量です。中央値は 1,129 に対して 538、最長の実行では 21,917 に対して 7,733 でした。低い設定は確認処理を省くことでコストを抑えています。low の GLM 5.3 は、grid 上の経路数に 2 回とも 216 と回答しましたが、正解は 132 です。block された cell が 1 つあるためです。硬貨の組み合わせ、knapsack、基数変換でも、それぞれ 1 回失敗しました。low の GLM 5.3 Flash は、40 段階の規則と制約付きの個数計算に毎回失敗しました。一方、DeepSeek V4.1 Flash はすべての設定で 33 回中 33 回正解しました。

GLM 5.3 で算術や複数 step の処理を行う場合は、デフォルトのまま使うのが安全です。low は、誤答を低コストで検出できる用途に限って使ってください。max の GLM 5.3 は、正解 1 件あたりで DeepSeek V4.1 Flash の 3.4 倍かかります。GLM 5.3 Flash はその 3 分の 1 未満ですが、33 回中 2 回失敗しました。

答えのない質問で事実を捏造するか

しません。思考が常に有効でも結果は同じでした。架空の存在について 5 つ質問したため、正解は「分からない」だけです。Verantis Dynamics の株価、Oridium-7 の融点、1987 Pan-Continental Robotics Prize の受賞者などを質問しました。effort はデフォルト、token 上限は 16,384 です。

モデル 回答を拒否 回答を捏造 上限到達、回答は空 Reasoning token 質問 1 件あたりのコスト
GLM 5.3 5/5 0/5 0/5 230 から 542 $0.0022
GLM 5.3 Flash 5/5 0/5 0/5 238 から 625 $0.0003
GLM 5.2 5/5 0/5 0/5 134 から 1,559 $0.0035
DeepSeek V4.1 Flash 1/5 3/5 1/5 7,021 から 16,384 $0.0139

GLM 5.3 の両 build は、数百 reasoning token の後に情報がないと回答しました。DeepSeek V4.1 Flash は 7,000 から 16,000 token 考えた後、通常は内容を捏造しました。たとえばAndrew Martin, the robot protagonist of Isaac Asimov's The Bicentennial Man, wonと回答しています。前日に行った 同モデルの検証では、上限に達する実行がもっと多かったものの、回答を拒否することはほとんどありませんでした。正当に結果が空になり得る lookup では、これが 2 つの flash 系モデルで測定した最大の違いです。

GLM 5.3 は JSON schema に従うか

厳密な schema には従いません。json_object を使ってください。請求書抽出用の厳密な json_schema を response_format に指定すると、GLM 5.3 と GLM 5.3 Flash は HTTP 200 を返しましたが、16 回中 16 回で schema を無視しました。JSON は markdown code fence で囲まれ、schema にない key(invoice_date、reference)も含まれていたため、要求した object として parse できたものはありません。Z.ai の API リファレンスに記載されているのは text と json_object だけです。schema を指定してもエラーにならず、そのまま受理される点に注意が必要です。

{"type": "json_object"} を指定し、field 名を prompt に書いた場合は、両 build とも 8 回中 8 回すべての値を正しく返しました。GLM 5.2 と DeepSeek V4.1 Flash も同じ結果です。思考は有効なままなので、抽出処理で使う出力 token の中央値は GLM 5.3 が 240、Flash が 140 でした。思考を無効にした V4.1 Flash は 25 です。結果は自分で schema に照らして validate してください。

GLM 5.3 Flash の画像コストはいくらか

pixel 面積に応じて増え、2048x2048 でも上限に達しません。そのため rate は低くても、大きな画像では DeepSeek V4.1 Flash より高くなります。生成した PNG を GLM 5.3 Flash に送り、text のみの prompt に使われた分を差し引きました。GLM 5.3 は text のみに対応しています。

画像 GLM 5.3 Flash の token 数 $0.15/M でのコスト DeepSeek V4.1 Flash の token 数 $0.30/M でのコスト
512x512 363 $0.000054 184 $0.000055
1024x1024 1,371 $0.000206 652 $0.000196
2048x2048 5,478 $0.000822 994 $0.000298

正方形画像のサイズと画像入力 token 数の関係を示す折れ線グラフ。GLM 5.3 Flash は pixel 面積に応じて増加し、2048x2048 で 5,478 token。DeepSeek V4.1 Flash は 512x512 までは 184 で一定し、最大 994

512 pixel を超えると、GLM 5.3 Flash は約 766 pixel あたり 1 token を使います。detail、画像の内容、file format は token 数に影響しませんでした。DeepSeek V4.1 Flash の数値は、前日に行った検証結果です。screenshot や文書 page は送信前に縮小してください。2048x2048 では、GLM 5.3 Flash の画像 1 枚あたりのコストが 2.8 倍になります。

GLM 5.2 からほかに何が変わったか

速度が向上し、周辺の仕組みはほとんど変わっていません。同じ時間帯に low で streaming したところ、1 秒あたりの出力 token 数は GLM 5.3 が 59 から 64、GLM 5.3 Flash が 70 から 82、GLM 5.2 が 51 から 55、DeepSeek V4.1 Flash が 124 から 161 でした。2 turn の function calling loop では、すべてのモデルが各 turn で 1 回 call しました。3 つの GLM build は、英語、中国語、Python text に対して同じ token 数を数えます。それぞれ 737、484、488 なので、token budget はそのまま移行できます。

prompt の先頭部分を繰り返すと cache rate で課金され、64 token 単位で計上されます。1,153 token の prompt では、1,024 token が cache から読み込まれました。Flash の model card には 300,000 token とありますが、両 build とも 1M token の上限に近い prompt を受け付けます。先頭付近に値を 1 つ隠した 990,000 token の prompt では、その値が返りました(末尾付近の内容の想起は検証していません)。約 1.07M token の prompt では途中で切り捨てられず、Prompt exceeds max length という 400 が返りました。upgrade 時に問題になる変更が 1 つあります。GLM 5.3 Flash は 131,072 を超える max_tokens を拒否します。

Synthorai での扱い

GLM 5.3、GLM 5.3 Flash、GLM 5.2 は gateway 上でそれぞれ glm-5.3、glm-5.3-flash、glm-5.2 として提供しています。料金は Z.ai の list price と同じで、/v1/chat/completions と /v1/responses から利用できます。1210 エラーは変更せずに返します。そのため、GLM 5.2 向けの思考無効化設定を送り続けている client は、暗黙に max で思考するのではなく、明示的に失敗します。思考 text は reasoning_content に入り、画像は image_url の content part として GLM 5.3 Flash に送ります。

FAQ

GLM 5.3 で思考を無効化できるか

できません。GLM 5.3 と GLM 5.3 Flash は、どの無効化設定でも error 1210 の 400 を返します。受け付けるのは low、high、max だけで、デフォルトは max です。今回のテストでは、low は正解 1 件あたりのコストを 63% 抑えられましたが、正解数は 33 回中 33 回ではなく 28 回でした。

GLM 5.3 は GLM 5.2 より安いか

token 単価は同じです。どちらも入力が $1.40、出力が $4.40 です。正解 1 件あたりでは安くなります。max の GLM 5.3 は $0.00468、GLM 5.2 は $0.01173 でした。推論量が約半分だからです。

GLM 5.3 Flash で GLM 5.3 を置き換えられるか

たまに数値を間違えても後段で検出できる用途なら、10 分の 1 の価格で置き換えられます。max の GLM 5.3 Flash は、正解 1 件あたり $0.00040 で 33 回中 31 回正解しました。GLM 5.3 は $0.00468 で 33 回中 33 回です。複数 step の算術処理では、low の Flash を避けてください。正解は 33 回中 24 回でした。

関連記事:GLM 5.2 の reasoning effort、GLM 5.2 の tool call、DeepSeek V4.1 Flash のコスト、LLM の思考制御、LLM の構造化出力。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?