この記事は Synthorai ブログの記事 DeepSeek V4.1 Flash API コスト、V4 Pro 同等で 3-6x 安い の転載です。原文(多言語対応)はリンク先をご覧ください。
DeepSeek V4.1 Flash の料金は、ピーク時で入力 100 万 token あたり $0.30、出力 100 万 token あたり $1.20、オフピーク時はその半額だ。答えを検証できる 11 タスクを各 3 回実行したところ、33 問中 33 問に正解した。V4 Pro と同じスコアで、正解 1 件あたりのコストは 3-6x 安く、出力速度は 2.9x だった。置き換え対象の V4 Flash と比べても、正解 1 件あたり 26% 安く、1.5x 高速で、Flash 系として初めて画像を読み込める。一方、設計時に考慮すべき挙動が 2 つある。thinking を切ると、複数ステップの計算に誤った token 1 個だけを返す。thinking を有効にすると、存在しないものについての質問で出力枠を使い切る。5 回中 3 回は 16,384 token に達した。公開から 4 日後、deepseek-v4.1-flash と deepseek-v4-pro-0813 を同じ時間帯、同じ gateway でまとめて計測し、deepseek-v4-flash-0731 も同日の夜に計測した。
TL;DR
- V4.1 Flash はピーク時に 100 万 token あたり $0.30/$1.20、オフピーク時は半額。V4 Pro は $1.32/$3.96。
- thinking を有効にすると 3 モデルとも 33 問中 33 問に正解した。V4.1 Flash の正解 1 件あたりのコストは $0.00097-$0.00149 で、V4 Pro より 3-6x 安く、V4 Flash より 26% 安い。
- thinking を切ると、3 モデルとも 33 問中 21 問まで落ちる。V4.1 Flash は誤った token 1 個だけを返す。
- 架空の対象について 5 問質問すると、thinking を有効にした V4.1 Flash は 3 回で 16,384-token の上限に達し、2 回は回答を捏造した。thinking を切ると 5 問すべてで回答を拒否した。
9 月 10 日に何が変わり、V4.1 Flash の料金はいくらになったのか?
新しいアーキテクチャ、新しい料金、そして旧モデルの提供終了だ。V4.1 Flash は「新しいアーキテクチャファミリーで最小のモデル」とされる。552B parameters の causal encoder-decoder で、20-layer stack の一方が prompt を読み、もう一方が回答を書く。token あたりの active parameters は入力時が 8B、出力時が 16B。画像入力にネイティブ対応し、context は 1M token、出力上限は 384K、ライセンスは MIT だ。DeepSeek の 料金ページ では、ピーク時の料金が入力 100 万 token あたり $0.30、出力 100 万 token あたり $1.20 とされている。ピーク時間は月曜から金曜の 01:00-04:00 と 06:00-10:00 UTC。オフピーク時は $0.15 と $0.60、cache hit は $0.006 と $0.003 だ。V4 Flash の料金は 2 段階あり、7 月の公開時は一律 $0.14/$0.28、2026-08-16 以降のピーク料金は $0.44/$1.32 だった。V4.1 Flash はその中間で、V4 Pro のピーク料金 $1.32/$3.96 を大きく下回る。
V4 Flash と Vision Exp build は提供を終了し、それぞれのモデル名へのリクエストは Flash 料金の V4.1 Flash にルーティングされる。DeepSeek は 9 月 14 日から V4 Pro のトラフィックも V4.1 Flash に切り替える予定だったが、同日の 変更履歴 で「ユーザーの要望を受けて」この計画を撤回した。Pro は Pro の料金で引き続き利用できる。
料金ほど大きくは変わっていないが、内部仕様にも変更がある。tokenizer は 3 モデルで同一だ。同じ英語、中国語、Python のコーパスに対して、それぞれ 729、452、528 token となったため、token budget はそのまま移行できる。cache page は 1,024 token から 512 token に半減したので、549-token の prompt では 512 token が cache される。902K-token の prompt に値を 1 つ埋め込んだテストでは、その値を正しく返した。1M の context window を超える prompt には、暗黙に切り詰めず 400 を返した。
DeepSeek の model card にある公式値では、新しい Flash はすべての項目で旧 Flash を上回る。agent と coding では Pro も上回るが、knowledge では及ばない。
| Benchmark | 評価対象 | V4 Flash | V4.1 Flash | V4 Pro |
|---|---|---|---|---|
| GPQA Diamond | 大学院レベルの科学問題 | 89.9 | 90.9 | 92.4 |
| HLE | 分野横断の難問 | 37.8 | 36.8 | 42.7 |
| Codeforces | 競技プログラミングの rating | 3289 | 3471 | 3348 |
| MathArena Apex | 数学競技 | 58.6 | 65.6 | 65.3 |
| Terminal-Bench 2.1 | terminal 上の agent タスク | 82.7 | 90.6 | 87.9 |
| Terminal-Bench 4.0 | より難しい terminal agent タスク | 7.0 | 31.2 | 12.4 |
| DeepSWE v1.1 | 実在する repository の修正 | 54.4 | 74.2 | 62.7 |
| CyberGym | セキュリティ脆弱性タスク | 76.7 | 88.1 | 83.3 |
| AutomationBench | workflow 自動化 | 37.7 | 54.8 | 43.2 |
ここからは自分たちで検証できた内容を扱う。対象は表の前半にある、答えを検証できる項目であり、knowledge 系の項目ではない。
V4.1 Flash は本当に V4 Pro と同等で、V4 Flash より優れているのか?
答えを検証できるタスクでは 3 モデルのスコアは同じだった。違いが出たのは料金、速度、失敗の仕方だ。答えが 1 つの数値となり、自動で検証できる 11 タスクを用意した。素数の合計、桁数、grid path、硬貨の組み合わせ、規則の 40 回適用、7 の 222 乗を 1000 で割った余り、基数変換、knapsack、3 つの条件を満たす 4 桁の数の個数などだ。各タスクを reasoning_effort の low、high、max と thinking off で 3 回ずつ実行した。reasoning token は回答前にモデルが生成する非表示の思考で、出力として課金される。正解 1 件あたりのコストは、各モデルのピーク料金で算出した総額を正解数で割った値だ。V4 Flash には、提供終了まで適用されていた $0.44/$1.32 を使った。オフピーク時は半額になる。
| Model | Effort | 正解 | Reasoning tokens、中央値(最大値) | 正解 1 件あたりのコスト、ピーク時 |
|---|---|---|---|---|
| V4 Flash 0731 | low |
33/33 | 492(6,444) | $0.00131 |
| V4 Flash 0731 |
high(default) |
33/33 | 433(9,172) | $0.00163 |
| V4 Flash 0731 | max |
33/33 | 453(24,010) | $0.00343 |
| V4 Flash 0731 | thinking off | 21/33 | 0 | $0.00083 |
| V4.1 Flash | low |
33/33 | 316(6,153) | $0.00097 |
| V4.1 Flash |
high(default) |
33/33 | 391(13,300) | $0.00149 |
| V4.1 Flash | max |
33/33 | 391(11,037) | $0.00129 |
| V4.1 Flash | thinking off | 21/33 | 0 | $0.00050 |
| V4 Pro | low |
33/33 | 309(6,398) | $0.00286 |
| V4 Pro |
high(default) |
33/33 | 548(18,247) | $0.00768 |
| V4 Pro | max |
33/33 | 644(15,920) | $0.00825 |
| V4 Pro | thinking off | 21/33 | 0 | $0.00232 |
thinking を有効にした場合、どのモデルもどの effort 設定でも失敗しなかった。このテストでは精度差を判別できず、差が出たのは料金と速度だ。V4.1 Flash は Pro より low で 2.9x、default の high で 5.2x、max で 6.4x 安い。V4 Flash と比べると low で 26% 安い。thinking を切って streaming し、思考時間を除いた回答生成速度を測ると、V4.1 Flash は毎秒 121-134 output token、リクエストから最初の token までは 1.4 s だった。V4 Flash は毎秒 86-94 token、最初の token まで 2.3 s。Pro は毎秒 46-49 token、最初の token まで 1.9 s だった。2-turn の function-calling loop では、全モデルが各 turn で正確に 1 回ずつ call した。2 つの処理で使用した reasoning token は、V4.1 Flash が 27 と 13、V4 Flash が 30 と 19、Pro が 61 と 29。処理 1 回あたりのコストはそれぞれ $0.00019、$0.00030、$0.00103 だった。DeepSeek の表にある knowledge の差、つまり HLE と GPQA は、このテストでは評価していない。
effort の設定は何を変え、thinking は切れるのか?
effort の設定で一部タスクの料金は変わったが、正解は変わらなかった。一方、thinking を切ると全モデルで 33 問中 12 問を落とした。V4.1 Flash の reasoning_effort には low、high、max を指定できる。DeepSeek は minimal を low に、medium と xhigh を high に割り当てる。11 タスク中 9 タスクでは、3 設定の reasoning token 数の差は数百 token 以内だった。差が広がったのは、3 条件を満たす 4 桁の数を数えるタスクだけだ。low では 5,650、high では 9,714、max では 6,763 token を使い、すべて正解した。thinking_budget は 0-1,024 のどの値も受け付けたが、動作には反映されなかった。model card にある「1-100 の整数による連続的な reasoning effort の制御」は API では利用できず、整数を渡すと拒否される。V4 Pro と V4 Flash も、それぞれ token 数は異なるが挙動は同じだ。旧モデルでは数え上げタスクの max が高くつく。Pro は 12,729-15,920 reasoning token、V4 Flash は 17,866-24,010 reasoning token を使った。同じ正解に V4.1 Flash は 6,763 token で到達した。
2 つの制御方法と、response 内で計測値を取得する場所は次のとおりだ。
resp = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": prompt}],
reasoning_effort="low", # "low" | "high" | "max"; default "high"
extra_body={"thinking": {"type": "enabled"}}, # {"type": "disabled"} turns it off
max_tokens=4096, # always set one: see the next section
)
usage = resp.usage
reasoning_tokens = usage.completion_tokens_details.reasoning_tokens # billed as output
thinking_text = resp.choices[0].message.reasoning_content # returned on every thinking call
thinking off は安価だが危険な設定だ。失敗するタスクはモデルごとに異なる。
| Thinking off、11 タスク x 3 回 | V4 Flash 0731 | V4.1 Flash | V4 Pro |
|---|---|---|---|
| 正解 | 21/33 | 21/33 | 21/33 |
| 3 回すべて失敗 | knapsack、素数の合計、列車の時刻表 | 硬貨の組み合わせ、40-step rule、knapsack | knapsack、数え上げタスク |
| 失敗の仕方 | 形式は正しいが数値が誤っている(17, 1043、10:40) |
誤った token 1 個だけを返す(5-step chain の正解は 168 だが 83) |
計算過程を示した後、誤った答えを返す |
標準テストに含めている 5-step chain が最も分かりやすい。thinking を切った V4.1 Flash は 3 回中 1 回しか正解せず、別の 1 セットでは 3 回すべて失敗した。V4 Flash は 3 回中 2 回、Pro は 3 回すべて正解した。Pro は回答前に手順を書くが、Flash 系は書かないためだ。budget に関する補足が 2 つある。thinking mode では、入力として課金される非表示の template prefix が追加される。V4.1 Flash では 26 prompt token、V4 Flash と Pro では 79 prompt token だ。thinking off では、同じテキストが 3 モデルとも 729 token だった。また、次の turn で送り返した reasoning_content は再課金されない。V4.1 Flash では、これを含めても含めなくても 81 prompt token、Pro では 134 prompt token だった。
存在しないものについて質問するとどうなるのか?
thinking を有効にした V4.1 Flash は、出力上限を使い切るか、回答を捏造する。thinking を切ると回答を拒否し、他の 2 モデルよりも安定して拒否できた。実在しない対象について 5 問質問したため、正しい答えは「分からない」だけだ。「Verantis Dynamics」の株価、「Kessler-Fanning Institute」の職員数、「Oridium-7」の融点、「1987 Pan-Continental Robotics Prize」の受賞者などを質問し、上限を 16,384 token に設定した。
| Model、設定 | 回答を拒否 | 回答を捏造 | 16,384-token の上限に到達し、回答なし | Reasoning tokens |
|---|---|---|---|---|
| V4.1 Flash、thinking on | 0/5 | 2/5(「The Simpsons の Professor Frink が 1987 年の賞を受賞した」「Oridium-7 の融点は 1815 °C」) | 3/5 | 2,610、11,905、16,384 x3 |
| V4.1 Flash、thinking off | 5/5 | 0/5 | 0/5 | 0(69-248 output tokens) |
| V4 Flash 0731、thinking on | 1/5 | 3/5(「従業員 0 人」「Oridium-7 は約 1065 °C」「漫画 Pluto に登場するスイスのロボット Montblanc が受賞した」) | 1/5 | 4,080-16,384 |
| V4 Flash 0731、thinking off | 4/5 | 1/5(「Oridium-7 の融点は…」) | 0/5 | 0 |
| V4 Pro、thinking on | 1/5 | 3/5(「Andrew Martin が受賞した」「従業員 0 人」「融点は 899-949 °C」) | 1/5 | 754-16,384 |
| V4 Pro、thinking off | 3/5 | 2/5(According to reference 844476, the Kessler-Fanning Institute had 247…) |
0/5 | 0 |
thinking を有効にした V4.1 Flash の 5 回中 3 回は、ピーク時で 1 回あたり $0.0197 かかり、空の message を返した。他のテストで使っている 2,048-token の上限では、5 回すべてが空になった。Pro も 5 回中 4 回が空だった。検索結果に正当な理由で答えが存在しない可能性があるなら、thinking を切るか、max_tokens に上限を設定し、空の message を「不明」として扱うべきだ。Pro の thinking-off での失敗は別の形を取るため、専用の regex を用意する価値がある。Let me check that reference for you. According to reference と書いた後、架空の数値を続ける。
V4 Flash の JSON 破損は直ったのか?
json_object では、どのモデルにも修正すべき問題は見つからなかった。strict json_schema はテストできなかった。V4 Flash 0731 には、thinking on と strict json_schema の組み合わせで、13 回中 8 回 integer field が破損する不具合があった。V4.1 Flash では、使用した経路で strict json_schema が 400 を返した。DeepSeek の JSON ガイド に記載されているのも {"type": "json_object"} だけだ。
json_object では、同じ invoice、つまり vendor、date、total、line items を抽出させた。3 モデルとも、thinking on で 8 回中 8 回、thinking off でも 8 回中 8 回、すべての値が正しかった。V4 Pro は strict json_schema で thinking を有効にすると、現在も値が破損する。8 回のうち正しい line-item count を返したものは 1 回もなく、45、12、47、1、2026 となった。thinking off では 8 回中 8 回正しかった。データ抽出では、全モデルで json_object と thinking off の組み合わせが毎回正解した。V4.1 Flash の出力コストは 25 token だった。
V4.1 Flash の画像入力はいくらかかるのか?
512x512 まではどの画像も 184 input token、1 megapixel では 652、4 megapixel では 994 だった。Flash 系で画像入力に対応するのは今回が初めてだ。提供終了した Vision Exp build は別モデルで、V4 Flash 0731 はテキストしか受け付けない。生成した PNG を V4.1 Flash に送り、画像付き prompt の token 数からテキストのみの prompt の token 数を引いた。
| 画像 | Image tokens | ピーク時のコスト |
|---|---|---|
| 64x64、128x128、256x256、512x512 | 184 | $0.000055 |
| 1024x1024 | 652 | $0.000196 |
| 2048x512(1024x1024 と同じ面積) | 652 | $0.000196 |
| 512x2048 | 688 | $0.000206 |
| 2048x2048 | 994 | $0.000298 |
最小値は vision ガイド の説明と一致する。「総 pixel 数が約 544x544 未満の画像は拡大」され、それより大きい画像は「約 1300x1300 相当まで」縮小される。文書上の上限は画像 1 枚あたり 1,024 token だ。内容が単色、noise、描画済みテキストのどれでも token 数は変わらなかった。形式も PNG、JPEG、WebP、ファイルサイズも 174-243 KB で差はなかった。課金基準は byte 数ではなく画像の寸法だ。1-megapixel の画像 1,000 枚では、質問と回答を除き、画像 token だけでピーク時に $0.20 かかる。
Synthorai での扱い
V4.1 Flash の gateway 上のモデル名は deepseek-v4.1-flash だ。DeepSeek での id は deepseek-flash。料金は時間帯を問わず、100 万 token あたり入力 $0.30、出力 $1.20、cache read $0.03 で、オフピーク料金はない。この記事の数値はすべて DeepSeek の list price で示しているため、利用時間帯に合わせて換算できる。V4 Flash 0731 と V4 Pro 0813 も、それぞれ deepseek-v4-flash-0731 と deepseek-v4-pro-0813 として、各モデルの料金で引き続き利用できる。/v1/chat/completions と /v1/responses の両方で利用でき、この経路では thinking: {"type": "disabled"} で thinking を切れる。thinking を使った call では、reasoning text が毎回 reasoning_content に返る。画像入力は image_url content part として渡す。
FAQ
DeepSeek V4.1 Flash は V4 Flash より安いのか?
置き換え対象となる 8 月の料金よりは安いが、7 月の公開時料金よりは高い。V4.1 Flash はピーク時に 100 万 token あたり $0.30/$1.20、オフピーク時は $0.15/$0.60。V4 Flash は 8 月中旬以降のピーク料金が $0.44/$1.32 で、それ以前は $0.14/$0.28 だった。このテストでは、low に設定した V4.1 Flash の正解 1 件あたりのコストは $0.00097、V4 Flash は最後の料金で $0.00131 だった。
DeepSeek V4.1 Flash の thinking は切れるのか?
切れる。thinking: {"type": "disabled"} を指定する。DeepSeek は reasoning_effort: "none" も文書化している。ただし、複数ステップの処理では精度が落ちる。V4.1 Flash は、このテストで 33 問中 33 問から 21 問まで低下し、5-step chain に誤った token 1 個だけを返した。計算や計画では有効にし、抽出処理や答えが存在しない可能性のある検索では切るのがよい。
DeepSeek V4.1 Flash は画像入力に対応し、画像 1 枚のコストはいくらか?
ネイティブ対応している。V4.1 Flash では、512x512 までの画像は 184 input token、1024x1024 は 652、2048x2048 は 994 で、内容や形式には左右されない。ピーク時の list price では、画像 1 枚あたり $0.000055-$0.000298 となる。
関連記事:DeepSeek V4 Flash のコスト、DeepSeek V4 Pro GA と preview の比較、LLM の thinking 制御、画像入力の token コスト、LLM の structured output。
