0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Qwen-Image 3.0 API を実測:$0.03 で 9 シーン

0
Last updated at Posted at 2026-08-06

この記事は Synthorai ブログの記事 Qwen-Image 3.0 API を実測:$0.03 で 9 シーン の転載です。原文(多言語対応)はリンク先をご覧ください。

Qwen-Image 3.0 API を実測:$0.03 で 9 シーン

Qwen-Image 3.0 の生成画像 1 枚あたりの料金は $0.03 で、前世代の $0.035 より安い。prompt は無料だ。検証では、およそ 5,000 token の prompt でも、11 語の prompt と料金はまったく同じだった。この一点だけでも、token 従量課金の競合とは大きく異なる。さらに、目玉機能にも実際のコストメリットがある。3x3 のグリッドに異なる 9 シーンを指定すると、9 シーンすべてが 1 枚の画像として生成され、課金も 1 枚分で済む。qwen-image-3.0 が商用 API で提供された初日に検証した。リリース時点では料金表、benchmark、weight、technical report が一切公開されていなかったためだ。課金方式、9-in-1 という主張、10 pixel の文字を描画できるという主張、日本語の小さな文字をめぐる評価、4,500 token の prompt window、前世代モデル やほかの画像生成モデルとの位置付けを調べた。

TL;DR

  • qwen-image-3.0 は生成画像 1 枚あたり $0.03 で、前世代の $0.035 より安い。検証した範囲では、prompt の長さにかかわらず課金されなかった。
  • 「一度に 9 枚」という主張は、1 枚のグリッド画像としてなら本当だった。指定した 9 シーンすべてが生成され、課金は 1 枚分だった。API の batch 上限は n=4。
  • 指定した小さな文字は弱点だ。英語の脚注は 3 回中 3 回でスペルを間違えた。一方、モデルが自分で考えた文字はきれいに描画された。
  • 生成は遅い。標準的な生成で 58〜85 秒かかり、qwen-image-2.0 の 10 秒を大きく上回る。長い prompt では 241 秒まで伸びた。

Qwen-Image 3.0 の課金方式

料金は解像度 tier ごとの画像単位で、prompt は無料だ。各 response の usage には token フィールドではなく、画像数と tier が記録される。1024x1024 またはアスペクト比を変えた同等サイズの request は 1K tier の画像 1 枚として課金される。2048x2048 の request は 2K tier になる。prompt は usage に一切反映されない。同じシーンについて、11 語の prompt と、推定 1,000、4,200、5,000 token の filler を加えた prompt を送ったが、料金はすべて同じだった。リリース週の後に DashScope が公開した料金表 も、この課金方式と完全に一致する。qwen-image-3.0 はどちらの tier でも生成画像 1 枚あたり $0.03。画像編集 workflow では入力画像 1 枚あたり $0.003 で、tier の境界は出力面積 2,250,000 pixel に設定されている。tier ごとに料金が変わるのは pro SKU だけで、1K クラスの出力は $0.04、2K は $0.075 だ。注目すべきは価格の方向性だ。誰もが premium 価格を予想していたリリースで、機能を強化しながら qwen-image-2.0 の $0.035 を下回る $0.03 に値下げした。

token 従量課金の画像 API とは、課金構造そのものが違う。gpt-image-2 は prompt token と出力画像 token の両方を課金するうえ、出力 token 数も安定しない。同じ 11 語の prompt でも、ある実行では 215 output token、別の実行では 744 output token となり、同一 request の従量料金に 3.5 倍の差が出た。画像単位の固定料金には、このばらつきがない。予測した金額がそのまま請求額になる。5 モデルのコストを検証した 以前の調査でも同じ違いが出た。画像単位の課金は単調だが、予算管理ではそれが利点になる。

「一度に 9 枚」は本当か

本当だ。ただし言葉から想像する形とは異なり、料金面では実際の方式のほうが有利だ。API の batch parameter は 4 を超える値を拒否する(n must be between 1 and 4)。そのため、1 回の call で 9 個の別ファイルを受け取ることはできない。リリース時の demo が示しているのは、1 枚の画像内での構図生成だ。異なる 9 シーンを 3x3 のグリッドに配置するよう指定すると、そのとおり生成される。検証では、夕暮れの灯台、チェスの対局、ラーメンの丼、折り鶴、地下鉄のホーム、雨の中のサボテン、バイオリン、雪のキツネ、熱気球を指定した。

指定した 9 シーンをそれぞれ明確かつ詳細に描いた 3x3 グリッドの生成画像

9 シーンすべてが破綻なく生成され、課金は画像 1 枚分だった。シート全体で $0.03、使える cell 1 個あたり $0.0033 だ。Alibaba の demo では、この仕組みをさらに高度に使い、文字や数式を含む 9 枚の本格的な infographic を 1 つのグリッドに収めている。9 個の独立ファイルではなく、thumbnail、mood board、option sheet が必要な workflow なら、実用的なコスト削減になる。固定料金の生成 1 回で 9 回分を置き換えられ、グリッドの切り出しも 1 行の crop 処理で済む。

10 pixel の文字は拡大しても読めるか

半分は読める。ただし失敗するのは、そのまま公開する文字列だ。このモデルは 10 pixel までの文字を描画できるとされている。layout に関しては、検証結果がその主張を上回った。仕様書を生成させると、モデルが独自に sidebar、port diagram、同梱物の行、security badge を追加し、数十個の小さな label もすべて読みやすく、スペルも正しかった。失敗したのは、一字一句そのまま描画するよう指定した文字列だけだ。脚注として「All measurements at 25 degrees Celsius」と指定したところ、3 回の生成で「Celkaus」「Celuse」「Celsue」になった。正しく描画できたのは 3 回中 0 回で、誤りは毎回、ページ内で最も小さい文字に発生した。

豊富で正確な layout とモデル独自の機能表を含む生成仕様書。指定した脚注の Celsius が Celuse になっている

日本語でも同じ傾向だった。これでリリース週の評価をめぐる議論にも答えが出る。公式 demo と比べ、日本語の小さな文字が「やや不自然」に見えるという 独立検証の報告 があり、今回の検証でも再現した。2 行の保管上の注意を指定して日本語 label を 3 回生成したところ、完全に正しかったのは 1 回だけだった。1 回は 1 文字が崩れ、もう 1 回は 2 文字が別の文字になった(読が認に、保管が保宜になった)。それ以外は非の打ち所がない minimalist な label だった。

簡潔なデザインの日本語製品 label。小さな注意書きで指定した 2 文字が別の文字になっている

傾向は一貫しており、失敗箇所もはっきりしている。モデルが自分で考えた文字は正確だが、指定した文字列をそのまま転記させると glyph が崩れる。中国語の prompt では逆方向からも確認できた。モデルは指示されていない 3 つの bin label(加急、普通、存档)を独自に作り、すべて正しい漢字で描画した。

中国語の prompt から生成したシーン。ロボットが封筒を 3 つの bin に仕分け、モデルが正しい漢字で label を付けている

試したすべての言語で、モデルが自分で作った文字は正確だった。mockup、storyboard、layout comp なら、文字描画は十分に production 品質だ。指定どおりの文字列が不可欠な用途、たとえば compliance notice、仕様値、法的文言では、すべての glyph を校正するか、生成後に正しい文字を合成する必要がある。

4,500 token の prompt window で何ができるか

追加料金なしで多くの指示を入れられるが、待ち時間は増える。このリリースの中心的な強化点は、指示量の上限だ。前世代より 4.5 倍長い prompt を扱える。受理上限を段階的に検証したが、明確な壁は見つからなかった。推定 4,200 token、さらに 5,000 token の filler prompt もエラーなく受理された。少なくとも検証できた境界では、document に記載された上限を超えてもエラーにならなかった。画像単位の課金なので、長くしても追加料金は発生しない。一方、latency は不安定ながら増加した。標準的な短い prompt は 58〜85 秒。1,000 token の 2 回は 85 秒と 120 秒、4,200 token は 241 秒、5,000 token は 88 秒だった。全体としては長くなる傾向があるが、ばらつきも大きい。この window を使うなら、費用ではなく処理時間に余裕を持たせる必要がある。

画像生成モデルの中での位置付け

catalog 内では大差をつけて最も遅い。これは 「見栄えではなく実用性」を重視した設計 の代償といえる。同日、同じ prompt で各モデルの処理時間を測定した。

モデル 画像 1 枚の生成時間(2 回) 課金方式 画像 1 枚の定価
qwen-image-2.0 9.8 / 10.2 画像単位 $0.035
qwen-image-2.0-pro 13.4 / 14.2 画像単位 $0.075
wan2.7-image 20.4 / 23.0 画像単位 -
seedream-5-0 30.8 / 34.1 画像単位 -
gpt-image-2 32.3 / 35.1 token 単位 実測 $0.007-$0.023
qwen-image-3.0 通常 58〜85 画像単位 $0.03

位置付けについて 2 点ある。まず、前世代が不要になったわけではない。qwen-image-2.0 は 6 分の 1 の時間で生成できるため、大量の単純な asset を処理するなら throughput で優位だ。3.0 は、2.0 では指示に従えない複雑な layout、文字量の多い画像、指示密度の高い作業に時間をかけるモデルだ。次に、Alibaba は現在、Qwen-Image と Tongyi Wanxiang 系の wan2.7-image という 2 つの画像生成 line を並行して提供している。後者は 3 倍高速だ。Alibaba ecosystem 内で document よりも見た目を重視するなら、こちらも比較対象になる。

capacity はまだ beta 相当で少ないため、rollout plan に織り込む必要がある。検証の途中、約 12 回生成した時点で upstream の rate quota に達した。無料 tier の報告 でも、連続 call で同じ 429 が発生している。通常の benchmark 表を掲載できない理由も記しておく。このリリースでは benchmark、weight、technical report が公開されず、料金表もリリース週の後に公開された。そのため、大半の主張には照合できる公式情報がない。ここまでの内容はすべて、独自の計測と検証に基づく。provider によって画像単価が異なる可能性もある。第三者の推測ではなく、最初の invoice で確認すべきだ。

FAQ

Qwen-Image 3.0 の画像 1 枚あたりの料金はいくらか

DashScope の公開料金 では、どちらの解像度 tier でも生成画像 1 枚あたり $0.03 だ。入力画像は画像編集 workflow で $0.003、text prompt は長さに関係なく無料となる。qwen-image-2.0 の $0.035 より安い。pro SKU は tier ごとに料金が異なり、1K クラスの出力は $0.04、2K は $0.075 だ。

Qwen-Image 3.0 は本当に一度に 9 枚の画像を生成できるか

1 枚の画像としてなら可能だ。3x3 のグリッドを指定する prompt で、要求した 9 シーンがすべて明確に描き分けられ、1K tier の画像 1 枚として課金された。API batch としては不可能だ。n の上限は 4 で、batch 内の各画像には個別に料金がかかる。独立したファイルではなく contact sheet が必要なら、グリッド形式が最もコスト効率に優れる。

Qwen-Image 3.0 の小さな文字は production で使えるか

モデルが自分で作る文字なら使える。検証では、モデルが独自に生成した label や copy は、英語、中国語、日本語のすべてで正しく描画された。指定した文字列をそのまま描画させる用途には向かない。指定した英語の脚注は 3 回中 3 回でスペルを間違え、日本語も 3 回中 2 回で少なくとも 1 文字が変わった。指定した小さな文字は校正するか、正しい書体で後から合成する必要がある。

Qwen-Image 2.0 から upgrade すべきか

2.0 では対応できない作業に限れば upgrade する価値がある。複雑な layout、document 形式のページ、長く複数要素を含む指示、画像内の文字が該当する。同じ画像単位の課金方式で、2.0 は標準的なシーンを約 10 秒で生成できるのに対し、3.0 は 58〜85 秒かかる。throughput を重視する workload は 2.0 のままでよい。3.0 はそのまま置き換えるモデルではなく、指示量の多い生成に特化したモデルとして扱うべきだ。

2026-08-05 から 2026-08-06 にかけて、qwen-image-3.0 が商用 route で利用可能になった当日に Synthorai gateway 経由で測定した(-pro tier は未提供)。課金方式と size tier、batch 上限とグリッド構成、長い prompt の受理上限(word 数から filler の長さを 1,000 / 4,200 / 5,000 token と推定。images API は prompt token 数を返さない)、中国語と日本語の prompt、小さな文字を複数回生成する検証、catalog 内の 6 モデルを対象とした同日同一 prompt の処理時間を調べた。掲載した生成画像は検証時の未編集出力。金額はリリース週の後に公開された DashScope の料金表に基づき、実測した usage の構造とも一致する。gpt-image-2 の画像単価の範囲は、以前の画像生成調査で確認した料金を実測 token 数に適用したもの。beta の成熟に伴い、挙動が変わる可能性がある。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?