モデル概要
Seedance 2.0はByteDanceが2026年2月にリリースしたユニファイドマルチモダルビデオ生成モデルである。170名以上の研究者が開発に参加し、2026年4月15日にarXivで技術論文が公開された。テキスト・画像・動画・音声を単一コンテキストで処理し、最大4K・10bit映像+ネイティブステレオオーディオを返す。詳細はSeedance 2.0を参照。
スペック一覧
| 項目 | 値 |
|---|---|
| 解像度 | 最大4K |
| エンコーディング | 10-bit |
| フレームレート | 24fps |
| クリップ長 | 4–15秒(拡張あり) |
| 入力上限 | 12ファイル(画像≤9, 動画≤3, 音声≤3) |
| 動画入力 | 各2–15秒、合計≤15秒 |
| 音声入力 | MP3、各≤15秒、単独投入不可 |
| オーディオ | シングルパス・ステレオ(SFX+リップシンク+環境音) |
| 成功率 | 90%以上 |
| ベンチマーク | T2V ELO 1,269 / I2V ELO 1,351 |
@参照システム
Seedance 2.0の核心機能。プロンプト内で@Image1, @Video1, @Audio1タグを使い、各ファイルに明示的な役割を付与する。
@Image1 = キャラクター顔アイデンティティ
@Image2〜@Image6 = 衣装リファレンス
@Video1 = カメラワーク参照
@Audio1 = BGM
同一画像でも「キャラクター顔として使え」と「背景として使え」では完全に異なる結果を生成する。この合成的制御を単一生成で提供するツールは現在市場にほぼ存在しない。
リファレンス・ロール・スキーマ
画像ロール (≤9)
| ロール | 用途 |
|---|---|
identity |
キャラクター顔/外見固定 |
wardrobe |
着用する衣装 |
style |
色彩/質感/美的方向性 |
environment |
背景/場所設定 |
動画ロール (≤3)
| ロール | 用途 |
|---|---|
motion |
動作/振付複製 |
camera |
カメラワーク参照 |
edit_target |
編集対象クリップ |
音声ロール (≤3)
| ロール | 用途 |
|---|---|
music |
BGM/リズム同期 |
voice |
音声特性クローン |
ambience |
環境音参照 |
制約: 音声単独投入不可。必ず画像または動画と併せて入力。
プロンプト・スキーマ
5要素テンプレートが安定した結果を生む。
subject: # 被写体の具体的描写
action: # クリップ中に何が変化するか
scene: # 場所、時間帯、天候
camera: # アングル+動き(英語撮影用語推奨)
mood: # スタイルキーワード+サウンドディレクション
I2Vプロンプト原則
画像が既に外見と構図を伝えているため、プロンプトは「何が変化するか」に集中する。保持すべき要素(顔、製品ラベル、ロゴ)はプロンプト最初の行に明記する。
# 保存指示(最初の行)
Preserve exact bottle shape, label text, cap design,
glass material, colours, and proportions.
# 変化の記述
Camera: slow clockwise orbit, 360° over 15 seconds.
Lighting: soft cyan key from left, rim from behind.
Sound: soft ambient hum, glass resonance, no music.
End: clean front-facing hero shot.
9つのコア機能
キャラクター一貫性: 長シーケンスでも顔・ディテール維持。動作複製: ヒッチコックズーム等の複雑な動きを参照動画から精密複製。ネイティブオーディオ: SFX・リップシンク・環境音の自動生成。ビデオ拡張: 既存映像を前後に自然延長。ビデオ編集: 要素の追加・削除・置換。音楽シンク: ビジュアルをビートに自動同期。クリエイティブテンプレート: 転換・パーティクル効果の再現。ワンテイク: 複数参照から連続撮影シーン生成。プロット完成: 最小入力からナラティブ自動構築。
カメラ用語チートシート
英語が最も正確に反応する。
アングル: Low angle · High angle · Eye level
Bird's eye · Dutch angle · OTS
動き: Tracking · Push-in · Pull-out · Orbital
Crane · Dolly zoom · Steadicam · Handheld
フレーミング: ECU · CU · MCU · MS · WS · EWS
サウンドディレクティング
映像と同一パスでステレオオーディオを生成する。
# 良い例
sound = {
"sfx": ["footsteps on concrete", "rain"],
"timing": {"0:08": "thunder"},
"ambient": "distant traffic",
"music": "none"
}
# 悪い例
sound = "nice background"
楽器・タイミング・サイレンスを明示するほど品質向上。
キャラクター一貫性パターン
デュアルアンカー方式:
1. identity画像を毎生成に投入
2. プロンプトでも外見をテキスト記述
「短い黒髪、白リネンシャツ、銀リング」
3. 画像 = 顔のアンカー
テキスト = ディテールのアンカー
→ ドリフト防止
画像のみの単一アンカーではドリフト発生。
料金
無料プラン: 登録時クレジット付与、商用利用可、ウォーターマークなし。有料: Basic $8.33/月〜(年払い)。全プランで商用利用許可。コスト戦略: Mini/Fastモードでテスト→確定後フルモードで最終版。
競合ポジショニング
リリース時T2V ELO 1,269 / I2V ELO 1,351でKling 3.0, Veo 3, Runway Gen-4.5を上回る。@参照による合成的制御は市場で独自。無料プランでの商用利用は大半の競合が有料のみで許可する点と差別化。
後継: Seedance 2.5(2026年7月)→ 30秒シングルショット、50レフ、4モード編集。
トラブルシューティング
| 問題 | 原因 | 解決 |
|---|---|---|
| キャラドリフト | ID固定不足 | デュアルアンカー |
| オーディオ不正確 | 曖昧な指示 | 楽器・タイミング具体明示 |
| レフ衝突 | 役割不明/過多 | 1ファイル1ロール+削減 |
| 結果不満足 | 全体再生成 | 編集機能で部分修正 |
