モデル概要
MiniMax H3は2026年7月31日にリリースされたユニファイドマルチモダルビデオ生成モデルである。技術的にはHailuo 3.0と同一。テキスト・画像・動画・音声を単一コンテキストで処理し、ネイティブ2K(2560×1440)映像+ステレオオーディオを返す。詳細はMiniMax H3を参照。
スペック一覧
| 項目 | 値 |
|---|---|
| 解像度 | 2K(2560×1440) |
| フレームレート | 24fps |
| クリップ長 | 5–15秒(延長 ~30秒) |
| 入力上限 | 12ファイル(画像≤9, 動画≤3, 音声≤3) |
| 動画入力 | 各2–15秒、合計≤15秒 |
| 音声入力 | MP3、各≤15秒、単独投入不可 |
| アスペクト比 | 21:9 · 16:9 · 4:3 · 1:1 · 3:4 · 9:16 · adaptive |
| オーディオ | シングルパス・ステレオ(対話+SFX+環境音) |
| 価格 | ~$1/15秒2Kクリップ(主流の~1/3) |
| ベンチマーク | ビデオ編集 世界1位(Artificial Analysis) |
エンドポイント・ルーティング
入力構成に基づき3つのエンドポイントに分岐する。
text-to-video
入力:テキストプロンプトのみ。メディアなし。
first-and-last-frame
入力:テキスト+画像(開始/終了フレームとして指定)。2フレーム間をモデルが補間。
reference-to-video
入力:テキスト+画像/動画/音声を参照資料として投入。アイデンティティ固定、モーション転移、スタイルマッチング、音声クローン、クリップ編集。最も高機能なエンドポイント。
# ルーティングロジック
def select_endpoint(media_files, frame_designation):
if not media_files:
return "text-to-video"
elif frame_designation in ["first", "last"]:
return "first-and-last-frame"
else:
return "reference-to-video"
fal.aiでは3エンドポイントが個別に公開されている。
リファレンス・ロール・スキーマ
reference-to-videoエンドポイントの核心設計。各ファイルにプロンプト内で役割を明示的に付与する。
| ロール | ファイル型 | 用途 |
|---|---|---|
identity |
画像 | キャラクター顔/外見固定 |
wardrobe |
画像 | 着用する衣装 |
style |
画像 | 色彩/質感/美的方向性 |
environment |
画像 | 背景/場所設定 |
motion |
動画 | 動作/カメラパス複製 |
edit_target |
動画 | 編集対象の既存クリップ |
voice |
音声 | 音声特性クローン |
music |
音声 | リズム構造によるビジュアル同期 |
ambience |
音声 | 環境音参照 |
ロール指定はプロンプトテキスト内の自然言語で行う:
Image 1 = character identity reference.
Image 2-4 = wardrobe references.
Video 1 = camera movement reference.
Audio 1 = background music.
アンチパターン:複数ファイルをロール指定なしで投入。モデルが曖昧に解釈し、予測不能な出力になる。
プロンプト・スキーマ
7要素のテンプレートが最も安定した結果を生む。
preservation: # I2V時のみ。最初の行に記述
- "ボトルの形状、ラベル、材質を保持"
subject: # 被写体の具体的描写
action: # クリップ中に何が変化するか
environment: # 場所、時間帯、天候
camera: # アングル+動き(英語撮影用語推奨)
lighting: # 方向、色温度、品質
style: # 美的処理キーワード
sound: # 聞こえるべき音+無音区間
プロンプト例:商品広告
Preserve exact bottle shape, label text, cap design,
glass material, colours, and proportions.
Glass perfume bottle on marble surface.
Camera: slow clockwise orbit, 360° over 15 seconds.
Lighting: soft cyan key from left, rim light from behind.
Atmosphere: fine mist drifting through background.
End: clean front-facing hero shot.
Style: premium commercial, shallow DOF.
Sound: soft ambient hum, glass resonance, no music.
プロンプト例:キャラクターアクション
Image 1 = character identity reference.
30s woman, short black hair, white linen shirt.
Walks quickly through narrow rain-soaked alley,
stops at the end, turns to look back.
Camera: low-angle Steadicam tracking, slow push-in.
Lighting: neon reflections on wet pavement.
Style: cinematic, film grain, anamorphic bokeh.
Sound: footsteps on wet concrete, rain, distant traffic.
No music.
サウンド・ディレクティング
H3は映像と同じ推論パスでステレオオーディオを生成する。サウンドを別トラックとしてディレクティングする。
# 良い例
Sound: espresso machine hissing (continuous),
cup placed on saucer at 0:04,
café chatter at low volume,
acoustic guitar 80bpm,
no percussion.
# 悪い例
Sound: nice café background.
楽器、SFXのタイミング、無音区間を明示するほどオーディオ品質が向上する。
インストラクション編集
再生成なしで既存クリップを部分修正する機能。
# ワークフロー
edit_input = {
"edit_target": existing_clip,
"prompt": """
Change background to rooftop terrace at sunset.
Warm golden lighting.
Preserve: product position, camera movement, pacing.
"""
}
# 未言及要素は自動保持
原則:1回のパスで1要素のみ修正。順次的アプローチが最も安定。
プロダクション・パターン
コスト最適化パイプライン
Phase 1: 768p → プロンプト+リファレンス組み合わせテスト
Phase 2: 方向確定 → 2K最終版レンダリング
Phase 3: インストラクション編集 → 部分修正(再生成回避)
キャラクター一貫性パターン
全生成に同一identity画像を投入
+ プロンプトで外見特徴をテキスト記述(デュアルアンカー)
= ドリフト防止
画像のみの単一アンカーではドリフトが発生。画像+テキストのデュアルアンカーが必要。
競合ポジショニング
| モデル | 強み | H3対比の弱み |
|---|---|---|
| Kling 3.0 | ネイティブ4K | オムニリファレンス制御なし |
| Veo 3.1 | 48kHz対話、T2Vベンチマーク上位 | プロプラ、高価格 |
| Seedance 2.0 | I2V強し | プロプラ |
| H3 | 編集1位、オムニref、オーディオ統合、OW予告、1/3価格 | 2K上限 |
注意:H3はリリース直後。独立アリーナスコア未確立。比較は暫定的。
オープンウェイト
MiniMax発表:「数日以内に」法規制に準拠しウェイト公開。日程・ライセンス未確定。実現すればフロンティア級ビデオモデル初のオープン化。