AIで動画やゲーム向けの音声を作るとき、場面の雰囲気だけを指定すると、修正すべき点を説明しにくくなります。誰が何を話すのか、背景に何が聞こえるのか、どの音を優先するのかを先に整理すると、生成後の確認にも使える指示書になります。
この記事では、30秒の架空の駅案内シーンを題材に、プロンプトと検収メモの作り方を紹介します。以下は制作フローの提案であり、実際に生成して検証した結果やベンチマークではありません。
利用前に、現在のモデルを確認する
2026年10月10日時点で、SeedAudio 1.5のサイトは1.5を「Coming Soon」と表示し、現在のオンライン生成器はSeed Audio 1.0を使うと案内しています。短い試作を行う際も、モデル選択欄と利用可能な出力形式を確認してください。現在の生成結果だけで、今後のモデルの品質や機能を判断することはできません。
一方、台本と評価基準は先に準備できます。ここでは特定のAPIに依存しない、小さな制作メモを作ります。
1. 音を四つの役割に分ける
| 役割 | 駅案内シーンの例 | 指示しておくこと |
|---|---|---|
| 会話・ナレーション | 案内係の一言 | 人数、言語、台詞、話す速さ |
| 環境音 | 遠くの電車、駅の空気感 | 距離、持続、声との音量関係 |
| 効果音 | 足音、短いチャイム | 順序、回数、台詞との重なり |
| 音楽 | 控えめな短い伴奏 | 楽器、強さ、開始と終了 |
この分類は、指示を整理するためのものです。四つの役割を書けば四つの音声ファイルが出力される、という意味ではありません。独立したステムが必要なら、利用する生成器の書き出し機能を別途確認します。
2. 生成用の文章と制作メモを分ける
生成器に渡すプロンプトとは別に、次のようなJSONをプロジェクト内に置くと、レビューの観点を揃えられます。これは制作メモの例であり、サービスのAPI仕様ではありません。
{
"scene_id": "station_guide_01",
"target_seconds": 30,
"language": "ja",
"speaker_count": 1,
"required_lines": ["次の電車は、まもなく到着します。"],
"required_events": ["footsteps", "chime"],
"priority": ["dialogue", "effects", "ambience"],
"avoid": ["extra_speakers", "applause"],
"revision": "v1"
}
台詞を配列として残しておけば、聴き取り確認の際に原稿と照合できます。required_eventsには、存在してほしい音だけを記録します。最初から多くの条件を入れすぎず、採用の判断に必要な項目に絞るのが扱いやすい方法です。
3. 日本語プロンプトの例
30秒程度の、架空の小さな駅の案内シーン。
朝の落ち着いたホーム。全体は自然で静かな雰囲気。
話者は案内係の一人だけ。日本語で、穏やかにはっきりと、
「次の電車は、まもなく到着します。」と一度だけ話す。
冒頭は遠くの電車の走行音と、ゆっくり近づく足音。
短いチャイムのあとに案内係が話す。
台詞の間は背景の音を控えめにし、言葉を聞き取りやすくする。
台詞のあとに少し間を置き、走行音が自然に遠ざかって終わる。
音楽は入れない。追加の話者、歓声、拍手、別のアナウンスは入れない。
「静かな駅」という説明に加えて、音の順序と台詞の優先度を記しています。映像に合わせる場合は、効果音の目標時刻を編集タイムラインにも記録します。プロンプトに時刻を書いても、厳密な同期が保証されるわけではないため、生成後の位置確認が必要です。
4. 検収を、内容と音の二段階で行う
内容の確認では、原稿の台詞が保たれているか、話者が増えていないか、チャイムと台詞の順序が合っているかを聴きます。
音の確認では、長さ、冒頭と末尾の切れ方、台詞の聞き取りやすさ、不要な音の有無を確認します。納品形式が決まっている場合は、サンプルレートやチャンネル数も確認項目に加えます。
レビューの記録例は次のようになります。以下は記入用のテンプレートです。
| 確認項目 | 判定 | 修正メモ |
|---|---|---|
| 台詞が原稿どおり | 未確認 | 抜け・追加・発音を確認 |
| 話者が一人 | 未確認 | 別の声が入っていないか |
| チャイムが台詞の前 | 未確認 | タイムライン上で確認 |
| 背景音が声を隠さない | 未確認 | 小さなスピーカーでも試聴 |
| 終了が自然 | 未確認 | 突然の切断がないか |
波形やファイル情報だけで完了とせず、場面全体を通して聴くことも大切です。
5. 一度に変更する条件を絞る
背景音が大きい場合は、まずその強さと声との関係を修正します。同時に台詞や話者まで変更すると、どの変更が効いたのか分かりにくくなります。
v1: 基本プロンプト
v2: 電車の走行音をさらに遠く、小さく指定
v3: チャイムと台詞の間に短い間を指定
プロンプト、使用モデル、生成日時、採否の理由を同じメモに残しておけば、次の試作を説明しやすくなります。参照音声を使う場合は、使用許可と利用範囲も記録します。
次の試作に使う
まず短い場面で、台詞、音の役割、順序、検収項目を揃えてみてください。この指示書は、モデルや編集ツールが変わっても再利用できます。
モデルの現在の案内や場面別のプロンプト例は、SeedAudio 1.5 — AI音声生成ワークスペースで確認できます。制作時は、サイトの最新の提供状況と実際の生成画面を基準に機能を確認してください。