はじめに
2026年9月22日、Gemini API に次世代の音声合成(TTS)モデル**「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」**が一般提供(GA)されました。あわせて、音声を検索・管理する新エンドポイント /v1beta/voices や、テキストからカスタム音声を作る Voice design、同意確認つきで声を複製する Voice replication、150種類以上の音声を扱える Extended Voice Library も登場しています。
音声エージェントやナレーション生成、オーディオブック制作などを Gemini API で行っている開発者にとっては影響が大きいアップデートです。特に gemini-3.1-flash-tts-preview を本番で使っている場合は、移行計画を立てておく必要があります。
📌 影響を受ける人
- Gemini API で TTS(音声合成)機能を使っている開発者
- リアルタイム音声エージェント(STT→LLM→TTS のカスケード構成)を運用している開発者
gemini-3.1-flash-tts-previewを本番環境で使用中のチーム- オーディオブック・ポッドキャスト・ナレーション生成など創作系の音声アプリを作っている開発者
変更の全体像
今回の更新の全体像を図にまとめました。2つの新モデルを軸に、Voices エンドポイントと3つの音声機能がぶら下がる構成になっています。
変更内容
1. Gemini 3.8 Flash TTS(フラッグシップ、GA)
gemini-3.8-flash-tts は表現力重視の創作向けフラッグシップ TTS モデルです。
- スタジオ品質の音声出力
- 細かなニュアンスの演技表現
- 地域の方言への対応
- 長時間・複数ターンでも安定した生成
ナレーション、オーディオブック、キャラクターボイスなど、品質を重視する用途に向いています。
2. Gemini 3.8 Flash-Lite TTS(GA、preview の後継)
gemini-3.8-flash-lite-tts は速度とコスト効率を重視したモデルで、公式に gemini-3.1-flash-tts-preview を置き換えるモデルと明記されています。
- 大量処理が必要な本番バッチ処理
- 音声認識→LLM→音声合成のカスケード構成によるリアルタイム音声エージェント
に適しています。ただし、プレビュー版の提供終了日は現時点のリリースノートには記載されていません。
3. Voices エンドポイント(/v1beta/voices)
音声の一覧取得・検索ができる新エンドポイントです。150種類以上の既製音声とカスタム音声を扱う Extended Voice Library への入り口と考えられます。v1beta パスのため、今後仕様変更の可能性がある点に留意してください。
4. Voice design / Voice replication / Extended Voice Library
| 機能 | 概要 |
|---|---|
| Voice design | テキストの指示(プロンプト)から、保存して繰り返し使えるカスタム音声キャラクターを作成 |
| Voice replication | 既存の声を複製。声の持ち主の同意確認の仕組みが組み込まれている |
| Extended Voice Library | 150種類以上の既製・カスタム音声を検索可能 |
⚠️ Breaking Change ではありませんが注意
Voice replication は悪用の懸念がある機能です。同意確認の具体的な手順や利用規約を事前に確認してから組み込んでください。
モデル比較表
| モデル | ステータス | 特徴 | 主な用途 |
|---|---|---|---|
gemini-3.8-flash-tts |
GA(新規) | スタジオ品質、演技表現、方言対応、長時間安定 | ナレーション、創作コンテンツ |
gemini-3.8-flash-lite-tts |
GA(新規) | 高速・低コスト | 大量処理、リアルタイム音声エージェント |
gemini-3.1-flash-tts-preview |
プレビュー(後継あり) | Flash-Lite TTS の前身 | 移行推奨 |
影響と対応
-
gemini-3.1-flash-tts-previewを本番利用中の場合:gemini-3.8-flash-lite-ttsへの移行を計画してください。提供終了日は未発表ですが、GA版への切り替えが明示的に案内されています。 -
新規で TTS を導入する場合:品質重視なら
gemini-3.8-flash-tts、速度・コスト重視ならgemini-3.8-flash-lite-ttsを選択してください。 - Voice replication を使う場合:同意確認フローと利用規約を必ず事前確認してください。
💡 Tips
リアルタイム音声エージェント(STT→LLM→TTS のカスケード構成)を構築している場合は、レイテンシ要件からgemini-3.8-flash-lite-ttsが第一候補になります。
コード例
モデル ID を差し替えるだけで新モデルに移行できます。
Before(プレビュー版を使用)
import google.generativeai as genai
response = genai.generate_speech(
model="gemini-3.1-flash-tts-preview",
text="こんにちは、これはテスト音声です。",
)
After(GA版の Flash-Lite TTS に移行)
import google.generativeai as genai
response = genai.generate_speech(
model="gemini-3.8-flash-lite-tts",
text="こんにちは、これはテスト音声です。",
)
品質を重視する場合は gemini-3.8-flash-tts を指定します。
response = genai.generate_speech(
model="gemini-3.8-flash-tts",
text="物語の主人公は、静かな声でこう語り始めた。",
)
Voices エンドポイントで音声一覧を取得する場合のイメージ(詳細な仕様は公式ガイドを確認してください)。
import requests
resp = requests.get(
"https://generativelanguage.googleapis.com/v1beta/voices",
headers={"x-goog-api-key": "YOUR_API_KEY"},
)
voices = resp.json()
まとめ
-
gemini-3.8-flash-tts(フラッグシップ)とgemini-3.8-flash-lite-tts(高速・低コスト)がGAになった -
gemini-3.8-flash-lite-ttsはgemini-3.1-flash-tts-previewの後継。移行計画が必要(終了日は未発表) - 新しい
/v1beta/voicesエンドポイントで音声の検索・管理が可能に - Voice design(カスタム音声作成)、Voice replication(同意確認つき音声複製)、Extended Voice Library(150種類以上)が追加
TTS を使ったプロダクトを開発している場合は、まずは新モデルへの切り替えテストから始めることをおすすめします。