Googleは2026年9月23日、音声生成AIの新モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。文章を音声に変換する技術(TTS:Text-to-Speech)の新版で、用途に応じて2種類のモデルを使い分けられるようにした点が特徴だ。
公式発表によると、Flash TTSは声の作り込みや演技指示など、表現力を重視した用途向けに設計されている。自然言語による指示だけで声質を一から設計できるほか、セリフ1行ごとに話し方(演技のニュアンス)を細かく指定することも可能という。2人の話者による自然な掛け合いの対話生成にも対応し、笑い声やため息、相づちといった台本上の音声表現も再現できるとしている。一方のFlash-Lite TTSは、大量の音声を効率よく低コストで生成する用途を主眼に置いたモデルと位置づけられている。
対応言語は100以上の言語・方言、あらかじめ用意された音声は2,000種類以上とされる。日本語を含む主要言語での品質評価として、外部機関Hume AIによる音声設計のベンチマークでFlash TTSが総合1位を獲得したことや、複数言語の音声品質を競う「Voice Arena」の順位表で日本語を含む上位に入ったことが紹介されている。本稿ではGoogle発表内の引用を確認しており、評価元の原資料や独立した再現検証は確認していない。
Googleは、両モデルのGemini API・Google AI Studioへの順次提供を9月23日に開始した。Flash TTSはGemini Notebook、Flash-Lite TTSはGoogle Vidsでも順次提供するとしている。Gemini Enterprise経由のAPI提供は今後の予定。
本人の声を複製する「音声複製」機能については、声の主本人による口頭同意の録音が必要とされ、通常の音声生成機能とは別の確認プロセスが設けられている。また、AI Studio経由の音声複製は、イリノイ州・テキサス州・欧州経済領域(EEA)・英国・スイス・インドでは提供されないとしている。なお、既存の音声ライブラリから声を選び、音の高さや話す速さ、アクセントなどを調整できる「Voice remixing」機能は、今回の発表時点ではまだ提供されておらず、今後提供予定の機能として案内されている。
料金体系については、今回確認した公式発表ページには具体的な記載がなかった。
出典
Google公式発表(9月23日)
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
公式情報確認日:2026年9月24日
