Qwen3-TTS で声をクローン・設計する+RVC で元のアクセントを保持した声変換
はじめに
Alibaba Cloud の Qwen チームが 2026 年 1 月に公開した Qwen3-TTS は、オープンソース TTS モデルとして初めて ElevenLabs・MiniMax-Speech といった商用サービスを性能で上回りました(英語 WER 1.24%、話者類似度 0.775)。Apache 2.0 ライセンスでローカル実行が可能です。
この記事では Qwen3-TTS の 2 つの主要機能と、TTS では再現できない「アクセント保持」を解決する RVC ワークフローを解説します。
記事の核心:使い分けの鍵
| やりたいこと | アプローチ |
|---|---|
| テキストを特定の声で読ませたい | Qwen3-TTS ボイスクローン |
| ゼロからキャラ声を作りたい | Qwen3-TTS ボイスデザイン |
| 既存の録音をそのまま別の声に変えたい | RVC × ChatterBox(音声変換) |
モデルラインナップ
| モデル名 | パラメータ | 特徴 | 主なユースケース |
|---|---|---|---|
| Qwen3-TTS-12Hz-1.7B-Base | 1.7B | 最高品質・SOTA WER | ボイスクローン本番用 |
| Qwen3-TTS-12Hz-0.6B-Base | 0.6B | 軽量・97ms レイテンシ | リアルタイム・エッジ |
| Qwen3-TTS-25Hz-1.7B-Base | 1.7B | 長文安定性に優れる | オーディオブック・長尺 |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign | 1.7B | 自然言語で声を設計 | キャラクター声デザイン |
| Qwen3-TTS-12Hz-1.7B-CustomVoice | 1.7B | 9 プリセット+属性編集 | 感情・トーン調整 |
1. ボイスクローン:実在する声を忠実に再現する
仕組み
参照音声(ref_audio)とその書き起こし(ref_text)を渡すと、話者の声質を継承した音声を生成します。内部では 2 つの経路でクローニングを実行します。
- スピーカーエンベディング経由:参照音声をエンコードして話者ベクターを生成し、リアルタイムクローニングに使用
- In-context Learning 経由:テキスト–音声ペアを文脈として与えることでプロソディ(抑揚・リズム)の保持精度が向上
参照音声の長さと品質の関係
| 参照音声の長さ | 話者類似度(目安) | 推奨用途 |
|---|---|---|
| 3 秒 | 〜0.75 | 動作確認・プロトタイプ |
| 5〜8 秒 | 〜0.82 | 一般コンテンツ制作 |
| 10〜15 秒 | 〜0.89 | 本番・高品質用途 |
| 15 秒以上 | 横ばい(プラトー) | それ以上は効果薄 |
書き起こし精度が品質を左右する
コミュニティ実測では、参照音声の書き起こし精度を改善すると話者類似度が 0.75 → 0.89 まで向上した事例があります。Whisper 等の ASR で自動書き起こしした後、人手で修正するワークフローが効果的です。
基本的な使い方
from qwen3_tts import Qwen3TTS
tts = Qwen3TTS.from_pretrained("Qwen/Qwen3-TTS-12Hz-1.7B-Base")
audio = tts.generate(
text="こんにちは。今日もよい一日を。",
ref_audio="reference_voice.wav", # 10〜15 秒の参照音声
ref_text="参照音声の書き起こしテキスト"
)
audio.save("output.wav")
2. ボイスデザイン:テキストでキャラクターの声を設計する
指定できる属性
| 属性カテゴリ | 例 |
|---|---|
| 性別・年齢 | 30代の女性、高齢の男性 |
| 声質・音色 | ハスキー、クリア、深みのある低音 |
| 感情・トーン | 温かみのある、権威ある、明るい |
| 話し方スタイル | ナレーター調、カジュアル、囁くような |
| アクセント(概略) | British accent、slight Japanese accent |
| 発話速度・ピッチ | ゆっくりとした口調、高めのピッチ |
アクセント指定は中国語・英語のみサポート。他言語の声を英語で記述することは可能ですが、アクセント再現の精度には限界があります(後述)。
プロンプト例
ナレーター(英語)
"A deep, authoritative male narrator voice with a slight British accent,
speaking at a measured pace with gravitas and warmth."
アニメキャラ系
"Young energetic female voice, high-pitched, cheerful and enthusiastic,
with an anime-like expressive tone."
日本語キャラクター
"おっとりとした中年男性の声。落ち着いた低音で、穏やかで知的な印象を与える話し方。"
プロンプトは 15〜40 語程度の具体的な記述が推奨されます。「female voice」のような単純すぎる記述は品質が落ちます。
ボイスデザイン → クローンへの変換ワークフロー
① VoiceDesign でサンプル生成
↓
② create_voice_clone_prompt でクローンプロンプト化
↓
③ generate_voice_clone で同じ声を効率的に量産
この流れにより、毎回声設計を再実行せず再利用可能な状態で管理できます。
3. アクセント問題と限界
Qwen3-TTS は強力な TTS ですが、アクセント再現については実用上の制限があります。
確認されているアクセントの制限
- 英語発話で中国語訛りが強くなりやすい(特に 0.6B モデル)
- British / Australian など特定アクセントはテキスト指定では不安定
- 実装変更でクローン済みアクセントが American English に戻るケースあり
- 日本語は品質が高いが、技術レポートのベンチマークでは一部言語で MiniMax に劣る
TTS の範囲内での回避策
- 実際のネイティブスピーカー音声 10〜15 秒をクローン参照音声に使う(テキスト記述より信頼性大)
- VoiceDesign → クローン変換で声を固定する
根本的解決策 → RVC による音声変換
元話者のアクセント・感情・間を完全に保持したい場合は、TTS ではなく音声変換(Voice Conversion)が本質的な解決策です。
4. RVC × ChatterBox:元のアクセントを保持した声変換
TTS と音声変換の根本的な違い
| 観点 | Qwen3-TTS(TTS) | RVC(音声変換) |
|---|---|---|
| 入力 | テキスト | 音声ファイル |
| 出力 | テキストを別の声で発声 | 元の発声を別の声質に変換 |
| アクセント保持 | 限定的(モデル依存) | 元音声のまま完全保持 |
| 感情・間 | 指定要(プロンプト) | 自動保持 |
| 必要なもの | テキスト+参照音声 | 元音声+学習済み RVC モデル |
RVC の仕組み
元音声
│
├─→ HuBERT(コンテンツ特徴抽出)
│
└─→ RMVPE(F0 ピッチ推定・維持)
│
↓
RVC モデル(話者特徴のみ変換)
│
↓
デコーダー → 変換後音声
ポイントは F0(基本周波数 = ピッチ輪郭)を元音声のまま維持すること。これによりアクセントや感情表現がそのまま保たれます。実験でも「元音声と変換後のピッチ輪郭はほぼ一致する」ことが確認されています。
ChatterBox VC との比較
| エンジン | 必要な準備 | 品質 | アクセント保持 | 向き不向き |
|---|---|---|---|---|
| RVC | 学習済み .pth モデル | 高(学習量依存) | 完全保持 | 特定話者の大量変換 |
| ChatterBox VC | 参照音声 数秒のみ | 中〜高(ゼロショット) | 完全保持 | 手軽な試作・多様な声 |
| CosyVoice 3 VC | 参照音声 数秒のみ | 高 | 完全保持 | 高品質ゼロショット |
5. ComfyUI TTS-Audio-Suite ワークフロー
同梱ワークフロー(音声変換関連)
TTS-Audio-Suite の example_workflows.zip に以下が含まれています。
| ファイル | 用途 |
|---|---|
Unified 🔄 Voice Changer - RVC X ChatterBox.json |
音声→別声変換(本記事の中心) |
Qwen3 integration + ASR.json |
Qwen3-TTS+自動書き起こし統合 |
RVC 🎓 Model Training.json |
RVC モデルのトレーニング |
Voice Cleaning - Noise Removal + Voice Fixer.json |
音声前処理 |
ノード接続(最小構成)
[Load Audio] [Load RVC Model]
source_audio ──────→ [Voice Changer] ←── rvc_model
│
↓
[Save Audio / Preview]
converted_audio
ChatterBox VC を使う場合(モデル不要)は Load RVC Model の代わりに参照音声を直接 narrator_target に接続するだけです。
パラメータ設定指針
| パラメータ | 推奨値 | 注意 |
|---|---|---|
| TTS_engine | RVC or ChatterBox | ChatterBox は参照音声を直接接続 |
| refinement_passes | 1〜3 | 5 以上は音質劣化リスク |
| RVC モデル配置先 | ComfyUI/models/RVC/ |
auto_download: True で自動取得可 |
| FAISS index | ComfyUI/models/RVC/.index/ |
省略可。あると類似度向上 |
| 入力音声品質 | WAV 16bit / 24kHz 以上 | ノイズは Voice Cleaner で除去推奨 |
6. ユースケース別ワークフロー選択ガイド
| やりたいこと | 推奨アプローチ | 必要なもの |
|---|---|---|
| テキストを特定人物の声で読み上げたい | Qwen3-TTS ボイスクローン | 参照音声 10〜15 秒+書き起こし |
| 完全オリジナルのキャラ声を作りたい | Qwen3-TTS ボイスデザイン | テキスト記述プロンプト |
| 既存の録音をそのまま別の声に変えたい | RVC × ChatterBox VC | 元音声+RVC モデル or 参照音声 |
| アクセント・感情を完全に保ちたい | RVC / ChatterBox VC | 元音声ファイル |
| 多言語で同じ声を使いたい | Qwen3-TTS 多言語クローン | 参照音声 1 つで 10 言語対応 |
| リアルタイム声変換(配信など) | Qwen3-TTS-12Hz-0.6B(97ms) | GPU 環境(RTX 3090 以上推奨) |
| 長時間オーディオブックを生成したい | Qwen3-TTS-25Hz-1.7B | TTS SRT ワークフロー使用 |
7. ベンチマーク比較(技術レポートより)
ゼロショットボイスクローン WER(Seed-TTS eval)
WER は低いほど良い。
| モデル | 中国語 WER | 英語 WER |
|---|---|---|
| Seed-TTS | 1.12% | 2.25% |
| MiniMax-Speech | 0.83% | 1.65% |
| Qwen3-TTS-12Hz-0.6B-Base | 0.92% | 1.32% |
| Qwen3-TTS-25Hz-1.7B-Base | 1.10% | 1.49% |
| Qwen3-TTS-12Hz-1.7B-Base | 0.77% | 1.24% ★SOTA |
話者類似度(コサイン類似度)
| モデル / サービス | 英語 | 日本語 | 韓国語 |
|---|---|---|---|
| ElevenLabs(商用) | 0.613 | 0.621 | 0.641 |
| MiniMax-Speech(商用) | 0.756 | 0.754 | 0.774 |
| Qwen3-TTS-12Hz-1.7B-Base | 0.775 ★ | 0.768 | 0.799 ★ |
ストリーミングレイテンシ
| モデル | ファーストパケット遅延 |
|---|---|
| Qwen3-TTS-12Hz-0.6B | 97 ms |
| Qwen3-TTS-12Hz-1.7B | 101 ms |
| Qwen3-TTS-25Hz-1.7B | 150 ms |
まとめ
- Qwen3-TTS は SOTA 水準のオープンソース TTS。ボイスクローンとボイスデザインの 2 軸で高品質な音声生成が可能
- ただし TTS である以上、元話者のアクセント・イントネーションを 100% 保持することは原理的に不可能
- RVC × ChatterBox(ComfyUI TTS-Audio-Suite)を使えば、既存の音声ファイルをそのまま別の声質に変換でき、アクセント・感情・間が完全に保持される
- example_workflows.zip の
Unified Voice Changer - RVC X ChatterBox.jsonがすぐに使えるワークフロー
今後の注目点
- Qwen3-TTS の言語カバレッジ拡張(10 言語 → それ以上)が公式ロードマップに記載
- CosyVoice 3 VC が TTS-Audio-Suite に追加済み(もう一つのゼロショット変換オプション)
- MOSS LoRA による軽量ファインチューニングで特定話者への特化も可能