0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Qwen3-TTS で声をクローン・設計する+RVC で元のアクセントを保持した声変換【ComfyUI対応】

0
Last updated at Posted at 2026-05-31

Qwen3-TTS で声をクローン・設計する+RVC で元のアクセントを保持した声変換

はじめに

Alibaba Cloud の Qwen チームが 2026 年 1 月に公開した Qwen3-TTS は、オープンソース TTS モデルとして初めて ElevenLabs・MiniMax-Speech といった商用サービスを性能で上回りました(英語 WER 1.24%、話者類似度 0.775)。Apache 2.0 ライセンスでローカル実行が可能です。

この記事では Qwen3-TTS の 2 つの主要機能と、TTS では再現できない「アクセント保持」を解決する RVC ワークフローを解説します。

記事の核心:使い分けの鍵

やりたいこと アプローチ
テキストを特定の声で読ませたい Qwen3-TTS ボイスクローン
ゼロからキャラ声を作りたい Qwen3-TTS ボイスデザイン
既存の録音をそのまま別の声に変えたい RVC × ChatterBox(音声変換)

モデルラインナップ

モデル名 パラメータ 特徴 主なユースケース
Qwen3-TTS-12Hz-1.7B-Base 1.7B 最高品質・SOTA WER ボイスクローン本番用
Qwen3-TTS-12Hz-0.6B-Base 0.6B 軽量・97ms レイテンシ リアルタイム・エッジ
Qwen3-TTS-25Hz-1.7B-Base 1.7B 長文安定性に優れる オーディオブック・長尺
Qwen3-TTS-12Hz-1.7B-VoiceDesign 1.7B 自然言語で声を設計 キャラクター声デザイン
Qwen3-TTS-12Hz-1.7B-CustomVoice 1.7B 9 プリセット+属性編集 感情・トーン調整

1. ボイスクローン:実在する声を忠実に再現する

仕組み

参照音声(ref_audio)とその書き起こし(ref_text)を渡すと、話者の声質を継承した音声を生成します。内部では 2 つの経路でクローニングを実行します。

  • スピーカーエンベディング経由:参照音声をエンコードして話者ベクターを生成し、リアルタイムクローニングに使用
  • In-context Learning 経由:テキスト–音声ペアを文脈として与えることでプロソディ(抑揚・リズム)の保持精度が向上

参照音声の長さと品質の関係

参照音声の長さ 話者類似度(目安) 推奨用途
3 秒 〜0.75 動作確認・プロトタイプ
5〜8 秒 〜0.82 一般コンテンツ制作
10〜15 秒 〜0.89 本番・高品質用途
15 秒以上 横ばい(プラトー) それ以上は効果薄

書き起こし精度が品質を左右する

コミュニティ実測では、参照音声の書き起こし精度を改善すると話者類似度が 0.75 → 0.89 まで向上した事例があります。Whisper 等の ASR で自動書き起こしした後、人手で修正するワークフローが効果的です。

基本的な使い方

from qwen3_tts import Qwen3TTS

tts = Qwen3TTS.from_pretrained("Qwen/Qwen3-TTS-12Hz-1.7B-Base")

audio = tts.generate(
    text="こんにちは。今日もよい一日を。",
    ref_audio="reference_voice.wav",   # 10〜15 秒の参照音声
    ref_text="参照音声の書き起こしテキスト"
)
audio.save("output.wav")

2. ボイスデザイン:テキストでキャラクターの声を設計する

指定できる属性

属性カテゴリ 例
性別・年齢 30代の女性、高齢の男性
声質・音色 ハスキー、クリア、深みのある低音
感情・トーン 温かみのある、権威ある、明るい
話し方スタイル ナレーター調、カジュアル、囁くような
アクセント(概略) British accent、slight Japanese accent
発話速度・ピッチ ゆっくりとした口調、高めのピッチ

アクセント指定は中国語・英語のみサポート。他言語の声を英語で記述することは可能ですが、アクセント再現の精度には限界があります(後述)。

プロンプト例

ナレーター(英語)

"A deep, authoritative male narrator voice with a slight British accent,
speaking at a measured pace with gravitas and warmth."

アニメキャラ系

"Young energetic female voice, high-pitched, cheerful and enthusiastic,
with an anime-like expressive tone."

日本語キャラクター

"おっとりとした中年男性の声。落ち着いた低音で、穏やかで知的な印象を与える話し方。"

プロンプトは 15〜40 語程度の具体的な記述が推奨されます。「female voice」のような単純すぎる記述は品質が落ちます。

ボイスデザイン → クローンへの変換ワークフロー

① VoiceDesign でサンプル生成
        ↓
② create_voice_clone_prompt でクローンプロンプト化
        ↓
③ generate_voice_clone で同じ声を効率的に量産

この流れにより、毎回声設計を再実行せず再利用可能な状態で管理できます。


3. アクセント問題と限界

Qwen3-TTS は強力な TTS ですが、アクセント再現については実用上の制限があります。

確認されているアクセントの制限

  1. 英語発話で中国語訛りが強くなりやすい(特に 0.6B モデル)
  2. British / Australian など特定アクセントはテキスト指定では不安定
  3. 実装変更でクローン済みアクセントが American English に戻るケースあり
  4. 日本語は品質が高いが、技術レポートのベンチマークでは一部言語で MiniMax に劣る

TTS の範囲内での回避策

  • 実際のネイティブスピーカー音声 10〜15 秒をクローン参照音声に使う(テキスト記述より信頼性大)
  • VoiceDesign → クローン変換で声を固定する

根本的解決策 → RVC による音声変換

元話者のアクセント・感情・間を完全に保持したい場合は、TTS ではなく音声変換(Voice Conversion)が本質的な解決策です。


4. RVC × ChatterBox:元のアクセントを保持した声変換

TTS と音声変換の根本的な違い

観点 Qwen3-TTS(TTS) RVC(音声変換)
入力 テキスト 音声ファイル
出力 テキストを別の声で発声 元の発声を別の声質に変換
アクセント保持 限定的(モデル依存) 元音声のまま完全保持
感情・間 指定要(プロンプト) 自動保持
必要なもの テキスト+参照音声 元音声+学習済み RVC モデル

RVC の仕組み

元音声
  │
  ├─→ HuBERT(コンテンツ特徴抽出)
  │
  └─→ RMVPE(F0 ピッチ推定・維持)
            │
            ↓
        RVC モデル(話者特徴のみ変換)
            │
            ↓
        デコーダー → 変換後音声

ポイントは F0(基本周波数 = ピッチ輪郭)を元音声のまま維持すること。これによりアクセントや感情表現がそのまま保たれます。実験でも「元音声と変換後のピッチ輪郭はほぼ一致する」ことが確認されています。

ChatterBox VC との比較

エンジン 必要な準備 品質 アクセント保持 向き不向き
RVC 学習済み .pth モデル 高(学習量依存) 完全保持 特定話者の大量変換
ChatterBox VC 参照音声 数秒のみ 中〜高(ゼロショット) 完全保持 手軽な試作・多様な声
CosyVoice 3 VC 参照音声 数秒のみ 高 完全保持 高品質ゼロショット

5. ComfyUI TTS-Audio-Suite ワークフロー

同梱ワークフロー(音声変換関連)

TTS-Audio-Suite の example_workflows.zip に以下が含まれています。

ファイル 用途
Unified 🔄 Voice Changer - RVC X ChatterBox.json 音声→別声変換(本記事の中心)
Qwen3 integration + ASR.json Qwen3-TTS+自動書き起こし統合
RVC 🎓 Model Training.json RVC モデルのトレーニング
Voice Cleaning - Noise Removal + Voice Fixer.json 音声前処理

ノード接続(最小構成)

[Load Audio]                [Load RVC Model]
  source_audio ──────→ [Voice Changer] ←── rvc_model
                              │
                              ↓
                        [Save Audio / Preview]
                         converted_audio

ChatterBox VC を使う場合(モデル不要)は Load RVC Model の代わりに参照音声を直接 narrator_target に接続するだけです。

パラメータ設定指針

パラメータ 推奨値 注意
TTS_engine RVC or ChatterBox ChatterBox は参照音声を直接接続
refinement_passes 1〜3 5 以上は音質劣化リスク
RVC モデル配置先 ComfyUI/models/RVC/ auto_download: True で自動取得可
FAISS index ComfyUI/models/RVC/.index/ 省略可。あると類似度向上
入力音声品質 WAV 16bit / 24kHz 以上 ノイズは Voice Cleaner で除去推奨

6. ユースケース別ワークフロー選択ガイド

やりたいこと 推奨アプローチ 必要なもの
テキストを特定人物の声で読み上げたい Qwen3-TTS ボイスクローン 参照音声 10〜15 秒+書き起こし
完全オリジナルのキャラ声を作りたい Qwen3-TTS ボイスデザイン テキスト記述プロンプト
既存の録音をそのまま別の声に変えたい RVC × ChatterBox VC 元音声+RVC モデル or 参照音声
アクセント・感情を完全に保ちたい RVC / ChatterBox VC 元音声ファイル
多言語で同じ声を使いたい Qwen3-TTS 多言語クローン 参照音声 1 つで 10 言語対応
リアルタイム声変換(配信など) Qwen3-TTS-12Hz-0.6B(97ms) GPU 環境(RTX 3090 以上推奨)
長時間オーディオブックを生成したい Qwen3-TTS-25Hz-1.7B TTS SRT ワークフロー使用

7. ベンチマーク比較(技術レポートより)

ゼロショットボイスクローン WER(Seed-TTS eval)

WER は低いほど良い。

モデル 中国語 WER 英語 WER
Seed-TTS 1.12% 2.25%
MiniMax-Speech 0.83% 1.65%
Qwen3-TTS-12Hz-0.6B-Base 0.92% 1.32%
Qwen3-TTS-25Hz-1.7B-Base 1.10% 1.49%
Qwen3-TTS-12Hz-1.7B-Base 0.77% 1.24% ★SOTA

話者類似度(コサイン類似度)

モデル / サービス 英語 日本語 韓国語
ElevenLabs(商用) 0.613 0.621 0.641
MiniMax-Speech(商用) 0.756 0.754 0.774
Qwen3-TTS-12Hz-1.7B-Base 0.775 ★ 0.768 0.799 ★

ストリーミングレイテンシ

モデル ファーストパケット遅延
Qwen3-TTS-12Hz-0.6B 97 ms
Qwen3-TTS-12Hz-1.7B 101 ms
Qwen3-TTS-25Hz-1.7B 150 ms

まとめ

  • Qwen3-TTS は SOTA 水準のオープンソース TTS。ボイスクローンとボイスデザインの 2 軸で高品質な音声生成が可能
  • ただし TTS である以上、元話者のアクセント・イントネーションを 100% 保持することは原理的に不可能
  • RVC × ChatterBox(ComfyUI TTS-Audio-Suite)を使えば、既存の音声ファイルをそのまま別の声質に変換でき、アクセント・感情・間が完全に保持される
  • example_workflows.zip の Unified Voice Changer - RVC X ChatterBox.json がすぐに使えるワークフロー

今後の注目点

  • Qwen3-TTS の言語カバレッジ拡張(10 言語 → それ以上)が公式ロードマップに記載
  • CosyVoice 3 VC が TTS-Audio-Suite に追加済み(もう一つのゼロショット変換オプション)
  • MOSS LoRA による軽量ファインチューニングで特定話者への特化も可能

参考リンク

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?