概要
Zoom会議の文字起こしは便利ですが、多くの方法はクラウドサービスを利用します。
しかし次のような問題があります。
- 機密情報をクラウドに送信したくない
- API利用料がかかる
- ネットワーク遅延がある
この記事では 完全ローカル環境で次のことを実現する方法を紹介します。
- Zoom会議のリアルタイム文字起こし
- 自分の声+相手の声を同時認識
- 画面共有動画(YouTubeなど)も文字起こし
- GPUによる高速音声認識
すべて クラウド未使用で動作します。
できること
この記事の構成では次の音声を同時に文字起こしできます。
自分の声(マイク)
Zoom相手の声
共有動画の音声(YouTubeなど)
処理はすべて ローカルAIで実行されます。
完成イメージ
文字起こし結果は次のように表示されます。
Speaker 1:
今日の会議の目的は新しい分析パイプラインの確認です。
Speaker 2:
了解しました。YouTubeの参考動画を共有します。
リアルタイムで文字が表示されます。
システム構成
今回のシステム構成は次の通りです。
マイク
Zoom
YouTube
│
▼
VB Audio Virtual Cable
│
▼
Transcription Suite
│
▼
リアルタイム文字起こし
Windowsでは
マイク音声
システム音声
が別デバイスになっています。
そのため 仮想オーディオデバイスで音声をミックスします。
使用ソフト
今回使用するソフトウェアです。
- Docker Desktop
- Transcription Suite
- VB-Audio Virtual Cable
動作環境
筆者の環境
OS
Windows 11
GPU
RTX 4060
ASR
faster-whisper-medium
話者分離
pyannote speaker diarization
GPUがあると ほぼリアルタイムで処理できます。
ソフトのインストール
Docker
Microsoft Storeまたは公式サイトからインストールします。
Docker Desktop
Transcription Suite
公式サイトからダウンロードします。
アプリを起動すると DockerコンテナのASRサーバーが起動します。
VB-Audio Virtual Cable
仮想オーディオデバイス。
VB-Audio Virtual Cable
ダウンロード後
VBCABLE_Setup_x64.exe
を 管理者権限で実行します。
インストール後は PCを再起動します。
音声ルーティング
最終構成は次になります。
マイク
│
▼
CABLE Input
▲
│
Zoom / YouTube
│
▼
CABLE Output
│ │
▼ ▼
Transcription ヘッドセット
Suite (Listen)
この構成で
自分
相手
動画
すべての音声が文字起こしされます。
Zoom設定
Zoomのオーディオ設定
入力
物理マイク
出力
CABLE Input
Windows設定
マイク設定
録音デバイス
↓
マイク
↓
プロパティ
↓
聴く
↓
CABLE Input
CABLE Output設定
録音デバイス
↓
CABLE Output
↓
聴く
↓
ヘッドセット
これにより
音を聞きながら文字起こし
が可能になります。
Transcription Suite設定
Audio Configuration
ACTIVE INPUT SOURCE
Microphone
Device
CABLE Output
使用するAIモデル
おすすめ設定
ASR
faster-whisper-medium
話者分離
pyannote speaker diarization
これにより
Speaker 1
Speaker 2
のように話者が分離されます。
パフォーマンス
例
GPU
RTX4060
モデル
faster-whisper-medium
遅延
約2〜3秒
リアルタイム文字起こしとして十分実用レベルです。
注意点
この構成では
自分の声が少し遅れて聞こえる
場合があります。
これは Windows の
Listen(聴く)
機能によるモニタリングです。
ヘッドセット使用であれば問題なく使用できます。
応用
この構成を拡張すると次のことも可能です。
Zoom会議
↓
リアルタイム文字起こし
↓
LLM
↓
自動議事録
↓
要約 / ToDo抽出
ローカルLLMと組み合わせることで AI議事録システムも構築できます。
まとめ
Windows環境でも
完全ローカル
リアルタイム文字起こし
は十分実用レベルで実現できます。
ポイントは
VB-Cableで音声ミックス
GPUでASR高速化
です。
構成図生成プロンプト
記事用の構成図を生成するプロンプトです。
Create a professional technical architecture diagram.
Style:
clean minimal flat design
white background
vector icons
simple arrows
Components:
Microphone
Zoom
YouTube
VB Audio Virtual Cable
Transcription Suite
Headset
Flow:
Microphone → VB Cable Input
Zoom → VB Cable Input
YouTube → VB Cable Input
VB Cable Input → VB Cable Output
VB Cable Output → Transcription Suite
VB Cable Output → Headset
Layout:
top = audio sources
middle = VB Cable
bottom = Transcription Suite
Use labeled arrows showing audio flow.
Make it look like a modern software architecture diagram.
Zennサムネイル生成プロンプト
記事用サムネイル(クリック率UP)
Create a modern tech blog thumbnail.
Theme:
AI speech recognition
Zoom meeting transcription
Style:
dark tech background
neon blue accents
minimal futuristic design
Elements:
microphone icon
speech to text waveform
AI chip symbol
Zoom meeting window
Text:
"Zoom Real-Time Transcription"
"Local AI"
Aspect ratio:
16:9

