0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

【2026】WindowsでZoom会議をリアルタイム文字起こしする(完全ローカルAI / Transcription SUITE / Whisper / GPU)

0
Posted at

Create_a_modern_tech_blog_thumbnailthemeai_speech__delpmaspu-jp.png

概要

Zoom会議の文字起こしは便利ですが、多くの方法はクラウドサービスを利用します。

しかし次のような問題があります。

  • 機密情報をクラウドに送信したくない
  • API利用料がかかる
  • ネットワーク遅延がある

この記事では 完全ローカル環境で次のことを実現する方法を紹介します。

  • Zoom会議のリアルタイム文字起こし
  • 自分の声+相手の声を同時認識
  • 画面共有動画(YouTubeなど)も文字起こし
  • GPUによる高速音声認識

すべて クラウド未使用で動作します。


できること

この記事の構成では次の音声を同時に文字起こしできます。

自分の声(マイク)
Zoom相手の声
共有動画の音声(YouTubeなど)

処理はすべて ローカルAIで実行されます。


完成イメージ

文字起こし結果は次のように表示されます。

Speaker 1:
今日の会議の目的は新しい分析パイプラインの確認です。

Speaker 2:
了解しました。YouTubeの参考動画を共有します。

リアルタイムで文字が表示されます。


システム構成

今回のシステム構成は次の通りです。

Create_a_professional_technical_architecture_diagr_delpmaspu.png

マイク
Zoom
YouTube
   │
   ▼
VB Audio Virtual Cable
   │
   ▼
Transcription Suite
   │
   ▼
リアルタイム文字起こし

Windowsでは

マイク音声
システム音声

が別デバイスになっています。

そのため 仮想オーディオデバイスで音声をミックスします。


使用ソフト

今回使用するソフトウェアです。

  • Docker Desktop
  • Transcription Suite
  • VB-Audio Virtual Cable

動作環境

筆者の環境

OS
Windows 11

GPU
RTX 4060

ASR
faster-whisper-medium

話者分離
pyannote speaker diarization

GPUがあると ほぼリアルタイムで処理できます。


ソフトのインストール

Docker

Microsoft Storeまたは公式サイトからインストールします。

Docker Desktop


Transcription Suite

公式サイトからダウンロードします。

アプリを起動すると DockerコンテナのASRサーバーが起動します。


VB-Audio Virtual Cable

仮想オーディオデバイス。

VB-Audio Virtual Cable

ダウンロード後

VBCABLE_Setup_x64.exe

管理者権限で実行します。

インストール後は PCを再起動します。


音声ルーティング

最終構成は次になります。

        マイク
          │
          ▼
      CABLE Input
          ▲
          │
    Zoom / YouTube
          │
          ▼
      CABLE Output
       │        │
       ▼        ▼
Transcription  ヘッドセット
Suite           (Listen)

この構成で

自分
相手
動画

すべての音声が文字起こしされます。


Zoom設定

Zoomのオーディオ設定

入力

物理マイク

出力

CABLE Input

Windows設定

マイク設定

録音デバイス
↓
マイク
↓
プロパティ
↓
聴く
↓
CABLE Input

CABLE Output設定

録音デバイス
↓
CABLE Output
↓
聴く
↓
ヘッドセット

これにより

音を聞きながら文字起こし

が可能になります。


Transcription Suite設定

Audio Configuration

ACTIVE INPUT SOURCE
Microphone

Device

CABLE Output

使用するAIモデル

おすすめ設定

ASR

faster-whisper-medium

話者分離

pyannote speaker diarization

これにより

Speaker 1
Speaker 2

のように話者が分離されます。


パフォーマンス

GPU
RTX4060

モデル
faster-whisper-medium

遅延
約2〜3秒

リアルタイム文字起こしとして十分実用レベルです。


注意点

この構成では

自分の声が少し遅れて聞こえる

場合があります。

これは Windows の

Listen(聴く)

機能によるモニタリングです。

ヘッドセット使用であれば問題なく使用できます。


応用

この構成を拡張すると次のことも可能です。

Zoom会議
↓
リアルタイム文字起こし
↓
LLM
↓
自動議事録
↓
要約 / ToDo抽出

ローカルLLMと組み合わせることで AI議事録システムも構築できます。


まとめ

Windows環境でも

完全ローカル
リアルタイム文字起こし

は十分実用レベルで実現できます。

ポイントは

VB-Cableで音声ミックス
GPUでASR高速化

です。


構成図生成プロンプト

記事用の構成図を生成するプロンプトです。

Create a professional technical architecture diagram.

Style:
clean minimal flat design
white background
vector icons
simple arrows

Components:
Microphone
Zoom
YouTube
VB Audio Virtual Cable
Transcription Suite
Headset

Flow:
Microphone → VB Cable Input
Zoom → VB Cable Input
YouTube → VB Cable Input
VB Cable Input → VB Cable Output
VB Cable Output → Transcription Suite
VB Cable Output → Headset

Layout:
top = audio sources
middle = VB Cable
bottom = Transcription Suite

Use labeled arrows showing audio flow.
Make it look like a modern software architecture diagram.

Zennサムネイル生成プロンプト

記事用サムネイル(クリック率UP)

Create a modern tech blog thumbnail.

Theme:
AI speech recognition
Zoom meeting transcription

Style:
dark tech background
neon blue accents
minimal futuristic design

Elements:
microphone icon
speech to text waveform
AI chip symbol
Zoom meeting window

Text:
"Zoom Real-Time Transcription"
"Local AI"

Aspect ratio:
16:9
0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?