人とAIが音声で話すとき、気になるのは賢さだけではありません。
こちらが話し終えてから、AIが文字起こしを確定し、考え、ツールを呼び、返事を作る。小さな待ち時間が何段も重なると、会話は急に「機械とのやり取り」らしくなります。
Microsoft AIは2026年10月1日、リアルタイム文字起こしモデル MAI-Transcribe-2-Streaming と、音声生成モデル MAI-Voice-2.1 / MAI-Voice-2.1-Flash を発表しました。
今回の本質は、音声の入口と出口を同時に速くしたことです。文字起こしが途中結果を返すため、エージェントは発話が完全に確定する前から、意図の検討やツール準備を始められます。
何が変わったのか
MAI-Transcribe-2-Streamingは、音声を受け取りながら「暫定の文字列」を返し、あとから安定した確定結果へ更新します。Microsoftは、最初の部分結果が音声受信後およそ100ミリ秒強で出始めると説明しています。
これは「返事が100ミリ秒で完成する」という意味ではありません。文字起こしの一部が早く見えるため、後段の推論やツール準備を重ねられる、という話です。
従来型は、発話終了を待ってから文字起こし・推論・音声生成へ進みます。新しい構成では、途中結果を受けながら「予約変更かもしれない」「顧客情報が必要かもしれない」と準備できます。
ただし、途中結果は修正されます。たとえば「キャンセル……ではなく日程変更」と続く会話で、早すぎるツール実行は危険です。速く考え始めることと、確定前に取り消せない操作を実行することは分ける必要があります。
3つのモデルの役割
今回の3モデルは、音声エージェントの「耳」と「口」を分担します。
- MAI-Transcribe-2-Streaming:60言語のリアルタイム文字起こし。連続的な言語検出に対応。
- MAI-Voice-2.1:23言語・26ロケールの音声生成。同じ声質で複数言語を話せる構成。
- MAI-Voice-2.1-Flash:応答速度を重視した音声生成。Microsoftは45秒分の音声を150ミリ秒のエンドツーエンド遅延で生成するとしています。
料金はMicrosoft AIの発表時点で、Streaming文字起こしが年末まで 1時間あたり0.54ドル、Voice 2.1が 100万文字あたり22ドル、Voice 2.1 Flashが 100万文字あたり15ドル とされています。Azureの価格は地域・契約・表示通貨で変わるため、導入判断では実際のテナント表示を確認する必要があります。
どこまで確認できたか
Microsoftは、MAI-Transcribe-2-StreamingがArtificial Analysisのストリーミング音声認識評価で、確定結果・途中結果とも精度1位になったと発表しています。また社内評価では「最も近い競合より単語表示が2倍速い」と主張しています。
ここは境界を分けて読みます。
公式カタログとMicrosoft Learnで確認できるのは、60言語対応、途中・確定結果、Realtime APIとAzure Speech SDK、そして現在はパブリックプレビューであることです。プレビューにはSLAがなく、Microsoftも本番ワークロードを推奨していません。
一方、「2倍速い」「Voice Flashは55%高速・約60%安い」はMicrosoftの比較主張です。比較条件や対象モデルが公開情報だけでは十分に揃わないため、独立検証済みの一般事実としては扱えません。
Artificial Analysisは第三者ベンチですが、今回こちらで直接確認できた詳細結果はMicrosoftによる引用範囲までです。ランキングは参考になっても、日本語、固有名詞、雑音、複数話者など自分の現場で同じ精度になる保証ではありません。
MORIの制作・業務にどうつながるか
面白いのは、単なる音声チャットよりも「聞きながら仕事を進める」使い方です。
- 取材や打ち合わせで、発話中から要点候補・出典候補を整理する
- 商品相談で、要望を聞きながら必要資料や確認項目を準備する
- 多言語コンテンツで、声の一貫性を保ちながら複数言語へ展開する
- 音声エージェントがツールを呼ぶ前に、途中結果と確定結果を二段階で検証する
MORIにとって重要なのは、待ち時間の短さそのものより、人が話している時間とAIの準備時間を重ねられることです。記事制作、相談対応、調査補助など、会話の次に必ず別作業が続く場面ほど効きます。
ただし、音声クローンは数秒の参照音声で可能とされています。Microsoftは同意ガードレールを組み込んだと説明していますが、本人同意、利用目的、保存、再利用のルールは運用側にも残ります。
まとめ
Microsoftの新しい音声モデル群は、音声エージェントの「聞く・考える・話す」を重ね、待ち時間を縮める方向をはっきり示しました。
特に注目したいのは、発話途中の文字列を使って推論やツール準備を始められる点です。一方で、途中結果は変わるため、不可逆な操作は確定結果や追加確認を待つ設計が欠かせません。
現時点ではパブリックプレビューです。速さの主張は魅力的ですが、実運用では日本語・固有名詞・雑音・誤作動時の取り消しまで含めた評価が必要です。



