ニュース
Microsoftが音声文字起こし新モデル公開、日本語含む60言語に低遅延対応
音声で受け答えするAIエージェントを開発する現場にとって、応答の遅さと対応言語の少なさは長年の制約でした。Microsoftが公開した新しい文字起こしモデルと音声合成モデルは、この2つの壁に挑む内容です。日本語を含む多言語対応と低遅延という組み合わせが、開発チームの選択肢をどう広げるのかを整理します。
何が起きたか
米MicrosoftのAI部門Microsoft AI(MAI)は10月1日(現地時間)、同社初のストリーミング型文字起こしモデル「MAI-Transcribe-2-Streaming」と、音声合成(TTS)モデル「MAI-Voice-2.1」、その高速版「MAI-Voice-2.1-Flash」を発表しました。いずれもMicrosoft Foundryでパブリックプレビューとして提供され、音声で対話する「音声エージェント」の構築を想定したモデル群だといいます[1]。
MAI-Transcribe-2-Streamingは、話している最中に文字起こし結果を逐次返す低遅延モデルです。日本語を含む60言語に対応し、話されている言語を自動で判別するほか、音声の受信から100ミリ秒強で暫定的な認識結果を返します。AI評価機関Artificial Analysisの評価で精度1位になったとしており、料金は年末までの導入価格として音声1時間当たり0.54ドルです[1]。
TTSのMAI-Voice-2.1は23言語に対応し、1つの声のまま言語を切り替えてもネイティブのアクセントで話せるのが特徴です。料金は100万文字当たり22ドルで、高速版のMAI-Voice-2.1-Flashは45秒の音声を150ミリ秒の遅延で生成できます。同等のモデルと比べて約60%安い、100万文字当たり15ドルという価格設定になっています[1]。
2つのVoiceモデルは数秒の参照音声から声を複製する機能も備えますが、利用には審査を経たアクセス承認が必要です。本人の同意を得た声しか合成できない仕組みを組み込んだとしています。既定音声の一覧に日本語は含まれていませんが、提供リージョンには東日本(Japan East)も含まれます[1]。
背景・解説
ストリーミング型の文字起こしとは、音声の録音が終わってからまとめて処理するのではなく、発話の途中から結果を少しずつ返す方式を指します。音声エージェントがユーザーの発話が終わるのを待たずに応答の準備を始められるため、会話のテンポを自然に保ちやすくなる仕組みです。音声合成(TTS)は文字情報を音声に変える技術で、遅延の短さと声の自然さが使い勝手を左右する要素です。
音声AIの分野では各社の発表が相次いでいます。米OpenAIは5月にストリーミング文字起こし向けの「GPT-Realtime-Whisper」を、米Googleは9月に会話を止めずに裏でタスクを実行できる「Gemini 3.8 Live」を発表しました。米Metaも昨年11月に、1600以上の言語に対応する音声認識「Omnilingual ASR」をオープンソースで公開しています[1]。海外メディアの報道では、MAI-Voice-2.1を使った試験で参加した4000人のうち約半数が声を本物の人間だと判断したと伝えられています[2]。
仕事や業務への影響 — AI Topicaの見方
日本語で音声エージェントを開発するチームは、文字起こしと音声合成のモデル選定をいったん見直すべきです。これまで低遅延モデルの日本語対応が限られていた開発現場にとって、60言語対応で100ミリ秒強の応答が得られる選択肢が増えた意味は小さくありません。例えば、コールセンター業務を自動応答に置き換えたい従業員50人規模の保険代理店であれば、顧客が話し終わる前に文字起こしが始まる仕組みは、1件あたりの応答待ち時間を数百ミリ秒単位で縮める効果があります。
価格面の比較も実務上の判断材料になります。音声合成の高速版は100万文字あたり15ドルで、通常版の22ドルより安く設定されているため、問い合わせ対応のように文字量が多いシステムほどコスト差が積み上がります。月間1000万文字規模で応答音声を生成している企業なら、高速版への切り替えで数万円単位の費用差が生まれる計算です。
ただし日本語の既定音声が用意されていない点は、国内向けサービスを検討する担当者が必ず確認すべき条件になります。音声の声質や言い回しを自社ブランドに合わせたい企業は、声の複製機能を使うための審査フローを事前に把握しておく必要があります。情シス担当者は、既存のコールセンターシステムや社内チャットボットとの接続可否を、価格表だけでなく実際の応答テストで確認する段取りを組む必要があります。
不確かな点・注意
Artificial Analysisによる精度1位という評価は、Microsoftの発表に基づく内容であり、第三者による独立した検証結果は出典内に示されていません。料金についても「年末までの導入価格」とされており、来年以降の価格体系は不明です。
MAI Playgroundで公開されているデモ「Chatter」は、日本語で話しかけた内容を認識するものの、応答自体は日本語設定がなく、英語で返す仕様だと報じられています。日本語での音声対話を想定する開発者は、現時点では応答側の言語対応状況を個別に確認する必要があります。
声の複製機能についても、審査基準や承認までの期間といった具体的な運用ルールは出典からは分かりません。導入を検討する企業は、本人同意の取得方法や審査の実務的なハードルについて、自社の利用目的に照らして個別に確認する姿勢が欠かせません。