Muse Voice Transcribe(ミューズボイストランスクライブ)とは

Muse Voice Transcribeとは、Metaが2026年9月1日に公開した、音声を聞きながら文字化し、誰が話したかと発話の区切りも判定する実時間音声認識モデルです。音声認識、話者分離、発話の開始・終了判定を一つのストリーミング処理で扱うことが特徴です。

音声が中央のリアルタイム処理を通り、文字化・話者分離・発話区切りの3つの出力へ同時に分かれる概念図。

2026年9月10日時点で、Meta Model API、Meta AI for Mac、Muse Codeで提供中。Muse Spark系のモデルで、音声とテキストを連続的に扱います。

3つの処理はどう連携する?

土台になるのはストリーミングASRです。ASRはAutomatic Speech Recognitionの略で、声を聞き終わる前から順次文字に変える音声認識を指します。音声は80ミリ秒ごとに処理され、モデルは次の音を聞くか、文字を出すかをその都度判断する方式。

話者分離は、文字化した発話を「誰が話したか」で分ける処理です。付くのはAやBといった記号で、同じ記号が別の録音でも同じ人を指す保証はありません。発話の開始・終了判定は、短い間をただの間と見るか、相手の話が終わったと見るかを判断します。土台のASRが共通なので文字と一緒に出せますが、公式ドキュメントでは用途ごとに動作モードを選ぶ形。素早い応答が要る音声AIエージェントには発話区切り、会議録には話者分離が案内されています。

複数言語と長い会話への対応

Metaは、70を超える言語で学習し、初回公開時点でそのうち25言語を広く検証したと説明しています。日本語もこの25言語の一つです。文の途中で日本語から英語へ切り替わるようなコードスイッチングにも対応。商品名や人名をあらかじめ登録し、認識をその語へ寄せる仕組みもあります。これは後から文字列を置換する辞書とは異なり、認識中の候補選びを助けるための入力です。

音声入力は1時間を超える長さ、話者は20人を超える会話に対応するという公式説明。これらの出力に追加の後処理を必須としない点も、公式が挙げる特徴です。ただしこれは音声を流しながら送る経路の話で、録音ファイルをまとめて送る経路には1回10分・32MBの上限があります。1時間の会議録音はそのままでは受け付けられません。「対応する」ことと、騒音、話者の重なり、方言、専門用語を含む自社の音声で必要な正確さが出ることも別です。

文字起こしAIや音声合成との違い

文字起こしAIは利用目的の名前で、音声ファイルを後からまとめて処理する製品も含みます。Muse Voice Transcribeは、音声が流れている最中に文字化と話者判定を進める基盤モデルです。その出力を会議録や顧客応対画面に組み込んで、文字起こしサービスにする関係。

音声合成は入出力が逆です。テキストから声を作るのが音声合成、声からテキストを取り出すのが音声認識という逆の関係。音声AIエージェントでは、音声認識が耳、言語モデルが判断、音声合成が声の役割を担います。

業務へ入れる前に何を測る?

会議録では、文字の誤り率だけでなく、人名、商品名、数値、話者の入れ替わりを別に採点します。注意したいのは、1語ずつの時刻や、認識の確からしさを表すスコアが提供されないと公式ドキュメントに明記されている点です。時刻が付くのは発話のまとまり単位までで、あやしい箇所を機械が拾って人へ回す運用は、この製品だけでは組めません。コールセンターでは通話品質、同時発話、ノイズ、リアルタイム表示の遅れも対象です。公開ベンチマークの順位ではなく、自社の電話と会議を同じ条件で比べます。

録音と文字起こしに必要な同意、個人情報の保存場所と期間、誤認識を修正できる人を決めます。声や会話には機密情報が含まれやすく、正確さの比較だけで提供先を決めるのは不十分。原音と文字のどちらを保存するかも、利用目的ごとに分けてください。修正後のテキストを原音と照合できる期間と、確定後に原音を削除する手順も運用設計の対象になります。

Topic難しい言葉だけ少し待つ適応遅延

文字化は早く出すほど便利ですが、後の音を聞かないと単語を確定できない場合があります。Muse Voice Transcribeは、難しさに応じて単語ごとの待ち時間を変える適応遅延を採用。速さと正確さの間を一律の秒数ではなく、語ごとに調整します。

Muse Voice Transcribeに関するよくある質問

Meta公式ページのマイクデモは音声を保存しますか?
Metaは、公式ページ上のデモでは音声を文字化のために処理するが、保存しないと説明しています。これはデモの説明なので、APIや組み込み先の保存条件まで同じとは限りません。
話者分離は、参加者の実名まで自動で付けますか?
公式の技術説明は、発話を話者A、話者Bのように区別する仕組みを示しています。声だけから実名を確定する保証は示されていないため、名簿との対応は別の工程と考えてください。
Muse Voice Transcribeは外国語を日本語へ翻訳しますか?
公式に説明されている主機能は、複数言語の音声をそのまま文字化し、話者と発話区切りを判定することです。異なる言語への翻訳は、文字化した後の別処理として設計してください。

Muse Voice Transcribeに関連する記事