NVIDIA Nemotron 3 Diarization(エヌビディア・ネモトロン・スリー・ダイアリゼーション)とは

NVIDIA Nemotron 3 Diarizationとは、録音や会議音声から、誰がいつ話したかを時間ごとに分けるNVIDIAのAIモデルです。2026年9月23日に公開されました。発言内容を書く「文字起こし」と、発言した人を区別する「話者分離」は別の仕事です。このモデルは後者を担当し、話した言葉や実在人物の名前までは単独で確定しません。以下は2026年9月時点の公式情報です。

会議で何を見分ける?

同じ内容の議事録でも、発言者を取り違えると、誰が約束し、誰が反対したかを誤って伝えます。モデルは音声の時間帯ごとに匿名の話者番号を付け、話が重なった部分も対象にします。最大8人までの話者を想定し、録音を後から処理する方法と、会話中に少しずつ処理する方法の両方に対応。前身のStreaming Sortformerは4人までだったので、5人以上が参加する会議にも使えるようになりました。会議の全文を作るには、文字起こしAIの結果と時間を照らし合わせます。

速さと正確さは両立する?

話者を判定する前に、音を少しためる必要があります。NVIDIAの推奨設定は、録音をまとめて処理する向きの30.4秒から、会話中に使う1.04秒・0.64秒・0.32秒までの4段階。ためる時間が短いほど早く結果を出せる代わりに手がかりが減るため、一般に正確さは下がります。NVIDIAは設定ごとに速さと誤りを測っており、公表された待ち時間は音をためる部分で、文字起こしや通信を含む総時間ではありません。実際の会議で遅れと取り違えを一緒に測るのが適切です。

導入時に確かめたい条件

まず、複数人が同時に話す場面や、遠くのマイクで録った会議を試します。NVIDIAの発表によると、外部の比較サイトVoiceArenaの初期結果では、12のシステムの中で誤りの割合が最も低い14.72%(次点は19.3%)でした。ただし対象は英語の会話139件・約22時間で、結果は今後変わりうると断り書きがあります。公開評価には英語・中国語の会議音声が含まれますが、日本語の現場での精度はその数字だけでは分かりません。さらに、匿名の話者番号を社員名へ結び付けるなら、人による確認や会議の参加者情報が必要です。録音データの保管場所、参加者への説明、利用条件も先に決めます。配布されるモデルの重みは商用・非商用のどちらにも使えると明記されていますが、OpenMDW 1.1というライセンス条件に従う形です。

Topic話者の番号は「声が聞こえた順」

モデルが返す「speaker_0」「speaker_1」という番号は、役職順でも座席順でもありません。NVIDIAの説明では、初めて音声に現れた順に番号を割り当てるので、最初に聞こえた声が0番です。会話を細かく区切って処理しても、同じ人に同じ番号を付け続けるための工夫で、会議参加者の実名を当てた結果ではないのです。

NVIDIA Nemotron 3 Diarizationに関するよくある質問

日本語の会議でも同じ精度で使えますか?
モデルカードと発表ブログには、日本語での精度の数値は載っていません。学習には実際の会話約1万時間と、合成した複数人の会話約8万3千時間が使われ、言語は英語・中国語(普通話)・ヒンディー語などと説明されています。日本語の会議に使うなら、自社の録音で発言者の取り違えを数えて確かめるのが確実です。
クラウドへ音声を送らずに試せますか?
試せます。モデルの重みが公開されており、NVIDIA公式の軽量な実行環境「NeMo-Speech.cpp」(Linux・macOS・Windows向け)なら、録音ファイルを1つ指定するコマンドで話者ごとの時間区間を出せます。手元のパソコンで処理すれば、会議音声を社外のサーバーへ送らずに済みます。

あわせて読みたい記事