Grok Voice Transcribe 2.0(グロック・ボイス・トランスクライブ・ツーポイントゼロ)とは
Grok Voice Transcribe 2.0とは、録音ファイルや音声ストリームを文字に変換するSpaceXAIの音声認識モデルです。2026年9月18日に公開され、録音後の一括処理と、通話や字幕向けのリアルタイム処理に対応しています。
公式表記:Grok Voice Transcribe 2.0
API識別子:grok-voice-transcribe-2.0
提供者:SpaceXAI
1.0から何が変わった?
SpaceXAIは社内の実用音声評価で、2.0は1.0の2倍正確になったと発表しています。しかも料金は1.0と同じ。土台は、テスラ車内のGrokアシスタントや1日数万件のカスタマーサポート通話を支えてきた音声モデルで、雑音の多い多言語の実録音で訓練されています。電話回線の音、複数人の会話、アクセント、口頭で伝える番号やメールアドレスといった現実的な条件に強いのはそのためです。Artificial Analysisの公開比較では、発表時点で32のストリーミングモデル中、精度が1位とされました。車内の音声コマンドのような短い発話では、誤り率が20.6%から6.8%へ下がっています(短い発話は言語を判別する手がかりが少なく、もともと苦手な領域です)。
どんな音声処理ができる?
主な機能は、単語ごとの開始・終了時刻と信頼度、話者の区別(追加料金なし)、最大8チャンネルの個別認識と最大100の重要語指定です。重要語は、自社の製品名や専門用語をあらかじめ渡して聞き間違いを減らす仕組み。数値、日付、通貨、電話番号、メールアドレスを読みやすい表記に整え、「あの」「えーと」といった言いよどみを除くこともできます。数十言語を認識し、途中で言語が切り替わる音声も一度に処理。公式ドキュメントの対応言語には日本語も含まれます。
料金と乗り換えの注意点
2026年9月時点の公式料金は、音声1時間あたりバッチが約0.10ドル、ストリーミングが約0.20ドル。話者分離、タイムスタンプ、重要語指定を含む価格です。会議録なら録音後のバッチ、通話支援やライブ字幕ならストリーミングが合います。公式ドキュメントはモデル名を省いたときの既定を2.0としており、既存のSpeech-to-Text API連携はコードを変えずに精度改善を受け取れます。裏返すと、1.0のまま動かし続けたい場合はgrok-voice-transcribe-1.0の明示指定が必要です。SpaceXAIは同じ発表で、1.0を数週間のうちに提供終了すると告知しました。通話録音や顧客の声を送る前に、録音・利用の同意、保存期間、アクセス権限を決めてください。認識結果は原音と照合し、固有名詞や金額は人の最終確認が欠かせません。
Topic「まだ話し終わっていない」をAIが判定する
Grok Voice Transcribe 2.0に関するよくある質問
- 日本語の会議を文字起こしすると、金額や数字はどんな表記で出ますか?
- 言語コードに日本語を指定すると、数値・通貨・単位が書き言葉の表記に整えられます。指定しなくても日本語の音声は文字にできますが、表記の整形は言語指定が前提です。
- バッチとストリーミングはどう使い分けますか?
- 録音済みの会議や動画はバッチ、通話支援、ライブ字幕、音声コマンドはWebSocketのストリーミングが向きます。
- Grok Voice Transcribe 2.0に送れるファイル容量の上限は?
- 公式ドキュメントではファイルあたり500 MBです。長時間の録音は、対応形式、送信時間、リトライ設計も事前に確認します。