Gemini 3.5 Transcribeとは

Gemini 3.5 Transcribeとは、Googleが提供する、会議や通話などの音声を文章へ変える音声認識モデルです。録音ファイル用とリアルタイム用があり、話された内容を後の業務で使いやすい文字へ整えることに重点を置きます。

Gemini 3.5 Transcribeが会議音声や複数言語を文字起こしし、議事録、字幕、検索に利用する流れを示した図。

英語表記:Gemini 3.5 Transcribe

2026年8月27日時点では、録音済み音声を処理するgemini-3.5-transcribeと、流れてくる音声を低い遅延で処理するgemini-3.5-transcribe-liveが案内されています。85以上の言語を自動で見分け、会話の途中で日本語と英語が切り替わるような音声にも対応する設計です。

どの機能を組み合わせればよい?

録音版では、誰が話したかを分ける話者識別、単語ごとの時刻、専門用語や固有名詞を優先させるカスタム語彙を利用できます。会議検索なら単語の時刻、コールセンターの応対分析なら話者識別など、後工程で必要な情報から逆算して機能を選ぶのが基本。ただし話者識別が扱えるのは最大8人までで、公式ドキュメントは3人以上への割り当てを実験的としています。2人の通話なら頼れても、多人数の会議で発言者を自動で決め切るところまでは期待しすぎない方が安全でしょう。

注意したいのは、全機能を同時には使えないこと。話し言葉の「あの」「ええと」や言い直しを整理するSmart transcriptionは、話者識別や単語時刻と組み合わせられません。単語時刻も認識精度を下げる場合があります。「きれいな議事録の下書き」と「原音を追える記録」は、別の目的です。

音声の長さにも制限があります。公式モデルページでは、録音版は通常1回あたり最大1時間、話者識別か単語時刻を使う場合は最大30分。Live版は1セッション最大10分です。長い会議は、無音区間や議題の切れ目で分割し、境界で言葉が欠けないか確かめます。

文字起こしAIやWhisperとの違い

文字起こしAIは、音声を文字へ変える製品や仕組みの総称です。Whisperも音声認識モデルの一つ。Gemini 3.5 TranscribeはGoogleGemini APIで使う特定モデルで、録音版とLive版を明示的に分け、Smart transcriptionやカスタム語彙を備えています。

一方、Gemini Audioは音声の内容を理解し、質問へ答えたり要点を取り出したりする広いモデル群です。Transcribeの主役は文章化。聞き取った文字と、AIが作った要約や判断を同じ記録として扱わないことが、監査や顧客対応での混乱を減らします。

企業では何に使えるのか?

会議の議事録、動画の字幕、商談や問い合わせの検索、インタビューの分析などが候補です。専門用語が多い業務では、製品名、部署名、略語をカスタム語彙へ入れ、誤認識が減るかを小規模な実音声で比べます。登録は最大1,000語まで可能ですが、公式ドキュメントは100語程度までが最も効果を出しやすいとしており、辞書を厚くするより取り違えの多い語に絞る方が近道です。対応言語数より、自社データでの結果が導入判断に直結するでしょう。

文字起こし後に生成AIで要約する場合も、原音への参照を残します。担当者名、金額、期日、否定表現は、わずかな誤認識でも業務影響が大きい箇所。自動生成された議事録を、そのまま確定記録や顧客への回答へ使わない運用が必要です。

導入前に確認する管理項目

  • 録音の合意:参加者や顧客へ録音・AI処理をどのように知らせるか。
  • データ管理:音声、文字、ログの保存先・期間・削除方法。
  • 精度検証:上記の要注意項目について、どこまで一致すれば合格とするかの線引き。
  • 役割分担:文字起こし、要約、決定事項の確定を別工程として管理する担当。
  • 継続確認モデルAPIの更新後にも同じテスト音声で差分を調べる手順。

Topic「火曜、いや水曜」を水曜だけに整える

Googleの公式ガイドは、話し手が「火曜日に、いや水曜日に会いましょう」と訂正した場面をSmart transcriptionの例にしています。逐語的な記録なら訂正前の「火曜」も残りますが、Smart transcriptionの出力は最終意図の「水曜」です。読みやすさは上がる一方、言い直し自体が重要な取材、法務、監査では情報を落とす可能性があります。用途に応じて、整えるモードと原発言を残すモードを選ぶことが欠かせません。

Gemini 3.5 Transcribeに関するよくある質問

Gemini 3.5 Transcribeは日本語と英語が混ざる会議でも使えますか?
公式は、日本語を含む85以上の言語と、会話途中で言語が切り替わる音声への対応を案内しています。ただし、社名や人名を含む自社の実音声で精度を検証してから運用します。
Gemini 3.5 Flashと同じモデルですか?
同じ名称の系統でも別モデルです。Gemini 3.5 Transcribeには専用のモデルIDがあり、音声から文字を作る用途へ最適化されています。
Smart transcriptionは監査用の逐語録にも向きますか?
必ずしも向きません。言いよどみや自己訂正を整えるのがSmart transcriptionなので、発話過程そのものを残す用途では、既定のverbatim(逐語)モードのまま出力し、原音とあわせて人が照合します。
文字起こし結果から議事録まで自動で確定できますか?
文字化と議事録の確定は分けます。要約や担当者抽出を後段AIへ任せても、金額、期日、固有名詞、否定表現は原音に戻って確認します。

Gemini 3.5 Transcribeに関連する記事