Gemini 3.5 TranscribeのMac日本語対応【APIと英語版アプリの違いを比較】
Macに録音を渡して、日本語の会議録づくりを始められる選択肢が増えました。
ただし、使う入口はMacアプリではなくAPIです。
英語限定の機能と取り違えず、まず短い音声から試してみませんか?
Gemini 3.5 Transcribe(ジェミニ3.5トランスクライブ)のAPIは、日本語の音声文字起こしに対応しています。Macから録音ファイルを送る使い方も可能です。
ただし、Gemini for Macの音声入力機能「Speak to Window」は、2026年8月29日時点で英語限定です。
APIの日本語対応とMacアプリの言語対応は別なので、入口を取り違えないようにしましょう。
Gemini 3.5 Transcribeは日本語対応、Macアプリは英語限定
Gemini 3.5 Transcribeで日本語を扱えるかという問いには、APIなら対応、MacアプリのSpeak to Windowは未対応と答えるのが正確です。
要点「Macで使う」と「Macアプリで使う」は違う
MacからGemini APIへ日本語音声を送ることはできます。一方、Fnキー長押しで入力欄へ話すMacアプリ機能は英語限定です。
Googleの対応言語一覧には日本語ロケール「ja-JP」が掲載されています。
Macアプリ側の日本語展開を追いたい場合は、Gemini for Macの日本語対応時期を分けて確認しておきましょう。
出典: Google AI for Developers「Gemini 3.5 Transcribe」(英語)
Gemini 3.5 Transcribe APIでできる日本語文字起こし
Gemini 3.5 Transcribe APIは、音声を文字へ変えるだけでなく、会議録やインタビューの後処理を減らす機能を備えています。
- 言語自動識別: 日本語を含む85を超えるロケールに対応
- Smart mode: 句読点や固有表現を整え、明らかな言い直しを調整
- Verbatim mode: 逐語性を優先して音声を記録
- 語彙指定: 社名や製品名などを事前に渡して認識を補助
会議の正式記録にはSmart modeだけでなく、原音とVerbatim modeの結果も残すと安心です。
AIが整えた文章を、そのまま決定事項として確定しない運用にします。
日本語対応と、日本語で常に高精度であることは同じ意味ではありません。業界用語や社名を含む自社音声で、誤変換の傾向を確かめます。
提供段階には公式ページ間で表現差があります。2026年8月26日のAPIリリースノートはGAと記載する一方、同日の発表ブログではpublic previewという説明です。
利用中のプロジェクトへ対象モデルが表示されるかを確認してください。
出典: Google AI for Developers「Gemini API release notes」(英語)
出典: Google公式ブログ「Gemini 3.5 Transcribe」(英語)
Gemini for Macの英語版アプリとの違い
Gemini for MacのSpeak to Windowは、文字起こしファイルを作るAPIではなく、現在開いている入力欄へ声で文章を入れる機能です。
英語限定
日本語対応
Macアプリの要件はmacOS Sequoia 15以降、RAM 8GB以上、約200MBの空き容量です。ただし段階展開のため、要件を満たしても機能がまだ表示されない場合があります。
注意画面の文脈が共有される場合がある
Speak to Windowでは、現在のウィンドウの文脈や選択テキストがGeminiへ送られる場合があります。顧客情報や未公開資料を開いたまま使わないルールを先に決めてください。
Mac標準の音声入力とどちらを使うか迷う場合は、Gemini for MacとMac標準音声入力の違いも確認すると、英語対応や画面理解の差を整理できます。
出典: Google Gemini Apps Help「Use the Gemini app for Mac」(英語)
Gemini 3.5 Transcribe APIはファイルとライブのどちら?
Gemini 3.5 Transcribe APIは、既存録音を処理するファイル用と、その場で文字を返すライブ用に分かれます。
ファイル用モデルはgemini-3.5-transcribe、ライブ用はgemini-3.5-transcribe-liveです。
ファイル用とライブ用の仕様比較
| 比較軸 | ファイル用 | ライブ用 |
|---|---|---|
| 時間上限 | 通常1時間 | 10分 |
| 話者分離 | 対応 | 非対応 |
| 単語時刻 | 対応 | 非対応 |
| 向く用途 | 会議録 | 短い字幕 |
ファイル用は通常1回1時間までですが、話者分離または単語単位タイムスタンプを使う場合は30分までです。
ライブ用は1セッション10分で、話者分離と単語単位タイムスタンプには対応しません。
ファイル用の話者分離は最大8人に対応しますが、3人以上の分離は実験的機能です。発言者の氏名と区切りは原音で見直します。
会議録ならファイル用、短いリアルタイム字幕ならライブ用と分けると選びやすくなります。音声入力の業務を先に決めたい場合は、音声入力を仕事で試す3業務にも目を通しておきましょう。
Macで日本語文字起こしを試す3段階
MacでGemini 3.5 Transcribeの日本語文字起こしを試すなら、精度、方式、データ条件の順で小さく確かめます。
- 1〜3分の公開可能な日本語音声で固有名詞と句読点を確認する
- 会議録ならファイル用、短い字幕ならライブ用を選ぶ
- 保存先、アクセス権、削除期限、承認者を決めてから社内音声へ広げる
Googleの料金表では、無料枠のコンテンツは製品改善に使われる場合があり、有料枠は使われないと記載されています。
無料枠へ機密性の高い会議音声をいきなり送らないようにしてください。
社内展開では、音声入力を社員が使いやすくする進め方と、Geminiのデータ保管場所も併せて確認すると、操作だけでなく運用条件まで揃えられます。
出典: Google AI for Developers「Gemini API pricing」(英語)
Gemini 3.5 TranscribeのMac・日本語対応でよくある質問
APIとMacアプリを分けて答えると、日本語対応の範囲が見えやすくなります。
QGemini 3.5 Transcribeは日本語に対応していますか?
AGemini 3.5 Transcribe APIは日本語ロケール「ja-JP」に対応しています。
QGemini for Macでも日本語の音声入力を使えますか?
AGemini for MacのSpeak to Windowは2026年8月29日時点で英語限定です。日本語音声はAPI経由で文字起こしできます。
QMacアプリとGemini 3.5 Transcribe APIは同じものですか?
AMacアプリは入力欄へ声で文章を入れる機能で、Gemini 3.5 Transcribe APIは録音やライブ音声を文字へ変える開発者向け機能です。
Q会議録にはファイル用とライブ用のどちらが向きますか?
A会議録には話者分離と単語単位タイムスタンプに対応するファイル用が向きます。ライブ用は短いリアルタイム字幕向けです。
QGemini 3.5 Transcribeは話者を分けられますか?
Aファイル用のGemini 3.5 Transcribeは最大8人の話者分離に対応しますが、3人以上は実験的機能です。ライブ用は対応しません。
QGemini for Macの日本語対応はいつですか?
AGemini for Macの日本語対応日は2026年8月29日時点で発表されていません。Google公式ヘルプの対応言語を確認してください。
まとめ
Gemini 3.5 TranscribeのMac日本語対応とは、MacアプリではなくAPIを使って日本語音声を文字へ変える選択肢です。
会議録はファイル用、短い字幕はライブ用を基本にし、MacアプリのSpeak to Windowは日本語対応の公式発表を待ちます。
最初は公開可能な短い音声で精度を確かめ、社内音声へ広げる前にデータ条件と人の確認手順を決めてください。
次へ1〜3分の音声で入口を確かめる
公開しても問題のない日本語音声を用意し、ファイル用APIで固有名詞、句読点、話者の区切りを確認してから業務利用を判断します。