Gemini 3.8 Flash TTS(ジェミニ・スリーポイントエイト・フラッシュ・ティーティーエス)とは
Gemini 3.8 Flash TTSとは、文章から表現豊かな音声を作るGoogleの生成AIのモデルです。台本の言葉を読み上げるだけでなく、話す速さ、感情、なまり、複数人の掛け合いを指示できます。音声を聞き取って文字にするモデルではなく、文字から声を作る音声合成のモデルです。2026年9月時点の公式情報に基づきます。
どんな音声制作に向く?
Googleは2026年9月22日にAPIで一般提供を始めました。公式モデル資料は、朗読や音声作品、複数人の会話、難しい発音や地域ごとのアクセントを重視する用途を挙げています。たとえば研修動画で説明役と質問役を分け、台本の行ごとに話し方を変えるような制作に向きます。対応言語は130で、日本語も含まれます(兄弟モデルのFlash-Lite TTSは101言語)。
声を作る機能と、文章の内容を確かめる機能は別です。社名や人名の読み、数字、法的な表現を含む音声は、公開前には原稿と実際の出力を聞き比べたいところ。字幕も併せて確認すれば、伝達ミスを減らせるでしょう。なお1回に渡せる原稿には上限(8,192トークン=文章を細かく区切った数)があります。長編の朗読は、章や節に分けて作る前提で段取りを組みます。
Flash-LiteやLiveとは何が違う?
同時に登場したGemini 3.8 Flash-Lite TTSは、大量制作の速さと費用を重視する兄弟モデルです。本モデルはその逆で、声の演技、地域ごとの話し方、長い掛け合いでも調子が崩れないことを優先します。両者は同じAPIの形を使うため、質を重視する素材と量を重視する素材で切り替えられるのが利点。
一方、Gemini Live APIは相手の発話に反応しながら会話を進めるための仕組みです。TTSは決まった台本を狙った声で読ませる仕事に適しています。電話応対の設計なら、声の美しさだけでなく、相手の発話を聞き取る遅延や会話の中断への対応も比べましょう。
Topic30秒で声を再現できる。ただし本人の同意の録音が要る
Gemini 3.8 Flash TTSに関するよくある質問
- Gemini 3.8 Flash TTSで日本語の音声も作れますか?
- 公式の対応言語一覧に日本語が含まれます。ただし、人名や商品名の読み方と自然さは台本や声の設定で変わるため、公開前に日本語話者が試聴してください。
- 作った声を広告に使う際、まず確認することは?
- 台本、音声の権利、声の元になった人の同意を確認します。Googleの同意確認や識別技術は支援策ですが、案件ごとの契約や表示義務を自動で判断するものではありません。