Googleは、音声生成モデルの最新版となる「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」を発表しました。従来の固定されたプリセット音声にとどまらず、自然言語プロンプトによる詳細な演出やカスタム音声の作成に対応しています。詳細はGoogle公式ブログで確認できます。
この記事の結論
Googleが発表したGemini 3.8テキスト読み上げモデルは、クリエイティブな表現やキャラクターボイス作成に特化した「Gemini 3.8 Flash TTS」と、高ボリュームかつコスト効率に優れた「Flash-Lite TTS」の2種類です。自然言語プロンプトによるカスタムボイス作成や、音声複製、ライン単位の演出制御に対応しています。
Gemini 3.8 Flash TTSとFlash-Lite TTSの違い
今回の発表では、用途に合わせて使い分けられる2つのモデルが提供されています。
Gemini 3.8 Flash TTSは、深いクリエイティブディレクションやキャラクターデザインに特化しています。ゲームやオーディオブック、ポッドキャスト向けに、自然言語のプロンプトだけでゼロから新しい声を構築できます。Hume AIのVoice Design Benchmarkで1位を獲得するなど、高い表現力を備えています。
一方、Gemini 3.8 Flash-Lite TTSは、大量の吹き替えや音声コンテンツの作成、音声エージェント向けに最適化されており、高ボリュームかつコスト効率のよい処理を実現します。
| モデル名 | 主な用途 | 特徴 |
|---|---|---|
| Gemini 3.8 Flash TTS | クリエイティブディレクション | 自然言語プロンプトによる音声作成 |
| Gemini 3.8 Flash-Lite TTS | 大量処理・コスト効率 | 高ボリュームの吹き替え・音声エージェント向け |

カスタムボイスの作成と30秒からの音声複製
Flash TTSモデルでは、30以上の初期音声に加えて、2,000以上のプロダクション対応音声ライブラリを利用できます。
さらに、30秒の音声サンプルがあれば、権利を持つ自分の声や特定の声のプロファイルを再現可能です。ボイス作成時には、音声所有者による同意確認や、SynthIDによる埋め込み型ウォーターマーク、C2PAクレデンシャルといった安全機能が組み込まれています。

ライン単位の演出と会話の相槌制御
生成される音声は、単にテキストを読み上げるだけでなく、詳細な演技指導やスクリプトキューの指定が可能です。
- セリフごとの演技指示(囁き声や落ち着いたトーンなど)
- 長時間の連続生成における音声の安定性
- 2人の話者が会話するシーンのネイティブなステージング
- 笑い声やため息、相槌といった非言語の音声的要素(バックチャネル)の挿入

どこで利用できるのか?対応プラットフォーム
Gemini 3.8の音声生成モデルは、提供されるチャネルやプラットフォームが異なります。
- Google AI Studio / Gemini API: 両モデルともに開発者向けに公開されており、音声デザインのワークスペースが利用可能です。
- Gemini Notebook: 一般ユーザー向けにGemini 3.8 Flash TTSが提供されます。
- Google Vids: Google Vids内でFlash-Lite TTSが利用可能です。
- 外部デベロッパープラットフォーム: Agora、LiveKit、Pipecat、VercelなどのAPIサービスでもサポートが進められています。
あわせて読みたい関連記事
おすすめ Google Pixel 11登場:ハードウェア微増でGeminiがスマホを変える?
Gemini 3.8のテキスト読み上げ機能やFlash TTSの特徴を解説する本記事に対し、GoogleのGeminiモデルの展開やエコシステムにおける位置づけを把握するうえで参考になるため。



コメント