PR

Gemini 3.8テキスト読み上げ登場:Flash TTSの特徴と違い

AI

Googleは、音声生成モデルの最新版となる「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」を発表しました。従来の固定されたプリセット音声にとどまらず、自然言語プロンプトによる詳細な演出やカスタム音声の作成に対応しています。詳細はGoogle公式ブログで確認できます。

この記事の結論

Googleが発表したGemini 3.8テキスト読み上げモデルは、クリエイティブな表現やキャラクターボイス作成に特化した「Gemini 3.8 Flash TTS」と、高ボリュームかつコスト効率に優れた「Flash-Lite TTS」の2種類です。自然言語プロンプトによるカスタムボイス作成や、音声複製、ライン単位の演出制御に対応しています。

Gemini 3.8 Flash TTSとFlash-Lite TTSの違い

今回の発表では、用途に合わせて使い分けられる2つのモデルが提供されています。

Gemini 3.8 Flash TTSは、深いクリエイティブディレクションやキャラクターデザインに特化しています。ゲームやオーディオブック、ポッドキャスト向けに、自然言語のプロンプトだけでゼロから新しい声を構築できます。Hume AIのVoice Design Benchmarkで1位を獲得するなど、高い表現力を備えています。

一方、Gemini 3.8 Flash-Lite TTSは、大量の吹き替えや音声コンテンツの作成、音声エージェント向けに最適化されており、高ボリュームかつコスト効率のよい処理を実現します。

モデル名主な用途特徴
Gemini 3.8 Flash TTSクリエイティブディレクション自然言語プロンプトによる音声作成
Gemini 3.8 Flash-Lite TTS大量処理・コスト効率高ボリュームの吹き替え・音声エージェント向け
音声生成スタジオのイメージ

カスタムボイスの作成と30秒からの音声複製

Flash TTSモデルでは、30以上の初期音声に加えて、2,000以上のプロダクション対応音声ライブラリを利用できます。

さらに、30秒の音声サンプルがあれば、権利を持つ自分の声や特定の声のプロファイルを再現可能です。ボイス作成時には、音声所有者による同意確認や、SynthIDによる埋め込み型ウォーターマーク、C2PAクレデンシャルといった安全機能が組み込まれています。

音声波形とニューラルネットワークのデータ処理

ライン単位の演出と会話の相槌制御

生成される音声は、単にテキストを読み上げるだけでなく、詳細な演技指導やスクリプトキューの指定が可能です。

  • セリフごとの演技指示(囁き声や落ち着いたトーンなど)
  • 長時間の連続生成における音声の安定性
  • 2人の話者が会話するシーンのネイティブなステージング
  • 笑い声やため息、相槌といった非言語の音声的要素(バックチャネル)の挿入
多言語音声合成ネットワークのイメージ

どこで利用できるのか?対応プラットフォーム

Gemini 3.8の音声生成モデルは、提供されるチャネルやプラットフォームが異なります。

  • Google AI Studio / Gemini API: 両モデルともに開発者向けに公開されており、音声デザインのワークスペースが利用可能です。
  • Gemini Notebook: 一般ユーザー向けにGemini 3.8 Flash TTSが提供されます。
  • Google Vids: Google Vids内でFlash-Lite TTSが利用可能です。
  • 外部デベロッパープラットフォーム: Agora、LiveKit、Pipecat、VercelなどのAPIサービスでもサポートが進められています。
🐕

この記事を書いた人

現場の業務改善担当(AIで自動化) / サイト運営者

工場での生産設備保守や不良原因調査を経験したあと、人事総務・CS(カスタマーサポート)領域で業務改善に関わってきました。現場で「同じ作業に時間を取られすぎる」と感じたことをきっかけに、Pythonや生成AIを使った自動化ツールを作り始めています。
Nexistixでは、AI・自動化・ガジェットのニュースや話題を、個人利用・副業・業務効率化の目線で読み解いています。
休日はバスケをしたり、愛犬のハク(クリーム色の豆柴)とゆっくり過ごすのが楽しみです。


KEEP READING
次に読むなら

この記事と近いテーマで、設定・機材・作業環境の判断材料になる記事です。

AI
スポンサーリンク
シェアする

コメント