Google、声を設計できるGemini 3.8 TTS公開

声の設計と演出

自然言語で声を新規設計
100超の言語・方言対応
一行ごとの演技制御

量産と品質

2,000超の即用可能な声
長時間でも話者ぶれ抑制
Flash-Liteで大量生成

権利保護と提供先

30秒音声から声を複製
SynthIDで生成音を識別
詳細を読む

Googleは2026年9月23日、自然言語で声を設計できる「Gemini 3.8 Flash TTS」と、大量処理向けの「Gemini 3.8 Flash-Lite TTS」を公開しました。開発者は同日からGemini APIとGoogle AI Studioで利用でき、個人向けには前者をGemini Notebook、後者をGoogle Vidsへ展開します。

Flash TTSは役割やアクセント、声質をプロンプトで指定し、100を超える言語・方言で新しい声を作れます。2,000種類以上の既成音声も提供し、ゲーム、ポッドキャスト、オーディオブック、対話型メディアでの人物設計を支えます。

両モデルは台本の一行ごとに演技、速度、方言、相づちを制御し、単一の台本から二人の会話も生成します。長時間の音声でも声質と自然な間合いを維持し、話者のぶれを抑える設計です。

30秒の音声サンプルから声を複製できますが、参照話者と一致する声の所有者による同意録音が必要です。声の複製には同意確認、SynthIDの透かし、C2PA資格情報を組み合わせ、権利保護と生成音声の透明性を高めます。

Googleによると、Flash TTSはHume AIのVoice Design Benchmarkで総合71.4を記録し、首位でした。FlashとFlash-Liteは総合品質指数でそれぞれ1位と2位となり、日本語を含む主要言語のVoice Arena評価でも上位に入りました。

Flash-Liteは大量の吹き替えや音声コンテンツ、音声エージェント向けにコスト効率を重視します。企業向けGemini Enterprise APIは近日提供予定で、FigmaやHeyGenなどが多言語化や対話エージェントへの統合を進めています。