Google、声を設計できるGemini 3.8 TTS公開
声の設計と演出
量産と品質
詳細を読む
Googleは2026年9月23日、自然言語で声を設計できる「Gemini 3.8 Flash TTS」と、大量処理向けの「Gemini 3.8 Flash-Lite TTS」を公開しました。開発者は同日からGemini APIとGoogle AI Studioで利用でき、個人向けには前者をGemini Notebook、後者をGoogle Vidsへ展開します。
Flash TTSは役割やアクセント、声質をプロンプトで指定し、100を超える言語・方言で新しい声を作れます。2,000種類以上の既成音声も提供し、ゲーム、ポッドキャスト、オーディオブック、対話型メディアでの人物設計を支えます。
両モデルは台本の一行ごとに演技、速度、方言、相づちを制御し、単一の台本から二人の会話も生成します。長時間の音声でも声質と自然な間合いを維持し、話者のぶれを抑える設計です。
30秒の音声サンプルから声を複製できますが、参照話者と一致する声の所有者による同意録音が必要です。声の複製には同意確認、SynthIDの透かし、C2PA資格情報を組み合わせ、権利保護と生成音声の透明性を高めます。
Googleによると、Flash TTSはHume AIのVoice Design Benchmarkで総合71.4を記録し、首位でした。FlashとFlash-Liteは総合品質指数でそれぞれ1位と2位となり、日本語を含む主要言語のVoice Arena評価でも上位に入りました。
Flash-Liteは大量の吹き替えや音声コンテンツ、音声エージェント向けにコスト効率を重視します。企業向けGemini Enterprise APIは近日提供予定で、FigmaやHeyGenなどが多言語化や対話エージェントへの統合を進めています。