ニュース

グーグル、自然な音声生成AIモデル「Gemini 3.8 Flash TTS/Flash-Lite TTS」発表

 米グーグルは現地時間23日、音声を生成するAIモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。Gemini Notebook(旧NotebookLM)やGoogle Vids、Google AI Studioなどで順次展開されている。

ゼロから声を作る「Flash TTS」とコスト効率に優れた「Flash-Lite TTS」

 「Gemini 3.8 Flash TTS」は、キャラクターデザインやクリエイティブな用途に向けたモデル。自然言語のプロンプトで役割やアクセントを指定し、ゼロから独自の音声を生成できる。

 100以上の言語や方言に対応し、2000種類を超える実用レベルの音声ライブラリを備える。自身の声、または利用権を持つ声のわずか30秒の音声サンプルから、声の特徴を複製する機能も搭載する。

 もう一つの「Gemini 3.8 Flash-Lite TTS」は、大量の音声生成やコスト効率を重視したモデル。自然なトーンやペースを維持しつつ、大規模な音声吹き替えやエージェント機能などに適している。

表現の調整

 両モデルで、スクリプトの行ごとに表現の指示を出せる。落ち着いたトーンから緊張感のあるささやき声まで、文脈に合わせた表現に対応する。

 2人の話者が交互に話す対話シーンも生成でき、笑い声やため息といった非言語的なリアクションを組み込むことも可能。長時間の生成においても音質や話者の特徴が変化しにくく、ポッドキャストなどのコンテンツ制作に活用できる。

安全性の確保

 音声の複製を利用する際は、参照する話者と一致する口頭での同意録音が必須。生成されたすべての音声には電子透かし「SynthID」が埋め込まれる仕様で、偽情報対策が施されている。

提供対象

 両モデルは順次展開されており、Google AI StudioやGemini APIで利用可能。また、Gemini NotebookではGemini 3.8 Flash TTSが、Google VidsではGemini 3.8 Flash-Lite TTSが提供される。

 企業向けのGemini Enterpriseでは近日中にAPI経由で提供予定。なお、Google AI Studioの音声複製機能は、米イリノイ州やテキサス州のほか、欧州経済領域(EEA)、英国、スイス、インドでは利用できない。