音声合成技術は、これまでにない精密化の時代を迎えています。現地時間の9月23日、グーグルはGemini3.8Flash TTSとGemini3.8Flash-Lite TTSという2つの新しいテキストから音声への変換モデルを正式に発表しました。これらのモデルは、開発者やクリエイターが個性豊かなキャラクターボイスや大規模な音声生成において多様なニーズに対応できるようにするものです。

製品の定位と核心機能において、この2つのモデルはそれぞれ異なる特徴を持っています。そのうちの1つであるGemini3.8Flash TTSは、音声とキャラクターのデザインに焦点を当てており、ユーザーが直感的な自然言語の記述によってカスタム音声を作成でき、また文ごとに正確にトーン、速度、アクセントなどの重要な要素を制御できます。さらに、わずか30秒の音声サンプルに基づいて効率的に音声を再現することも可能です。もう1つのモデルであるGemini3.8Flash-Lite TTSは、大規模な音声生成と効率的なボイシングのシナリオに注力しています。

エコシステムおよび多言語サポートに関して、グーグルはこの2つの新しいモデルが100種類以上の言語と方言を完全にサポートしており、出荷時に2000種類以上の既成の音声を提供していることを明らかにしました。これにより、世界中で音声アプリケーションの開発やコンテンツ制作に強力な下地となる計算能力が提供されます。