語音合成技術正在迎來前所未有的精細化時代。當地時間9月23日,谷歌正式宣佈推出 Gemini3.8Flash TTS 和 Gemini3.8Flash-Lite TTS 兩款全新的文本轉語音模型,全面滿足開發者和創作者在個性化角色配音以及大規模音頻生成上的多元需求。
在產品定位與核心功能上,兩款模型各有側重。其中,Gemini3.8Flash TTS 主要面向聲音和角色設計,支持用戶通過直觀的自然語言描述來創建定製化聲音,並能夠逐句精準控制語氣、語速以及口音等核心要素。此外,該模型還支持基於短短30秒的音頻樣本進行高效的聲音復刻。而另一款 Gemini3.8Flash-Lite TTS 則專注於大規模音頻生成和高效配音場景。
在生態與多語言支持方面,谷歌官方表示,這兩款全新模型全面支持超過100種語言和方言,並且開箱即用地產出了2000多種現成聲音,爲全球範圍內的語音應用開發與內容創作提供了強有力的底層算力支撐。
VIP會員