谷歌推出Gemini3.8双TTS模型台词级精细控制
IT时代网9月23日消息,谷歌宣布Gemini家族新增两款文本转语音模型:Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,把语音生成从静态预设升级为可精细调控的创作工具,同步改进Gemini Notebook与Google Vids的使用体验。
两款模型分工不同。Flash TTS面向深度创意与角色设计,可通过自然语言提示从头创建全新语音,在游戏、有声读物、播客与互动媒体中赋予角色生命力,还能对表演提示、节奏与方言转换进行精细控制;Flash-Lite TTS面向大容量、高性价比场景,针对大规模配音、音频内容创作与表现力丰富的语音代理优化,支持音调、节奏与细微表现力调节。
新模型把可用语音从原先的30种扩展到无限语音库,内置2000多种现成语音,覆盖100多种语言和方言,包括墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复制功能仅需30秒音频样本即可重现一致的声音特征,并内置同意验证机制。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。
编辑:林一舟
THE END