谷歌推出Gemini 3.8语音合成模型
IT时代网9月27日消息,谷歌在Gemini家族中加入了两个新的文本转语音模型——Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS,官方称这是到目前为止表现力最强的音频生成模型。
两个模型已经在Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook以及Google Vids中开放使用。按照官方说法,语音生成不再是一组固定的预设音色,而像一个可以自由调配的创作台,还能设定口音与情绪基调,用来制作有声书、游戏角色配音或播客。
在声音数量上,模型把此前30种原始音色扩展成可持续扩充的声音库,既能为一个全新的角色生成专属声音,也能让某个品牌代言音色保持一致。官方同时提供了墨尔本DJ风格、单薄平直的机器人音色以及日语巨龙等示例,展示合成效果。
负责任使用也被一并写入。官方称新模型搭配了相应的安全机制,以降低语音克隆与滥用的风险。
这次发布延续了Gemini Audio系列的扩充节奏,此前该系列已经先后推出3.5 Live Translate、3.5 Transcribe、3.8 Live以及3.8 Live Extended Thinking。

编辑:林一舟
THE END