ElevenLabs发布v4语音模型支持90种语言

IT时代网9月28日消息,ElevenLabs推出v4与v4 Turbo两款新语音模型,带来更强的表现力控制、面向语音智能体的更低延迟,并支持超过90种语言,10秒音频即可完成声音克隆。

v4采用新架构,长文本下的声音一致性更好,朗读时能结合上下文调整语气。上一代引入的行内情感标签在v4中得到扩展,用户可以叠加多个标签,模型会按顺序执行。语言数量从上一代的70种增至90种,日语、巴西葡萄牙语、普通话和粤语的品质提升最明显。

语音智能体场景下,v4可以在大模型开始生成回答的同时就开始合成音频,进一步压缩等待时间,对打断、升级转接和挂起的处理也更自然。ElevenLabs的年化收入今年年初约3.3亿美元,目前已超过6亿美元,企业通话业务占比超过55%,员工总数超过800人。该公司今年2月完成红杉领投的5亿美元融资,估值110亿美元。

编辑:林一舟

THE END