千问发布Qwen-Audio-3.1语音大模型 全线降价最高95%

IT时代网9月23日消息,千问今日发布Qwen-Audio-3.1系列语音大模型,一次性推出五款模型,覆盖理解、生成、交互、创作的完整音频能力栈,同时宣布全线语音模型降价:TTS降价约70%,Realtime降幅约85%,ASR降幅达95%。

语音识别方面,Qwen-Audio-3.1-ASR支持30种语言和16种中文方言,新增原生转写润色能力,可自动去除语气词与重复表达并重组语义;分角色转写把说话人标签、时间戳和文本联合输出,短插话与重叠语音也能分清。模型支持低延迟流式识别,首字响应约160毫秒,在KeSpeech和WSYue的11个子集上平均字错误率为4.55%。

基于下代架构的音频理解模型ASR-Next能够识别人物情绪、环境声与机械声,面对同时包含对话、背景音乐和环境声的音频,不仅能输出文本,还能描述音频中发生了什么、事件在何时出现,并回答与整段内容相关的问题。

音频创作模型TTS-Next则围绕文本、时间戳和参考音频统一生成人声、音效和环境音,一段播客可同时包含多位说话人的对话与背景音效;支持多人音色复刻与多轮对话生成,角色在连续内容中不会变声,还支持48kHz输出与细粒度时间戳控制,面向播客、有声书、影视剧、游戏等专业创作场景。

实时交互模型Realtime升级为全双工,用户可随时插话打断,交流体验接近真人通话。模型能识别语气背后的情绪并调整回应方式,跨语言切换时保持上下文与交流节奏,还可在对话中调用工具,连接API、知识库和业务系统完成任务。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END