通义千问发布实时语音模型3.0
IT时代网7月15日消息,阿里云通义千问正式发布实时语音交互对话模型Qwen-Audio-3.0-Realtime,在智商、Agent工具调用、共情对话、双工交互流畅度四条主线上同步升级,力求实现"又快又聪明"的语音交互体验。
模型提供Plus和Flash两个版本,分别面向推理能力优先和响应速度优先的场景。实时语音模型通常为压低时延而牺牲推理深度,但Qwen-Audio-3.0-Realtime针对日常对话等对时延敏感的场景可毫秒级直接生成回复。在语音问答基准VoiceBench上,Plus版本以书面化和口语化prompt测试得分分别为92.5和90.5,仅下降2.0,表明模型能扛住真人说话的随意性。
在工具调用方面,模型无需用户明确指令即可自行调用外部工具,调用结果自动融入对话记忆,后续追问可衔接使用。模型基于FunctionCall标准协议,支持MCP、API、知识库引入。共情对话方面,模型能根据语境动态调整语气、节奏、音调与情感,在辩论场景中快速组织反驳,在情感陪伴中通过副语言信号进行共情回应。
双工交互能力使模型能边说边听,像真人一样随时打断、插话。模型内置多模态感知的双工控制子模型,在嘈杂环境中不会被背景噪声误打断,多人讨论中能锁定主对话对象。今年5月Preview版本在Artificial Analysis对话流畅度指标上曾以97.8%登顶。
技术层面,模型采用On-Policy Distillation在线策略蒸馏框架,将文本大模型完整推理能力蒸馏至语音模型,同时引入多教师蒸馏策略,确保口语表达、基础推理、工具调用和音频理解四条主线均衡发展。模型已在阿里云百炼平台上线,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。

图:Qwen-Audio-3.0-Realtime产品宣传图
注:本文中包含AI辅助创作的内容。