阿里发布语音识别大模型主攻专业词汇

IT时代网7月31日消息,阿里巴巴今日发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash。用一句话概括这次升级的目标:让 AI 更准确地听懂专业词汇。

模型在三个维度做了系统性优化——上下文一致性、行业词识别、热词定制化,同时新增语音润色能力,可以直接输出结构化文本,省去后续整理环节。

难点其实在词库。研究团队持续从医疗、IT 编程、股票、社会名人等领域挖掘专业词汇,搭建起覆盖多行业的高质量词库,用来强化模型对术语和冷门词的识别。在最新一轮行业词汇内部评测中,各行业专业词的“听中率”均有明显提升,医疗场景更是突破 95.36%。

此前的成绩也可作参照。Qwen-Audio-ASR-Flash 系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景落地验证,曾在 AI 评测平台 Artificial Analysis 上以 1.7% 的错字率位列全球第一。

目前 Qwen-Audio-3.0-ASR 已通过阿里云百炼平台开放调用,提供三个版本:Qwen-Audio-3.0-ASR-Flash 面向语音识别,单次最长支持 5 分钟;Qwen-Audio-3.0-ASR-Filetrans 用于离线文件转写;Qwen-Audio-3.0-ASR-Streaming 则对应实时语音识别场景。

阿里发布语音识别大模型主攻专业词汇

注:本文中包含AI辅助创作的内容。

THE END