讯飞上线语音基座大模型Spark-Audio

IT时代网9月16日消息,科大讯飞宣布Spark-Audio-1.0-Preview上线,这是一款基于全国产化算力训练的语音基座大模型。

过去大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法存在两个明显短板。一是信息丢失,文字只能记录说了什么,会丢掉语音里自带的语气、情绪以及背景环境音等关键信息,导致模型对场景的判断不完整;二是链路割裂,系统把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行,模块之间存在断点,不仅容易累积错误,使用体验上也会出现延迟和卡顿。

语音基座大模型解决的正是这些问题:它不再只做语音转文字,而是直接理解语音,一次性听懂人声、环境音、音乐等,并能理解声音里的语义、情绪和场景。

此次首发的Spark-Audio-1.0-Preview采用0.65B(Dense结构)音频编码器,搭配30B-A3B(MoE结构)大语言模型,使用了1300万小时音频以及大量文本数据,基于纯国产算力集群训练完成。在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务。

官方称,Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景高噪声、小声说等偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型相比,表现也十分接近。该模型可支持99种语言及202种方言的识别。

目前,Spark-Audio-1.0-Preview已正式开放体验,API后续将上线讯飞开放平台。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END