小米开源CocktailASR语音识别模型

IT时代网9月11日消息,小米技术今日宣布,正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。

该模型采用端到端大模型架构,以目标说话人的一段参考音频作为声纹提示,可在多人同时说话的复杂环境里,精准提取并仅转录目标用户的语音。在多个主流多说话人测试集上均达到SOTA水平,大幅领先现有方案。

它的单人识别性能比肩标准语音识别模型,可无缝兼顾单人场景;具备拒识非目标说话人干扰语音的能力,目标不在场时输出空文本,避免误触发;还支持思维链推理模式,为识别结果提供可解释的推理过程。模型代码与权重已在开源社区放出。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END