阿里千问发布同声传译大模型

IT时代网9月19日消息,阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,模型以 Interleave 架构重构实时同传,准确度、流畅度与简洁度同步提升,字均延迟(LAAL)从 2.8 秒降至 2.3 秒。

官方表示,在支持 60 种语言的基础上,新模型增加了三项能力让同传更适合真实场景:实时说话人分离让每句话归属清晰、音色复刻更稳定;原文译文同帧同出,双语同屏;长上下文消歧则联系前文读懂当下,人名与术语的翻译更精准。

模型采用基于 Hybrid MoE 的 Thinker–Talker 双模块设计,通过 Interleave 方式衔接流式理解、文本输出与语音生成。其中 Thinker 把视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端产出,让理解与翻译在单一序列内完成;Talker 再结合译文和源音频,把译文合成为保留原说话人音色的语音。

在覆盖 14 个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,该模型在翻译忠实度、流畅度、简洁度以及说话人分离错误率 DER 四个维度上均优于目前行业主流实时同传系统。在公开 FLEURS 音频测试集上评测的 70 个语言方向中,其翻译质量、字均延迟、语音识别准确率与语音合成质量同样领先于上一代及当前主流实时同传系统。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END