Meta推出首个实时音频感知转写模型

IT时代网9月2日消息,据外媒报道,Meta 公司推出 Muse Voice Transcribe,这是其首个实时音频感知模型。开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元(现汇率约合 20.2 元人民币),即每小时 0.18 美元(约 1.2 元人民币)。

该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时系统可同步输出文字,无需等待完整录音结束后再单独处理,因此延迟更低,适合实时听写、会议记录与通话字幕。

Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,也能识别说话是否结束从而自动确定一段输入的边界。模型训练覆盖 70 余种语言,其中 25 种在发布时完成验证,并支持长度超过 1 小时的音频以及句内或句间的自然语言切换。

技术层面,Meta 引入名为自适应延迟的动态决策机制:系统不会为所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出结果——较易识别的语音可更快提交,发音不清、术语较多或语境复杂的词语则调用更多前后文信息。Meta 称,截至 2026 年 9 月 1 日,该模型位列一家第三方流式语音转文本排行榜第 1 名。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

THE END