豆包实时语音模型3.0 API正式上线

IT时代网6月18日消息,火山引擎今日正式上线豆包实时语音模型3.0(Seeduplex)的API服务,开启邀测。作为原生全双工端到端语音大模型,豆包实时语音模型3.0具备精准遵循、抗干扰、动态判停三大核心优势,不仅能实现"边听边说边办事"的实时交互体验,还可在对话中直接调用工具完成任务。

从被动响应到智能参与

豆包实时语音模型3.0正在将理想中的语音助手体验带入现实。基于对用户指令的精准理解,它可以从"被动响应"走向"适时参与",像真人一样持续倾听、自行判断对话节奏。

例如在多人交谈中,用户只需说一句"现在先别出声,聊到世界杯时再加入",它便会安静待命,无需反复唤醒;当对话真正进入相关话题后,它会立刻主动接话、自然参与。更进一步,模型支持用户自定义工具,打通实时语音交互、任务规划与工具编排,在实时交互中调用工具完成任务。预定日历、发送邮件、总结文档、发起查询等,都可由一句话语音指令在对话流中自然完成。

精准抗干扰:锁定用户声音

语音交互长期面临复杂声学环境"污染"用户输入的难题。背景噪音、旁人交谈、设备自身发出的声音,都可能导致系统响应迟钝、回复中断或被误触发。

豆包实时语音模型3.0通过持续接收并理解用户侧音频,感知全局声学环境,更精准地区分哪些声音是在与模型交互,哪些只是干扰信息。即便是在广播、导航、多人对话等嘈杂环境,也能精准锁定用户声音,大幅降低误回复率与误打断率。

动态判停:判停延迟缩短约250ms

自然对话的难点不只是"听清",还包括"拿捏时机"。用户的短暂停顿可能是在思考,也可能意味着已经说完。豆包实时语音模型3.0深度融合语音与语义理解,在对话节奏控制上更灵活。

评测显示,相比半双工模型,其判停延迟缩短约250ms,复杂场景下的抢话比例下降了40%。当用户主动打断时,模型打断延迟缩短约300ms,响应速度更快。

企业场景落地:从体验升级走向业务价值

豆包实时语音模型3.0可广泛应用于汽车智能座舱、AI智能硬件终端、智能呼叫中心与全渠道客服等场景。

在汽车智能座舱场景中,面对车内强噪音、驾驶中随时打断指令等情况,模型能有效提升车载语音助手的自然度和可用性。在AI智能硬件终端场景中,面对多源噪音或老人孩子说话不连贯、边想边说等情况,模型更能耐心倾听、不抢话。在智能客服场景中,针对用户插话、停顿、嘈杂环境等情况,模型能自然寻找话语间隙,降低因交互体验不佳导致的服务负面评价。

火山引擎表示,企业级语音交互正式从"可用"走向"好用",接下来将继续推进技术创新,与伙伴共同探索人机共融的下一代对话体验。

豆包实时语音模型3.0
此图片为IT时代网AI生成的示意图

注:本文中包含AI辅助创作的内容。

THE END