OpenAI推自然语音模型GPT-Live-1
IT时代网9月11日消息,OpenAI于9月10日发布自然语音模型GPT-Live-1,将ChatGPT的自然全双工对话能力带到API,供开发者构建语音应用与业务工作流。
该模型采用单一架构同时处理听与说,而非传统的(识别—大模型—语音合成)串联方案,支持自然打断、笑声与犹豫等对话细节,并原生提供转写文本与轮次检测能力,可将深层推理与工具调用委托给后端文本模型。
前端语音层定价为每分钟0.05美元,已于9月10日当天在API中可用。开发者需自行搭配后端模型与代理框架,自定义语音访问则需联系销售了解资格与申请流程。

编辑:林一舟
THE END