Cloudflare推出多模态决策模型Clef-omni 支持音视频输入

IT时代网10月10日消息,Cloudflare发布公告,宣布推出开放权重决策模型Clef-omni,支持单次API调用处理文本、图像、音频和视频输入,模型权重已在Hugging Face开放下载。

此前推出的Clef系列支持文本、图像及从视频中抽取的连续画面输入,处理视频需要先按时间轴拆成一张张静态图像再按顺序交给模型。Clef-omni在此基础上新增音频和完整视频输入,支持wav、mp3、mp4和webm格式,开发者无需另行搭建语音转写及音视频拆分流程,用一个模型即可处理多种输入。

技术底座方面,Clef-omni基于Qwen3-Omni-30B-A3B-Instruct构建,保留了基座模型的主要理解能力,面向结构化决策任务,不生成常规文本输出。官方公布的测试数据中,纯文本请求中位响应时间约130毫秒,图像约150毫秒,带声音的21秒视频约1.5秒完成评分。

基准测试方面,Clef-omni在工具调用、API调用等决策任务上与前代Clef、Clef-flash互有胜负,家用电器控制精确匹配率达69.38,反钓鱼识别准确率73.27。此前,本站曾报道过Cloudflare开源基于Qwen的多模态决策模型Clef。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END