智元具身大模型登顶DailyOmni
IT时代网7月28日消息,具身全模态理解权威榜单 DailyOmni 最新结果出炉,智元自研的具身原生全模态大模型 WITA-Omni Preview 以 85.21 分综合成绩拿下第一,把千问、Gemini、豆包、英伟达等国内外模型甩在身后,八项细分指标里六项夺魁。
DailyOmni 是业内检验音视频时序对齐、跨模态联合推理的第三方权威榜单,大量采用真实开放环境的音视频素材,核心考的是模型把画面、环境声音揉在一起,认准声画对应、事件先后和跨模态语义的本事——这恰恰是人形机器人在真实空间里跟人打交道最需要的能力。
智元方面说,WITA-Omni 的关键不在于简单把聊天模型塞进机器人,而是把物理动作和表情抬到和语音平级的一级输出,用一个原生端到端模型统一管感知、决策和表达,在 Thinker–Talker 范式上扩出了面向具身的 Thinker–Talker–Actor 架构。
它的领先也非纯靠堆参数。中训练阶段用了千万小时级的开源和自有多模态数据,把文本、视觉底座升级成"听得见、看得懂、能做音画联合推理"的全模态模型。针对公开音视频普遍缺交互轮次、响应时机、动作表情的问题,智元还自建了以人为中心、保留声音画面语言动作表情天然时序的大规模高质量数据集。

此图片为IT时代网AI生成的示意图
注:本文中包含AI辅助创作的内容。