比亚迪HyWorldVLA登顶自动驾驶基准
IT时代网8月12日消息,据盖世汽车报道,比亚迪汽车新技术研究院人工智能团队于 7 月 29 日发表首篇研究论文《HyWorldVLA》,介绍一种用于自动驾驶的混合世界模型,在 NAVSIM v1 公开基准测试中以 90.59 的 PDMS 评分刷新历史最佳。
该模型结合像素级与潜在空间世界建模,并采用视觉-语言-动作(VLA)架构。通常像素级模型像放电影一样逐帧预测未来路况,细节丰富但计算昂贵、对视觉噪声敏感;潜在空间模型在压缩的抽象表征中运行,效率高却易丢细节。比亚迪的方案在训练阶段用像素级监督充当"看门狗",强制潜在空间保留足够环境信息,实际推理时只用轻量的潜在空间模型保证效率。
消融实验显示两者缺一不可:移除像素级预测,PDMS 从 90.59 跌至 87.50;移除潜在空间处理,则降至 89.91。在指标更全面的 NAVSIM v2 上,HyWorldVLA 拿到 89.71 分,领先第二名近 1 分;在 655 个雨雾噪声场景测试中得分 86.87,比最强基线高出 19 分以上。
这篇论文的意义超出分数本身。外界对比亚迪的印象长期偏向"重制造、轻研发",智能化多依赖供应链整合;而这是比亚迪首次在自动驾驶基础模型领域公开亮相,证明其具备从 0 到 1 的 AI 研发能力。今年 5 月比亚迪刚发布自研 4 纳米智驾芯片璇玑 A3,单颗算力约 700TOPS、三芯并联可达 2100TOPS,从算法到芯片的完整闭环被视为面向 L3 级自动驾驶的技术储备。不过基准领先不等于量产落地,HyWorldVLA 目前仍停留在论文阶段,何时装车尚无时间表。

注:本文中包含AI辅助创作的内容。