阿里开源首个自动驾驶视觉语言基础模型

IT时代网9月6日消息,阿里千问本周开源了 Qwen-Drive-1.0-4B,这是一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型,官方称其为首个面向自动驾驶的视觉语言基础模型。

Qwen-Drive-1.0 在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划,同时完全保留了预训练视觉语言模型的原始架构。

模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时保留通用视觉理解与指令遵循能力,同时提供 SFT 和 RL 两个规划专家,评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力以及开环、伪闭环和闭环运动规划。

官方介绍,该模型仅使用公开来源构建规划样本,SFT 模型在所有基准上已具备竞争力;经过强化学习后,仅以微小的开环位移误差为代价,换来人类偏好对齐和闭环安全性的全面提升。模型权重已在主流开源平台放出。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END