本土快讯2026.09.06

阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型

阿里千问本周开源 Qwen-Drive-1.0-4B,这是官方定位为首个面向自动驾驶的视觉语言基础模型,基于 Qwen3.5-4B 构建,统一 3D 感知、视觉问答与运动规划,并在 GitHub、Hugging Face 与 ModelScope 同步开放。

朋克君
发布者朋克君
预计阅读 2 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

阿里千问开源首个面向自动驾驶的视觉语言基础模型 Qwen-Drive-1.0-4B。

02

模型统一了 3D 感知、视觉问答与运动规划能力,保留预训练 VLM 原始架构。

03

采用分阶段训练策略,提供 SFT 与 RL 两个规划专家以覆盖不同能力侧重。

04

模型已在 GitHub、Hugging Face 与 ModelScope 同步开源。

本摘要由 AI 辅助整理,请以正文内容为准。

数智朋克讯 阿里千问本周开源了 Qwen-Drive-1.0-4B。官方将其定义为“首个面向自动驾驶的视觉语言基础模型”,该模型基于 Qwen3.5-4B 构建,面向自动驾驶任务链,统一了 3D 感知、视觉问答与运动规划能力,并完全保留了预训练 VLM 的原始架构。

在训练方案上,Qwen-Drive-1.0 采用分阶段策略,将驾驶监督数据与通用视觉语言数据结合,使模型在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力。在运动规划阶段,模型同时提供 SFT 与 RL 两个规划专家,以覆盖不同的训练策略与能力侧重。

官方评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。规划样本仅使用公开来源构建,并统一了各数据集的轨迹格式,实现从开环预测到闭环驾驶的完整评估。结果显示,SFT 版本在所有基准上已具备竞争力;经过强化学习后,模型以微小的开环位移误差为代价,在人类偏好对齐与闭环安全性方面获得全面提升。

目前,Qwen-Drive-1.0-4B 已在 GitHub、Hugging Face 与 ModelScope 同步开源。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签