17173 > 游戏资讯 > 科技新闻 > 正文

阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型

2026-09-06 18:01:44 神评论
17173 新闻导语

阿里千问开源首个自动驾驶视觉语言模型Qwen-Drive-1.0-4B,统一3D感知与运动规划,保留通用视觉能力。GitHub已发布,点击查看详情!

感谢网友 Domado 的线索投递!

9 月 6 日消息,阿里千问本周开源了 Qwen-Drive-1.0-4B,这是一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。

官方表示,Qwen-Drive-1.0 是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划,同时完全保留了预训练 VLM 的原始架构。

模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力。Qwen-Drive-1.0-4B 同时提供 SFT 和 RL 两个规划专家,官方评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。

据介绍,Qwen-Drive-1.0 仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,并从开环预测到闭环驾驶进行全面评估。SFT 模型在所有基准上已具备竞争力。经过强化学习后,该模型仅以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。

附相关链接:

GitHub:https://github.com/QwenLM/Qwen-Drive-1.0

Hugging Face:https://huggingface.co/Qwen/Qwen-Drive-1.0-4B

ModelScope:https://modelscope.cn/models/Qwen/Qwen-Drive-1.0-4B

【来源:IT之家】
关于自动驾驶,视觉语言模型,Qwen-Drive,阿里千问,开源,3D感知,运动规划,强化学习,SFT,RL的新闻
17173想了解一下大家怎么看17173的,以便提供更好的阅读体验,所以请各位路过的大佬们花一分钟时间看看这个问卷吧 一键参与