DriveLM

用图问答让自动驾驶学会推理和解释

DriveLM 是一个面向自动驾驶的视觉问答(VQA)基准与数据集,源自 ECCV 2024 Oral 论文。它提出用图结构组织驾驶场景中的视觉问答,将感知、预测、规划等任务以问题链形式关联,解决传统自动驾驶模型缺乏推理和可解释性的问题。核心能力包括:提供大规模驾驶场景问答数据,支持多模态模型评估,以及通过图问答形式驱动端到端驾驶决策。项目包含数据生成工具、评估脚本和基线模型,旨在推动可解释、可交互的自动驾驶智能体发展。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1345
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队OpenDriveLab
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言HTML
技术栈/模型autonomous-driving,chain-of-thought,graph-of-thoughts,large-language-models,llm,prompt-engineering,prompting,tree-of-thoughts,vision-language
GitHub 星标★ 1345
30天Star增速
HF 下载量
上线时间2023-08-08 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Git(用于克隆 DriveLM 仓库)
  • nuScenes 数据集(DriveLM-Data 基于 nuScenes 与 CARLA 构建,需自行准备)
  • Python 运行环境(用于运行 challenge devkit 与数据准备脚本,README 节选未明确版本)
  • 足够的磁盘空间存放 nuScenes 原始数据与 DriveLM 标注数据

安装与启动步骤

  1. 1克隆仓库

    把 DriveLM 仓库拉到本地,所有数据准备文档与挑战 devkit 都在仓库内。

    git clone https://github.com/OpenDriveLab/DriveLM.git
  2. 2进入仓库目录

    切换到克隆下来的目录,后续命令都在此目录中执行。

    cd DriveLM
  3. 3阅读数据准备文档

    README 的 Getting Started 明确指向该文档,先看清楚 nuScenes 数据的下载与处理要求。

    cat docs/data_prep_nus.md
  4. 4准备 DriveLM-nuScenes

    严格按 docs/data_prep_nus.md 中的步骤操作;README 节选未给出具体下载链接与参数,不要自行猜测路径。

  5. 5使用挑战 devkit

    进入 challenge 目录查看 devkit 内容,用于评估或提交 Autonomous Driving Challenge 2024 结果。

    cd challenge
  6. 6关注后续更新

    README 标注 More content coming soon,训练、评测等内容后续才会放出,建议留意官网 news。

如何确认成功

仓库克隆成功并能打开 docs/data_prep_nus.md 与 challenge/ 目录;数据准备完成后按该文档给出的校验方式确认即可。

常见问题

Q:DriveLM 的数据集在哪里下载?

A:README 的 Getting Started 指向 docs/data_prep_nus.md,nuScenes 版数据的下载与处理流程以该文档为准。

Q:有可以直接使用的 DriveLM-Agent 权重吗?

A:README 提到 DriveLM-Agent 是 VLM 基线方法,但本次节选中没有给出权重下载地址,需等仓库后续更新。

Q:怎么参加 2024 自动驾驶挑战赛?

A:README 给出 Driving-with-Language 排行榜链接 opendrivelab.com/challenge2024/#driving_with_language,可在该页面查看提交方式。

Q:为什么没有 pip install 之类的安装命令?

A:本次 README 节选只给了数据准备与 devkit 的入口,没有列出依赖安装命令,因此不提供未经验证的命令。

注意事项

  • 本项目主要是数据集与基准,部署重点是数据准备而非安装软件包。
  • README 节选未给出完整安装指令,请以 docs/data_prep_nus.md 和 challenge/ 目录内的说明为准。
  • DriveLM-Data 基于 nuScenes 与 CARLA,使用前请遵守其各自的数据许可协议。
  • 更多内容官方标注为 coming soon,建议定期查看 opendrivelab.com 的 news。

核心亮点

  • 首个将图结构VQA引入自动驾驶的基准,创新性强
  • ECCV 2024 Oral,学术认可度高,数据质量有保障
  • 覆盖感知、预测、规划全链路,支持端到端评估

不足之处

  • 数据规模相对较小,可能限制模型泛化能力
  • 文档和社区生态尚在早期,上手门槛较高

适用场景

  • 自动驾驶多模态模型推理能力评估
  • 驾驶场景可解释性研究
  • 端到端驾驶决策模型训练与测试

替代项目

nuScenes-QA、HAD (Human Attention in Driving)、BDD-X

项目介绍

DriveLM 是计算机视觉领域的开源项目,由 OpenDriveLab 开发,2023 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,345)位列前 30%,在计算机视觉分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:自动驾驶多模态模型推理能力评估。同类可对比的替代方案包括 nuScenes-QA、HAD (Human Attention in Driving)、BDD-X。

上一篇:Awesome_Mamba

下一篇:VLM-Grounder

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···

★ 427 2026-08-09