VideoActionModel

用视频生成驱动自动驾驶,让AI学会看路开车

VideoActionModel 是自动驾驶视频生成建模的官方实现,包含 VaViM 和 VaVAM 两个核心模型。它解决的是自动驾驶中通过视频生成来学习世界模型和动作预测的问题,核心能力是利用视频生成技术模拟驾驶场景,并基于生成的视频预测车辆控制动作,从而支持端到端的自动驾驶决策。项目基于 Jupyter Notebook 开发,技术栈涵盖自动驾驶、移动机器人、视频生成和世界模型,适合研究者和开发者用于探索视频生成在自动驾驶中的应用。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 170
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队valeoai
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型autonomous-driving,mobile-robots,video-generation,world-models
GitHub 星标★ 170
30天Star增速
HF 下载量
上线时间2024-02-09 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 官方实现,代码与论文对应,研究可信度高
  • 覆盖世界模型与动作预测,技术路线前沿
  • 支持自动驾驶与移动机器人场景,应用面广

不足之处

  • 早期项目,文档和社区支持待观察
  • 依赖 Jupyter Notebook,工程化部署需额外改造

适用场景

  • 自动驾驶行为决策研究
  • 世界模型与视频生成算法开发
  • 移动机器人导航控制实验

替代项目

DriveGAN、GameGAN、World Models

项目介绍

VideoActionModel 是行业应用领域的开源项目,由 valeoai 开发,2024 年首次发布。

它收录于行业应用分类,该分类目前共有 545 个项目,GitHub 星标数为 170。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。MIT许可证,完全免费,需自行部署。

它主要面向的使用场景是:自动驾驶行为决策研究。同类可对比的替代方案包括 DriveGAN、GameGAN、World Models。

上一篇:Epona

下一篇:Vista

同类项目推荐

xmgai-like 开源

换脸、艺术二维码随手玩,副业灵感一包带走。

本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···

★ 60 2026-08-09
spoken-to-signed-translation 开源

把口语文本一路转成手语视频的流水线

a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation

★ 102 2026-09-11
LiveTranslate 开源

直播看片实时翻译,字幕秒出,跨语言无压力

Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···

★ 691 2026-08-13