Epona

用扩散模型预测驾驶未来,生成连续视频帧。

Epona 是 ICCV 2025 收录的自动驾驶世界模型官方实现,基于自回归扩散模型生成未来视频帧。它解决自动驾驶中预测未来场景的难题,核心能力是给定当前观测(如摄像头图像)和动作指令,生成连续、多模态的未来视频序列,用于规划与决策。项目提供训练和推理代码,支持自定义数据集,并包含预训练模型。技术栈基于 PyTorch,适合研究自动驾驶预测和视频生成。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 388
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队Kevin-thu
所属国家
定价模式free
价格说明开源项目,MIT许可证,代码免费使用,无在线服务或付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型autonomous-driving,diffusion-models,video-generation,world-models
GitHub 星标★ 388
30天Star增速
HF 下载量
上线时间2025-06-26 00:00:00
最近更新2026-09-18 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • ICCV 2025 官方实现,学术权威性强
  • 自回归扩散架构,支持多模态未来预测
  • 提供预训练模型和完整训练/推理代码

不足之处

  • 早期项目,文档和社区支持待观察
  • 依赖特定数据集,泛化性需自行验证

适用场景

  • 自动驾驶场景预测与规划研究
  • 视频生成模型在机器人领域的应用
  • 多模态未来帧生成的学术基准

替代项目

DriveGAN、World Models、GameGAN

项目介绍

Epona 是行业应用领域的开源项目,由 Kevin-thu 开发,2025 年首次发布。

它收录于行业应用分类,该分类目前共有 545 个项目,GitHub 星标数为 388。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-18。MIT许可证,代码免费使用,无在线服务或付费版本。

它主要面向的使用场景是:自动驾驶场景预测与规划研究。同类可对比的替代方案包括 DriveGAN、World Models、GameGAN。

上一篇:Motus

下一篇:VideoActionModel

同类项目推荐

xmgai-like 开源

换脸、艺术二维码随手玩,副业灵感一包带走。

本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···

★ 60 2026-08-09
spoken-to-signed-translation 开源

把口语文本一路转成手语视频的流水线

a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation

★ 102 2026-09-11
LiveTranslate 开源

直播看片实时翻译,字幕秒出,跨语言无压力

Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···

★ 691 2026-08-13