cosmos-predict2.5

用视频预测未来世界,为机器人和自动驾驶提供模拟训练场

Cosmos-Predict2.5 是 NVIDIA 开源的视频生成模型,属于 Cosmos 世界基础模型(WFM)系列的最新版本,专注于以视频形式模拟和预测世界的未来状态。它解决的核心问题是让 AI 具备对物理世界动态的理解与预测能力,可用于生成高质量、时间连贯的未来帧序列。该模型基于扩散架构,支持文本或图像条件生成视频,提供多种模型尺寸以适应不同算力需求,并配套了完整的训练、微调及推理工具链。其核心能力包括高保真视频合成、长时程时序预测、以及多模态条件控制,旨在为机器人、自动驾驶、科学模拟等领域提供强大的世界模拟基础。项目采用 Python 实现,代码结构清晰,有活跃的社区维护,适合研究者和开发者进行二次开发与部署。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1377
维护状态 低维护
是否开源 是
定价模式 free

项目预览

项目数据

分类视频生成
开发团队nvidia-cosmos
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可证,可免费本地部署使用,无在线服务。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型foundational-models,video-generation,world-models
GitHub 星标★ 1377
30天Star增速
HF 下载量
上线时间2025-09-25 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:模型权重 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(README 节选未给出具体版本要求)
  • 可访问 GitHub 与 Hugging Face 的网络环境
  • git(如需克隆仓库)
  • 足够的本地磁盘空间用于存放模型权重(README 未给出具体容量)

安装与启动步骤

  1. 1确认项目状态

    先阅读 README 顶部公告:本仓库已不再活跃开发,仅接收有限维护更新,官方建议迁移到 Cosmos 3。

  2. 2访问 Cosmos 3 新仓库

    README 明确推荐所有用户迁移,最新模型、技术报告、教程与基准都在新仓库中。

  3. 3克隆当前仓库

    仅在需要复现 Cosmos-Predict2.5 旧版本时克隆,README 未提供依赖安装命令。

    git clone https://github.com/nvidia-cosmos/cosmos-predict2.5.git
  4. 4获取模型权重

    README 仅给出 Hugging Face 集合页面链接,需在该页面自行选择并下载对应模型权重。

  5. 5查阅官方站点

    产品介绍与更多资料见 NVIDIA Cosmos 产品官网,README 未列出具体安装步骤。

如何确认成功

README 节选未提供启动验证方法;能正常打开 Cosmos 3 新仓库与 Hugging Face 模型集合页面即说明链接有效。

常见问题

Q:这个仓库还能正常使用吗?

A:仓库已不再活跃开发,只接收有限的维护更新,官方建议迁移到 Cosmos 3,新功能与支持都集中在新仓库。

Q:应该下载哪个版本的模型?

A:README 明确推荐迁移到 Cosmos 3 获取最新能力;若必须用旧版本,可到 README 给出的 Hugging Face 集合页面查看可用权重。

Q:为什么没有安装命令?

A:本次 README 节选只包含迁移公告与相关链接,未提供依赖安装、运行或推理命令,请查阅新仓库 Cosmos 3 的文档。

Q:Cosmos 3 与本项目有什么关系?

A:Cosmos 3 是 NVIDIA 下一代 Physical AI 基础模型平台,单一模型即可完成推理、世界状态预测、跨域跨模态迁移与动作策略生成。

注意事项

  • 本仓库已停止活跃开发,仅做有限维护,长期使用请迁移到 Cosmos 3(https://github.com/NVIDIA/Cosmos)。
  • README 节选未给出任何安装、运行、端口或配置文件信息,本教程步骤仅为通用准备动作。
  • 下载模型权重前请先在 Hugging Face 对应页面确认许可协议与访问权限。
  • 硬件与显存要求未在 README 中说明,请以官方文档为准。

核心亮点

  • 基于 NVIDIA 强大算力生态,模型性能与稳定性有保障
  • 提供多种模型尺寸,从研究到部署场景灵活适配
  • 支持文本/图像条件生成,控制方式多样,易上手

不足之处

  • 模型体积大,推理资源门槛较高
  • 文档/社区待观察

适用场景

  • 机器人操作策略的视觉预训练
  • 自动驾驶场景的未来帧预测与规划
  • 科学模拟中的物理过程可视化

替代项目

Genie、VideoPoet、WorldDreamer

项目介绍

cosmos-predict2.5 是视频领域的开源项目,由 nvidia-cosmos 开发,2025 年首次发布。

在全站 13,655 个收录项目中,它的 GitHub 星标数(1,374)位列前 30%,在视频分类中处于中上游。

近 44 天,它的 GitHub 星标从 1,351 增加到 1,374,净增 23。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-06-08。Apache-2.0许可证,可免费本地部署使用,无在线服务。从国内网络环境看,可直接访问。

它主要面向的使用场景是:机器人操作策略的视觉预训练。同类可对比的替代方案包括 Genie、VideoPoet、WorldDreamer。

上一篇:Astra

下一篇:DiT-Extrapolation

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 128493 2026-08-09
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3574 2026-08-10
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 330 2026-08-26
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4315 2026-08-10