cosmos-transfer2.5

用多个空间条件精准控制视频生成,打造可控世界模拟。

Cosmos-Transfer2.5 是 NVIDIA 开源的视频生成模型,基于 Cosmos-Predict2.5 构建,专注于多空间控制条件下的高质量世界模拟。它解决的核心问题是:在视频生成中,如何通过多个空间控制输入(如深度图、分割图、边缘图等)精确引导生成内容,实现可控的世界仿真。该模型支持多种条件输入组合,能够生成符合物理规律和空间结构的视频序列,适用于自动驾驶仿真、机器人训练、虚拟环境构建等领域。其核心能力包括:多模态空间条件融合、高保真视频生成、以及基于世界模型的因果推理。项目代码以 Python 为主,依赖 PyTorch 等深度学习框架,提供了推理和微调脚本,方便开发者二次开发。目前项目处于早期阶段,但已获得 715 星标,显示出社区对可控视频生成方向的关注。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 715
维护状态 维护中
是否开源
定价模式 free

项目数据

分类视频生成
开发团队nvidia-cosmos
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费本地部署使用
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型spatial-controls,video-generation,world-models,world-simulation
GitHub 星标★ 715
30天Star增速
HF 下载量
上线时间2025-09-25 00:00:00
最近更新2026-08-09 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

核心亮点

  • 支持深度图、分割图等多种空间控制输入,生成结果可控性强
  • 基于世界模型,视频生成符合物理规律和空间一致性
  • 提供推理和微调脚本,便于二次开发和定制

不足之处

  • 文档/社区待观察
  • 模型体积和推理资源消耗可能较大,对硬件要求高

适用场景

  • 自动驾驶场景仿真,生成多视角可控视频
  • 机器人操作训练,生成符合物理规则的环境视频
  • 虚拟制片和游戏开发,快速生成背景或过场动画

替代项目

Stable Video Diffusion、Runway Gen-3、NVIDIA Cosmos-Predict2.5

项目介绍

cosmos-transfer2.5 是一个视频生成领域的开源项目,官方简介:Cosmos-Transfer2.5, built on top of Cosmos-Predict2.5, produces high-quality world simulations conditioned on multiple spatial control inputs.。项目使用 Python 开发,在 GitHub 上获得 715 星标。

上一篇:ID-LoRA-LTX2.3-ComfyUI

下一篇:NAVA

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 110227 2026-08-09
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4047 2026-08-10
ai-video-summarizer 开源

上传视频,自动转写、摘要、剪出高光片段

An AI-powered tool for transcribing, summarizing, and creating smart clips from vide···

★ 62 2026-08-09
openscenesense-ollama 开源

本地跑AI,轻松分析视频画面和声音

OpenSceneSense Ollama is a Python library that harnesses AI for advanced local video···

★ 52 2026-08-09