Stable-Video-Infinity

让视频扩散模型无限延长也不崩坏

Stable-Video-Infinity 是一个面向无限长度视频生成的开源项目,被 ICLR 26 接收为 Oral 论文。它针对现有视频扩散模型在长视频生成中误差累积、画面漂移和显存爆炸的问题,提出 Error Recycling(误差回收)机制,把生成过程中产生的误差重新注入后续去噪步骤,从而在保持时序一致性的同时持续延长视频。项目基于视频扩散 Transformer,支持音频驱动说话人脸、舞蹈生成、端到端拍摄等场景,可生成长时间连贯视频而不出现明显崩坏。代码为 Python 实现,提供训练与推理流程,适合研究者和工程团队用于长视频生成、虚拟人、影视预演等方向。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2578
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队vita-epfl
所属国家
定价模式free
价格说明开源项目,代码免费使用,定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型audio-driven-talking-face,dance-generation,end-to-end-filming,long-video-generation,video-diffusion-transformers
GitHub 星标★ 2578
30天Star增速
HF 下载量
上线时间2025-10-09 00:00:00
最近更新2026-09-27 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-29
浏览次数0

使用教程

难度:高级 约 30 分钟 部署方式:模型权重 5 步

环境要求

  • Linux + NVIDIA GPU(官方在 A100 80G 上测试)
  • CUDA 12.0 环境
  • PyTorch 2.4.1 / 2.5.0 / 2.8.0(README 测试版本)
  • Python 3.10(conda 环境)
  • 需从 Hugging Face 或 ModelScope 下载模型权重

安装与启动步骤

  1. 1创建 conda 环境

    使用 conda 创建 Python 3.10 的独立环境,避免与系统包冲突。

    conda create -n svi python=3.10
  2. 2激活环境

    激活刚创建的 svi 环境,后续所有安装都在此环境内执行。

    conda activate svi
  3. 3安装 ffmpeg

    通过 conda-forge 安装视频处理所需的多媒体库 ffmpeg。

    conda install -c conda-forge ffmpeg
  4. 4安装 librosa

    安装音频处理库 librosa,供音频驱动说话人脸等场景使用。

    conda install -c conda-forge librosa
  5. 5安装 libiconv

    安装字符编码转换库 libiconv,解决部分依赖的编码问题。

    conda install -c conda-forge libiconv

关键配置

配置项必填说明示例
torch 版本是README 自动脚本会安装 torch==2.5.0,也支持 2.4.1 与 2.8.0。2.5.0

如何确认成功

能成功执行 conda activate svi 并在新环境中导入 librosa 无报错,即表示基础环境配置完成。

常见问题

Q:flash-attn 安装失败怎么办?

A:README 指出可参考项目 issue #3 的讨论排查,通常与 CUDA 版本和编译环境有关。

Q:可以用更低版本的 torch 吗?

A:可以,README 明确测试过 torch==2.4.1 和 torch==2.5.0,2.8.0 为 A100 上的复现版本。

Q:没有 A100 80G 能跑吗?

A:README 仅声明在 A100 80G 上测试通过,未给出其他显存配置的保证。

注意事项

  • README 只给出了环境安装部分,模型下载、推理脚本等需参考官方仓库与项目主页。
  • 确认 CUDA 版本与 torch 版本匹配,避免 flash-attn 编译失败。
  • 模型权重可从 Hugging Face 的 vita-video-gen/svi-model 或 ModelScope 的 epfl-vita/svi-model 获取。

核心亮点

  • 提出 Error Recycling 机制,直接缓解长视频生成中的误差累积与画面漂移
  • 被 ICLR 26 接收为 Oral,方法有学术背书,技术路线可信
  • 覆盖音频驱动说话人脸、舞蹈生成、端到端拍摄等多种长视频场景

不足之处

  • 推理显存与算力需求较高,普通消费级显卡难以直接跑长视频
  • 项目较新,预训练权重与一键推理脚本的完善度待观察

适用场景

  • 虚拟人长时直播或口播视频生成
  • 舞蹈/动作类短视频的连续长镜头生成
  • 影视预演与广告分镜的端到端长视频拍摄

替代项目

AnimateDiff、CogVideoX、Open-Sora

项目介绍

Stable-Video-Infinity 是视频领域的开源项目,由 vita-epfl 开发,2025 年首次发布。

在全站 13,276 个收录项目中,它的 GitHub 星标数(2,578)位列前 30%,在视频分类的 503 个项目里位列前 10%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-27。代码免费使用。

它主要面向的使用场景是:虚拟人长时直播或口播视频生成。同类可对比的替代方案包括 AnimateDiff、CogVideoX、Open-Sora。

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 126059 2026-08-09
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3257 2026-08-10
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4281 2026-08-10