Text2Video-Zero

不训练视频模型,用文生图扩散模型直接生成连贯视频

Text2Video-Zero 是 ICCV 2023 Oral 论文的官方实现,核心思路是利用预训练的文生图扩散模型(如 Stable Diffusion)直接生成视频,无需对视频数据进行训练。它通过巧妙设计潜在噪声的时序一致性(如跨帧注意力机制、运动动态编码),将静态图像生成扩展为时间上连贯的视频序列,解决了直接逐帧生成会导致闪烁和内容不连贯的问题。项目支持三种模式:零样本文本到视频生成、零样本视频编辑(基于提示词或图像编辑)、以及指令引导的视频编辑(如换风格、改物体)。其最大价值在于证明了强大的文生图模型可以零样本迁移到视频领域,为视频生成提供了一条低成本、无需视频训练数据的新路径。核心能力包括:文本驱动视频生成、视频内容编辑、以及利用图像编辑模型实现视频风格迁移。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4243
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队Picsart-AI-Research
所属国家
定价模式free
价格说明开源项目,提供在线演示页面,可免费体验,无付费版本。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型video-editing,video-generation
GitHub 星标★ 4243
30天Star增速
HF 下载量
上线时间2023-03-21 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 5 步

环境要求

  • Python 3.9
  • CUDA >= 11.6(README 明确要求)
  • 已安装 virtualenv(用于创建虚拟环境)
  • 可访问 GitHub 与 PyPI 的网络环境

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 Text2Video-Zero 官方仓库到本地,需保证网络可访问 GitHub。

    git clone https://github.com/Picsart-AI-Research/Text2Video-Zero.git
  2. 2进入项目目录

    切换到刚克隆下来的仓库根目录,后续安装命令都在此目录执行。

    cd Text2Video-Zero/
  3. 3创建虚拟环境

    使用 README 指定的 Python 3.9 创建虚拟环境,--system-site-packages 会继承系统已装包。

    virtualenv --system-site-packages -p python3.9 venv
  4. 4激活虚拟环境

    激活后 pip 安装的依赖会进入 venv,避免污染系统 Python 环境。

    source venv/bin/activate
  5. 5安装依赖

    按 requirements.txt 安装全部 Python 依赖,含 torch 等大型包,耗时较长请耐心等待。

    pip install -r requirements.txt

如何确认成功

README 未给出启动命令;可用 pip list 查看 requirements.txt 中的依赖是否都已安装成功。

常见问题

Q:对 Python 和 CUDA 版本有什么要求?

A:README 明确要求使用 Python 3.9 与 CUDA >= 11.6,版本不符可能导致依赖安装或运行失败。

Q:没有 NVIDIA GPU 可以运行吗?

A:README 只给出 CUDA >= 11.6 的安装要求,未提供纯 CPU 运行说明,建议使用带 CUDA 的 GPU 环境。

Q:不想本地部署怎么体验?

A:README 提供了 Hugging Face Spaces 在线 Demo(PAIR/Text2Video-Zero),可直接在网页上体验。

Q:安装命令报找不到 python3.9 怎么办?

A:需先在系统中安装 Python 3.9 并确保 python3.9 可执行文件在 PATH 中,README 未提供其他版本替代方案。

注意事项

  • README 节选只包含 Setup 安装步骤,未提供推理/生成视频的运行命令,需参考官网 https://text2video-zero.github.io 或论文。
  • virtualenv 使用了 --system-site-packages,虚拟环境会继承系统包,可能与 requirements.txt 中的版本产生冲突。
  • 激活虚拟环境使用 source venv/bin/activate,属于 Linux/macOS 写法,Windows 需另用对应激活脚本。

核心亮点

  • 零样本视频生成,无需任何视频训练数据,直接复用 Stable Diffusion 权重
  • 支持文本到视频、视频编辑、指令编辑三种模式,功能覆盖广
  • 跨帧注意力机制有效保持时序一致性,视频连贯性优于朴素逐帧生成

不足之处

  • 生成视频分辨率低(默认 512x512),且时长极短(约 2 秒),实用性受限
  • 推理速度慢,需要多次扩散采样,且跨帧注意力计算开销大
  • 对复杂运动场景支持弱,物体形变或大幅运动时容易出现伪影

适用场景

  • 快速生成短视频概念预览,用于创意设计或故事板
  • 对已有视频进行零样本风格迁移或物体替换,无需重新训练
  • 在缺乏视频训练数据的领域,利用文生图模型探索视频生成能力

替代项目

AnimateDiff、ModelScope Text-to-Video、VideoCrafter

项目介绍

Text2Video-Zero 是视频领域的开源项目,由 Picsart-AI-Research 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,243)位列前 10%,在视频分类的 473 个项目里位列前 7%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。提供在线演示页面,可免费体验,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:快速生成短视频概念预览,用于创意设计或故事板。同类可对比的替代方案包括 AnimateDiff、ModelScope Text-to-Video、VideoCrafter。

上一篇:StyleSV

下一篇:AMT

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09