make-a-video-pytorch

用文本描述直接生成短视频,复现Meta最新AI模型

Make-A-Video 的 PyTorch 非官方实现,复现 Meta AI 提出的文本生成视频模型。该模型基于扩散模型架构,结合了文本编码器、时空注意力机制和轴向卷积,能够将文本描述直接转换为短视频片段。项目解决了从文本到视频生成的训练难题,通过预训练文本-图像模型并扩展至视频领域,降低了训练成本。核心能力包括文本条件视频生成、超分辨率处理以及视频插帧,支持从简单文本提示生成连贯的动态场景。代码结构清晰,包含模型定义、训练脚本和推理示例,适合研究者和开发者进行二次开发与实验。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1988
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队lucidrains
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型artificial-intelligence,attention-mechanisms,axial-convolutions,deep-learning,text-to-video
GitHub 星标★ 1988
30天Star增速
HF 下载量
上线时间2022-09-29 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境(可用 pip 安装)
  • 已安装 PyTorch(代码示例中 import torch)
  • 能联网访问 PyPI 以安装包

安装与启动步骤

  1. 1安装依赖库

    用 pip 从 PyPI 安装 make-a-video-pytorch 包,README 提供的就是这一条安装命令。

    pip install make-a-video-pytorch
  2. 2导入所需模块

    在 Python 脚本中导入 PseudoConv3d 与 SpatioTemporalAttention 两个模块,并导入 torch。

    import torch
    from make_a_video_pytorch import PseudoConv3d, SpatioTemporalAttention
  3. 3初始化两个模块

    按 README 示例设置 dim=256、kernel_size=3;注意力模块设置 dim_head=64、heads=8。

    conv = PseudoConv3d(dim=256, kernel_size=3)
    attn = SpatioTemporalAttention(dim=256, dim_head=64, heads=8)
  4. 4输入视频特征测试

    构造形状 (batch, features, frames, height, width) 的张量,分别前向得到卷积与注意力输出。

    video = torch.randn(1, 256, 8, 16, 16)
    conv_out = conv(video)
    attn_out = attn(video)
  5. 5用图像特征测试

    传入 4 维图像张量时,时间维卷积与注意力会被自动跳过,可直接用于 2D Unet 预训练。

    images = torch.randn(1, 256, 16, 16)
    conv_out = conv(images)
    attn_out = attn(images)

关键配置

配置项必填说明示例
dim是特征维度,示例中 PseudoConv3d 与注意力模块都设为 256256
kernel_size是伪 3D 卷积的卷积核大小3
dim_head是注意力每个头的维度64
heads是时空注意力的头数8

如何确认成功

运行示例代码不报错,conv_out 与 attn_out 形状分别为 (1,256,8,16,16)(视频)或 (1,256,16,16)(图像)。

常见问题

Q:必须安装 PyTorch 吗?

A:是的,README 示例中先 import torch,且输入张量由 torch.randn 生成,需自行确保环境中已装好 PyTorch。

Q:传入 4 维图像张量会怎样?

A:README 说明此时时间维卷积和时空注意力会自动跳过,等价于普通 2D 模块,方便先做图像预训练再迁移到 3D Unet。

Q:这个包能直接生成视频吗?

A:README 定位是组件实现(wip),提供 PseudoConv3d 和 SpatioTemporalAttention 这类模块,需要自行搭建完整模型与训练流程。

Q:视频张量各维含义是什么?

A:README 注释为 (batch, features, frames, height, width),即批大小、特征数、帧数、高、宽。

注意事项

  • 项目 README 标注为 wip(开发中),API 可能变动
  • README 未给出训练脚本、权重或推理端到端命令
  • PseudoConv3d 与 SpatioTemporalAttention 只是构建视频生成模型的组件,不代表完整 Make-A-Video 复现

核心亮点

  • 完整复现Make-A-Video架构,包含时空注意力和轴向卷积模块
  • 支持从预训练文本-图像模型微调,降低视频训练门槛
  • 提供推理脚本和示例,可快速生成文本对应的视频片段

不足之处

  • 非官方实现,与Meta原版可能存在细节差异
  • 训练资源需求高,普通硬件难以复现完整训练流程
  • 文档/社区待观察

适用场景

  • 学术研究:对比分析文本到视频生成模型结构
  • 创意内容:根据文案自动生成短视频素材
  • 教学演示:学习扩散模型在视频领域的应用

替代项目

VideoGPT、CogVideo、ModelScope Text-to-Video

项目介绍

make-a-video-pytorch 是视频领域的开源项目,由 lucidrains 开发,2022 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,988)位列前 30%,在视频分类的 473 个项目里位列前 13%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:学术研究:对比分析文本到视频生成模型结构。同类可对比的替代方案包括 VideoGPT、CogVideo、ModelScope Text-to-Video。

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09