transframer-pytorch

用 U-Net+Transformer 生成 30 秒连贯视频

Transframer-pytorch 是 DeepMind 提出的 Transframer 架构的非官方 PyTorch 实现,用于生成最长 30 秒的视频。它结合了 U-Net 和 Transformer 两种主流架构,利用注意力机制捕捉时序依赖,通过自回归方式逐帧预测未来帧。该项目解决了传统视频生成模型难以处理长序列、计算开销大、连贯性差的问题,核心能力包括基于条件帧的预测、多帧联合生成以及灵活的输入输出配置。作为早期研究代码,它提供了清晰的模块化设计,便于研究者复现论文实验或在此基础上进行二次开发。不过,项目尚处于早期阶段,未提供预训练权重,实际使用需要自行训练,且对计算资源要求较高。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 73
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队lucidrains
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型artificial-intelligence,attention-mechanisms,deep-learning,transformers,unet,video-generation
GitHub 星标★ 73
30天Star增速
HF 下载量
上线时间2022-08-17 00:00:00
最近更新2026-08-12 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 完整复现 DeepMind 论文架构,代码结构清晰,便于研究对比
  • 支持长视频生成(最长 30 秒),突破常见模型短片段限制
  • 模块化设计,U-Net 与 Transformer 可独立替换,方便实验扩展

不足之处

  • 未提供预训练权重,需从零训练,成本高
  • 文档较少,示例和教程不完善,上手门槛较高

适用场景

  • 学术研究:复现论文实验,探索长视频生成新方法
  • 创意内容:生成短视频片段,辅助动画或特效预演
  • 数据增强:为合成数据集生成连续帧,用于训练其他模型

替代项目

VideoGPT、CogVideo、NUWA

项目介绍

transframer-pytorch 是视频领域的开源项目,由 lucidrains 开发,2022 年首次发布。

它收录于视频分类,该分类目前共有 473 个项目,GitHub 星标数为 73。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-12。MIT许可证,完全免费,需自行部署。

它主要面向的使用场景是:学术研究:复现论文实验,探索长视频生成新方法。同类可对比的替代方案包括 VideoGPT、CogVideo、NUWA。

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09