TokenFlow

用文本编辑视频,帧帧连贯不闪烁

TokenFlow 是 ICLR 2024 的官方 PyTorch 实现,用于实现基于扩散模型的视频编辑。它解决了文本到视频编辑中常见的时序不一致问题,即逐帧独立编辑会导致画面闪烁和内容漂移。TokenFlow 的核心创新在于利用扩散模型特征空间中的自注意力机制,将视频帧的噪声特征对齐到共享的“token”流上,从而在保持编辑内容的同时,确保帧间语义和外观的连贯性。项目提供完整的推理和训练代码,支持基于 Stable Diffusion 的文本引导视频编辑,可处理真实视频输入,并输出风格化或内容修改后的连贯视频。其核心能力包括:无需额外训练即可实现零样本视频编辑、支持多种编辑类型(如风格迁移、物体替换)、以及提供高质量的时间一致性保障。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1706
维护状态 低维护
是否开源
定价模式 free

项目数据

分类图像生成
开发团队omerbt
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型iclr2024,stable-diffusion,text-to-image,text-to-video,tokenflow,video-editing
GitHub 星标★ 1706
30天Star增速
HF 下载量
上线时间2023-07-20 00:00:00
最近更新2026-09-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目为官方 PyTorch 实现,开发语言为 Python)
  • PyTorch 深度学习框架
  • 一个预训练的文本到图像扩散模型(如 Stable Diffusion),用于提供扩散先验
  • 无需额外训练或微调,可直接做零样本视频编辑

安装与启动步骤

  1. 1获取项目源码

    从官方 GitHub 仓库克隆 TokenFlow 源码到本地,后续安装与运行都在该目录中进行。

    git clone https://github.com/omerbt/TokenFlow.git
  2. 2进入项目目录

    进入克隆下来的目录,并阅读完整 README 获取安装与运行说明(本节选未包含具体安装命令)。

    cd TokenFlow
  3. 3查阅官方运行文档

    README 节选只介绍了方法原理,未给出依赖安装与推理命令;请务必查看仓库完整说明与项目主页。

  4. 4准备预训练扩散模型

    按官方说明准备一个预训练的文本到图像扩散模型权重,TokenFlow 基于该模型完成文本引导的视频编辑。

如何确认成功

README 节选未提供运行命令与预期输出,无法据此验证;请以官方仓库完整说明为准。

常见问题

Q:使用 TokenFlow 需要自己训练模型吗?

A:不需要。README 明确说明它使用预训练的文本到图像扩散模型来完成一致的视频编辑,无需任何进一步的训练或微调。

Q:TokenFlow 能做什么?

A:做文本驱动的视频编辑,且帧间保持一致:给定源视频和目标文本,即可在不额外训练的情况下完成编辑,避免逐帧独立编辑带来的闪烁与内容漂移。

Q:为什么教程里没有具体的安装命令?

A:所提供的 README 节选只包含项目简介与摘要,未涉及安装、依赖和运行命令,因此只能给出通用准备动作,避免虚构包名和参数。

Q:依赖和版本怎么装?

A:README 节选未列出依赖清单与版本要求,请直接查看官方仓库的完整 README 与项目主页获取准确安装说明。

注意事项

  • 本教程严格依据所给 README 节选整理,节选中没有安装命令,故未编造任何 pip/conda/docker 指令。
  • 项目为 ICLR 2024 官方实现,具体环境、模型权重下载与推理脚本请以官方仓库 README 和项目主页为准。
  • 运行视频扩散编辑通常对显存有较高需求,实际硬件要求请参考官方说明。
  • 克隆仓库后可先通读 README,再决定具体安装与运行方式。

核心亮点

  • 零样本视频编辑,无需针对视频微调模型,开箱即用
  • 基于扩散模型特征对齐,时序一致性显著优于逐帧编辑
  • 支持多种编辑场景,如风格迁移、物体替换、属性修改

不足之处

  • 对输入视频的分辨率和长度有一定限制,处理长视频时内存消耗大
  • 依赖 Stable Diffusion 基础模型,编辑效果受限于基础模型的能力
  • 文档/社区待观察

适用场景

  • 影视后期:快速生成风格化视频片段或替换视频中的物体
  • 创意内容生成:将文本描述转换为连贯的视频内容,用于广告或社交媒体
  • 视频修复与增强:保持时序一致性的条件下,对视频进行色彩调整或细节增强

替代项目

Runway Gen-2、Deforum Stable Diffusion、Text2Video-Zero

项目介绍

TokenFlow 是视频领域的开源项目,由 omerbt 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,706)位列前 30%,在视频分类的 472 个项目里位列前 14%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:影视后期:快速生成风格化视频片段或替换视频中的物体。同类可对比的替代方案包括 Runway Gen-2、Deforum Stable Diffusion、Text2Video-Zero。

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 334 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4266 2026-08-10