TurboDiffusion

出片快上百倍,画质依然在线

面向视频扩散模型的极致加速方案,通过蒸馏与优化实现 100~200 倍推理加速,在保持生成质量的同时大幅缩短出片时间,让高质量视频生成从离线走向实时成为可能。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3823
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队thu-ml
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai-infra,consistency-model,diffusion-models,distillation,inference-acceleration,mlsystem,rcm,sageattention,sparse-linear-attention,video-generation
GitHub 星标★ 3823
30天Star增速
HF 下载量
上线时间2025-12-06 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:进阶 约 30 分钟 部署方式:库/依赖 8 步

环境要求

  • Python >= 3.9(README 示例使用 3.12)
  • PyTorch >= 2.7.0,推荐 torch==2.8.0(更高版本可能导致 OOM)
  • 建议使用 NVIDA 显卡(加速数据基于单张 RTX 5090)
  • 下载模型权重/数据集前需安装 git lfs
  • 训练 rCM/SLA 需额外依赖 megatron-core、hydra-core、wandb、webdataset、transformer_engine

安装与启动步骤

  1. 1创建并激活环境

    用 conda 新建一个 Python 3.12 的独立环境,避免与系统环境冲突,随后激活该环境。

    conda create -n turbodiffusion python=3.12
    conda activate turbodiffusion
  2. 2pip 安装 TurboDiffusio

    官方推荐的安装方式,务必带上 --no-build-isolation 参数,否则编译可能失败。

    pip install turbodiffusion --no-build-isolation
  3. 3或从源码编译安装

    想改代码或参与训练时用源码方式:拉取仓库、同步子模块后用 -e 可编辑安装。

    git clone https://github.com/thu-ml/TurboDiffusion.git
    cd TurboDiffusion
    git submodule update --init --recursive
    pip install -e . --no-build-isolation
  4. 4安装 SageSLA 加速算子

    要启用基于 SageAttention 的快速 SLA 前向,必须先安装 SpargeAttn,同样需要 --no-build-isolation。

    pip install git+https://github.com/thu-ml/SpargeAttn.git --no-build-isolation
  5. 5安装训练额外依赖

    仅在做 rCM/SLA 训练时需要,普通推理可跳过;transformer_engine 需要单独指定 --no-build-isolation。

    pip install megatron-core hydra-core wandb webdataset
    pip install --no-build-isolation transformer_engine[pytorch]
  6. 6下载模型权重

    通过 HuggingFace 仓库克隆到 assets/checkpoints 目录,执行前请确认已安装 git lfs,否则大文件会缺失。

    git clone https://huggingface.co/worstcoder/Wan assets/checkpoints
  7. 7转换检查点格式

    FSDP2 依赖 Distributed Checkpoint,训练前需先把 .pth 教师权重转成 .dcp;训练后可用 scripts/dcp_to_pth.py 转回。

    python -m torch.distributed.checkpoint.format_utils torch_to_dcp assets/checkpoints/Wan2.1-T2V-1.3B.pth assets/checkpoints/Wan2.1-T2V-1.3B.dcp
  8. 8下载训练数据集

    只有需要训练时才下载,同样是 git lfs 大文件仓库,克隆到 assets/datasets 目录。

    git clone https://huggingface.co/datasets/worstcoder/Wan_datasets assets/datasets

如何确认成功

README 未给出推理启动命令;执行 pip show turbodiffusion 能显示包信息、且 assets/checkpoints 下有权重文件即表示安装与下载成功。

常见问题

Q:用中文提示词效果不好怎么办?

A:README 明确说明当前模型只在长英文提示词上训练,使用其他类型提示词时建议先做提示词增强(augment)再输入。

Q:pip 安装时报构建隔离相关的错误?

A:官方两条安装命令都带 --no-build-isolation,请务必保留该参数;源码安装同理,不要省略。

Q:该装哪个 PyTorch 版本?

A:要求 torch>=2.7.0,README 推荐 2.8.0,因为更高版本可能导致 OOM(显存不足)。

Q:克隆模型权重后文件很小或不全?

A:这是没装 git lfs 导致的,先安装并初始化 git lfs,再重新克隆 HuggingFace 上的 checkpoint 仓库。

Q:训练时加载检查点报格式错误?

A:FSDP2 使用 Distributed Checkpoint,需要先用 torch_to_dcp 命令把 .pth 教师权重转换为 .dcp 格式再开始训练。

注意事项

  • README 提示 checkpoints 和论文尚未定稿,后续会更新以提升质量。
  • 当前模型仅针对长英文提示词训练,其他语言或短提示词效果可能不佳。
  • 核心加速组件为 SageAttention、SLA(Sparse-Linear Attention)与 rCM 时间步蒸馏。
  • README 未提供推理/生成视频的运行命令与参数,实际使用请以仓库后续更新为准。

核心亮点

  • 提出RCM与稀疏线性层结合,实现100-200倍视频扩散模型加速,显著降低推理延迟
  • 集成SageAttention等优化技术,针对AI基础设施深度调优,工程化程度高
  • 基于一致性模型蒸馏,支持少步采样,在保持视频质量的同时大幅提升生成速度

不足之处

  • 文档/社区待观察
  • 加速效果可能依赖特定硬件(如GPU架构),通用性需进一步验证

适用场景

  • 实时视频生成与交互式创作,如短视频平台快速出片
  • 大规模视频内容批量生成,降低算力成本
  • 边缘设备或资源受限环境下的视频扩散模型部署

替代项目

Latent Consistency Models (LCM)、AnimateDiff、VideoFusion

项目介绍

TurboDiffusion 是基础设施领域的开源项目,由 thu-ml 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,823)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,606 增加到 3,823,净增 217。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:实时视频生成与交互式创作,如短视频平台快速出片。同类可对比的替代方案包括 Latent Consistency Models (LCM)、AnimateDiff、VideoFusion。

上一篇:SageAttention

下一篇:codeburn

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09