finetrainers

用有限显存微调视频扩散模型,多卡也能跑

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1361
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队huggingface
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,art,artificial-intelligence,diffusers,diffusion,diffusion-models,pytorch,transformers
GitHub 星标★ 1361
30天Star增速
HF 下载量
上线时间2024-09-25 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-12
浏览次数0

项目介绍

finetrainers 是 Hugging Face 团队推出的扩散模型训练框架,专注于让视频与图像扩散模型(如 CogVideoX、Wan、Flux 等)的微调变得可扩展且省显存。它解决的核心问题是:扩散模型尤其是视频模型参数量大、训练时显存占用高,普通开发者难以在有限硬件上完成微调。项目通过分布式训练、序列并行、激活检查点、分片优化器状态等内存优化技术,把训练成本压到可接受范围。核心能力包括:支持多种主流扩散模型架构、LoRA 与全量微调、多卡并行训练、与 diffusers 生态无缝衔接,并提供训练脚本和配置示例。整体定位是给研究者和工程团队一个开箱即用、可横向扩展的扩散模型训练底座,而不是零散的单点脚本。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:进阶 约 20 分钟 部署方式:本地安装 5 步

环境要求

  • Python 环境(需可运行 pip 安装依赖)
  • Git(用于 clone 仓库和切换 tag)
  • 已安装 PyTorch 及相关依赖(requirements.txt 中指定)
  • 建议使用 diffusers main 分支(requirements 要求 diffusers>=0.32.1)
  • 足够的 GPU 显存用于扩散模型训练

安装与启动步骤

  1. 1克隆仓库

    把 finetrainers 源码下载到本地,进入项目目录后再执行后续安装。

    git clone https://github.com/huggingface/finetrainers.git
    cd finetrainers
  2. 2切换稳定版本

    main 分支是开发分支,README 建议使用最新稳定 release tag,例如 v0.2.0。

    git fetch --all --tags
    git checkout tags/v0.2.0
  3. 3安装依赖

    在项目根目录安装 requirements.txt 中列出的全部 Python 依赖包。

    pip install -r requirements.txt
  4. 4从源码装 diffusers

    README 要求从 GitHub 源码安装 diffusers,以获取最新特性和修复。

    pip install git+https://github.com/huggingface/diffusers
  5. 5查看版本说明

    按照对应 release tag 的 README 指引继续,获取该稳定版的具体训练用法。

如何确认成功

能成功导入 finetrainers 与 diffusers 且无报错,即说明基础环境安装完成。

常见问题

Q:应该用 main 分支还是 release tag?

A:README 明确说明 main 是开发分支,稳定性应依赖 release tag,因此建议 checkout 到最新稳定 tag(如 v0.2.0)。

Q:为什么一定要从源码安装 diffusers?

A:requirements 只要求 diffusers>=0.32.1,但 README 推荐使用 main 分支以获得最新功能和 bug 修复。

Q:安装依赖时版本冲突怎么办?

A:优先在干净虚拟环境(venv/conda)中安装,避免与其他项目的包版本互相影响。

注意事项

  • 项目处于 work-in-progress 阶段,接口和用法可能随版本变化。
  • README 节选未给出具体训练命令、配置文件与端口,实际训练参数请参考对应 release tag 的完整 README。
  • 视频扩散模型训练显存开销大,需评估自身硬件是否满足。

核心亮点

  • 针对视频扩散模型做了显存优化,序列并行和激活检查点让大模型能在有限显卡上训练
  • 与 Hugging Face diffusers 生态深度集成,模型加载、训练、保存流程统一,迁移成本低
  • 支持 LoRA 与全量微调、多卡分布式训练,配置化程度高,适合从实验到生产的扩展

不足之处

  • 项目仍处于早期快速迭代阶段,API 和配置格式可能变动,稳定性有待观察
  • 文档和社区案例相对有限,视频模型训练调参门槛较高,新手不易直接上手

适用场景

  • 在单卡或少量显卡上微调 CogVideoX、Wan 等视频扩散模型
  • 为特定风格或领域数据做 LoRA 微调,生成定制化视频内容
  • 研究团队做扩散模型训练方法对比与消融实验,需要统一训练框架

替代项目

kohya-ss/sd-scripts、huggingface/diffusers

上一篇:verl-omni

下一篇:Megatron-Bridge

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63550 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1314 2026-08-13