HunyuanCustom

多模态驱动,定制你的专属视频生成

HunyuanCustom 是一个基于多模态驱动的定制化视频生成架构,旨在解决现有视频生成模型难以对特定主体进行个性化控制的问题。它通过融合音频、图像和文本等多模态输入,实现对视频内容中主体外观、动作和场景的精细控制,支持图像到视频、音频驱动的视频编辑与生成。核心能力包括:利用扩散模型进行高质量视频合成,支持自定义主体身份保持,以及灵活的多模态条件注入。该项目为创意内容生产、影视预可视化、虚拟角色动画等场景提供了高效的工具,降低了专业视频制作的门槛。

开源 unknown 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1230
维护状态 低维护
是否开源
定价模式 unknown

项目数据

分类视频生成
开发团队Tencent-Hunyuan
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型audio-driven,diffusion-models,image-to-video,image-to-video-generation,video-editing,video-generation
GitHub 星标★ 1230
30天Star增速
HF 下载量
上线时间2025-05-07 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:高级 约 60 分钟 部署方式:本地安装 7 步

环境要求

  • Linux 系统,推荐 CUDA 12.4 或 11.8
  • 使用 Conda 管理环境并安装 PyTorch 等依赖(README 说明用 conda 安装)
  • 默认推理脚本按 8 卡运行(torchrun --nproc_per_node=8),低显存可用单卡脚本
  • 需自行下载模型权重并放到仓库下的 ./models 目录

安装与启动步骤

  1. 1克隆仓库

    把仓库克隆到本地并进入项目目录,后续所有命令都在该目录执行。

    git clone https://github.com/Tencent/HunyuanCustom.git
    cd HunyuanCustom
  2. 2准备 Conda 环境

    README 提示用 conda 安装 PyTorch 等依赖,但节选中该步命令被省略,需对照原 README 执行。

  3. 3安装 Python 依赖

    安装 requirements.txt 中列出的全部 pip 依赖。

    python -m pip install -r requirements.txt
  4. 4安装加速依赖

    先装 ninja,再安装 flash-attention v2.6.3,需 CUDA 11.8 及以上。

    python -m pip install ninja
    python -m pip install git+https://github.com/Dao-AILab/flash-attention.git@v2.6.3
  5. 5准备模型权重

    按 README 下载权重放到 ./models,例如 hunyuancustom_720P/mp_rank_00_model_states.pt。

  6. 6单主体视频生成

    8 卡运行 sample_batch.py,指定参考图、正负提示词与 720P 权重路径。

    cd HunyuanCustom
    export MODEL_BASE="./models"
    export PYTHONPATH=./
    torchrun --nnodes=1 --nproc_per_node=8 --master_port 29605 hymm_sp/sample_batch.py 
        --ref-image './assets/images/seg_woman_01.png' 
        --pos-prompt "Realistic, High-quality. A woman is drinking coffee at a café." 
        --neg-prompt "Aerial view, aerial view, overexposed, low quality, deformation, a poor composition, bad hands, bad teeth, bad eyes, bad limbs, distortion, blurring, text, subtitles, static, picture, black border." 
        --ckpt ${MODEL_BASE}"/hunyuancustom_720P/mp_rank_00_model_states.pt" 
        --video-size 720 1280 
        --seed 1024 
        --sample-n-frames 129 
        --infer-steps 30 
        --flow-shift-eval-video 13.0 
        --save-path './results/sp_720p'
  7. 7低显存运行

    显存不足时改用 sample_gpu_poor.py,开 CPU_OFFLOAD 并加载 fp8 权重,最低 8GB 显存。

    cd HunyuanCustom
    export MODEL_BASE="./models"
    export CPU_OFFLOAD=1
    export PYTHONPATH=./
    python hymm_sp/sample_gpu_poor.py 
        --ref-image './assets/images/seg_woman_01.png' 
        --pos-prompt "Realistic, High-quality. A woman is drinking coffee at a café." 
        --neg-prompt "Aerial view, aerial view, overexposed, low quality, deformation, a poor composition, bad hands, bad teeth, bad eyes, bad limbs, distortion, blurring, text, subtitles, static, picture, black border." 
        --ckpt ${MODEL_BASE}"/hunyuancustom_720P/mp_rank_00_model_states_fp8.pt" 
        --video-size 720 1280 
        --seed 1024 
        --sample-n-frames 129 
        --infer-steps 30 
        --flow-shift-eval-video 13.0 
        --save-path './results/cpu_720p' 
        --use-fp8 
        --cpu-offload

关键配置

配置项必填说明示例
MODEL_BASE模型权重所在目录,各推理命令的 ckpt 都基于它拼接./models
PYTHONPATH让脚本能导入仓库内的 hymm_sp 模块./
CPU_OFFLOAD低显存模式下把部分计算卸载到 CPU1
LD_LIBRARY_PATH出现浮点异常时指向 cublas 库路径/opt/conda/lib/python3.8/site-packages/nvidia/cublas/lib/

如何确认成功

运行结束后在 --save-path 指定目录(如 ./results/sp_720p)能看到生成的视频文件即成功。

常见问题

Q:运行时报 float point exception 或 core dump 怎么办?

A:README 给出方案:确认 CUDA 12.4、CUBLAS>=12.4.5.8、CUDNN>=9.00(或直接用官方 CUDA 12 镜像),并安装 nvidia-cublas-cu12==12.4.5.8、设置 LD_LIBRARY_PATH。

Q:显存不够能跑吗?

A:可以。README 说明单卡 8GB 显存即可运行,用 hymm_sp/sample_gpu_poor.py,设置 CPU_OFFLOAD=1 并加 --use-fp8、--cpu-offload,使用 fp8 权重。

Q:默认要几张卡?

A:示例使用 torchrun --nnodes=1 --nproc_per_node=8,即 8 卡;低显存脚本则是单进程 python 直接运行。

Q:视频编辑怎么提高人像姿态质量?

A:视频驱动编辑示例中可加 --pose-enhance(README 注释说明对人物视频启用可提升姿态生成质量),同时需提供 --input-video 与 --mask-video。

Q:Gradio 服务怎么启动?

A:README 节选中该章节被截断,只给出了 cd HunyuanCustom,完整启动命令请查看仓库原 README。

注意事项

  • 仅支持 Linux 手动安装,推荐 CUDA 12.4 或 11.8,flash-attention 需 CUDA 11.8 以上。
  • 模型权重的下载方式在节选中未给出,需按官方 README/HuggingFace 页面下载后放入 ./models。
  • 不同任务要换成对应 ckpt:单主体用 hunyuancustom_720P,编辑用 hunyuancustom_editing_720P,音频驱动用 hunyuancustom_audio_720P。
  • 音频驱动示例还用到了 --input-audio、--audio-strength、--audio-condition、--cfg-scale、--use-deepcache 等参数,可按需增删。

核心亮点

  • 支持音频、图像、文本多模态联合控制,生成视频更贴合创意意图
  • 基于扩散模型,视频生成质量高,主体一致性强
  • 提供图像到视频和视频编辑功能,应用场景灵活

不足之处

  • 项目尚在成长中,文档和社区生态有待完善
  • 对计算资源要求较高,普通用户部署门槛不低

适用场景

  • 影视预可视化与概念设计
  • 虚拟角色动画与数字人制作
  • 个性化营销视频快速生成

替代项目

AnimateDiff、VideoCrafter、ModelScope Text-to-Video

项目介绍

HunyuanCustom 是视频领域的开源项目,由 Tencent-Hunyuan 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,230)位列前 30%,在视频分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:影视预可视化与概念设计。同类可对比的替代方案包括 AnimateDiff、VideoCrafter、ModelScope Text-to-Video。

上一篇:VACE

下一篇:BLADE

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 334 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4266 2026-08-10