HunyuanVideo-1.5

小模型也能出大片,画质一点不缩水

腾讯混元推出的领先轻量级视频生成模型,在保持高画质的前提下大幅压缩模型规模与推理成本,支持高效文生视频,适合资源受限环境下的部署与应用。

开源 unknown 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4562
维护状态 低维护
是否开源
定价模式 unknown

项目数据

分类视频生成
开发团队Tencent-Hunyuan
所属国家
定价模式unknown
价格说明官网提供在线视频生成体验,但具体定价信息未明确,需进一步确认。
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型image-to-video,text-to-video,video-generation
GitHub 星标★ 4562
30天Star增速
HF 下载量
上线时间2025-11-20 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 8 步

环境要求

  • Python 环境,可执行 pip / torchrun 命令
  • NVIDIA GPU(README 称仅 8.3B 参数、可在消费级 GPU 上流畅运行)
  • 可访问 GitHub 与 PyPI 的网络(部分注意力库需从源码编译安装)
  • 预先下载好的 HunyuanVideo-1.5 预训练模型权重路径

安装与启动步骤

  1. 1获取项目代码

    把官方仓库克隆到本地并进入目录。README 正文的安装说明从 Step 2 开始,Step 1 未在节选中给出。

    git clone https://github.com/Tencent-Hunyuan/HunyuanVideo-1.5.git
    cd HunyuanVideo-1.5
  2. 2安装基础依赖

    安装 requirements.txt 中的全部依赖,并额外升级腾讯云 SDK 的 Python 包(README 指定了腾讯镜像源)。

    pip install -r requirements.txt
    pip install -i https://mirrors.tencent.com/pypi/simple/ --upgrade tencentcloud-sdk-python
  3. 3安装 Flash Attention

    用于加速推理并降低显存占用。README 只给出官方仓库链接,未给出具体命令,请按该仓库说明安装。

  4. 4安装 Flex-Block-Attent

    仅稀疏注意力(sparse attention)需要,可加快推理。需先克隆仓库并初始化子模块再编译安装。

    git clone https://github.com/Tencent-Hunyuan/flex-block-attn.git
    cd flex-block-attn
    git submodule update --init --recursive
    python3 setup.py install
  5. 5安装 SageAttention

    启用 SageAttention 可加速推理,但会自动禁用 Flex-Block-Attention,二者不要同时指望生效。

    git clone https://github.com/cooper1637/SageAttention.git
    cd SageAttention
    export EXT_PARALLEL=4 NVCC_APPEND_FLAGS="--threads 8" MAX_JOBS=32
    python3 setup.py install
  6. 6安装 SGL-Kernel

    用于在 transformer 中启用 fp8 gemm,README 指定了固定版本号 0.3.18。

    pip install sgl-kernel==0.3.18
  7. 7运行推理生成视频

    用 torchrun 多卡并行执行 generate.py,通过环境变量控制加速与画质开关,需先准备好提示词、模型与输出路径。

    export N_INFERENCE_GPU=8
    export PROMPT="一只小猫在草地上奔跑"
    export IMAGE_PATH=/your/path/input.jpg
    export RESOLUTION=720p
    export ASPECT_RATIO=16:9
    export SEED=42
    export MODEL_PATH=/your/path/ckpts
    export OUTPUT_PATH=/your/path/outputs
    torchrun --nproc_per_node=$N_INFERENCE_GPU generate.py 
      --prompt "$PROMPT" 
      --image_path $IMAGE_PATH 
      --resolution $RESOLUTION 
      --aspect_ratio $ASPECT_RATIO 
      --seed $SEED 
      --rewrite $REWRITE 
      --cfg_distilled $CFG_DISTILLED 
      --enable_step_distill $ENABLE_STEP_DISTILL 
      --sparse_attn $SPARSE_ATTN --use_sageattn $SAGE_ATTN 
      --enable_cache $ENABLE_CACHE --cache_type $CACHE_TYPE 
      --overlap_group_offloading $OVERLAP_GROUP_OFFLOADING 
      --sr $ENABLE_SR --save_pre_sr_video 
      --output_path $OUTPUT_PATH 
      --model_path $MODEL_PATH
  8. 8用 Diffusers 调用

    不跑本仓库脚本时,可直接用 Hugging Face Diffusers 的 HunyuanVideo15Pipeline 加载在线权重生成视频。

    import torch
    from diffusers import HunyuanVideo15Pipeline
    from diffusers.utils import export_to_video
    
    dtype = torch.bfloat16
    device = "cuda:0"
    prompt = "一只小猫在草地上奔跑"
    seed = 42
    
    pipe = HunyuanVideo15Pipeline.from_pretrained("hunyuanvideo-community/HunyuanVideo-1.5-Diffusers-720p_t2v", torch_dtype=dtype)
    pipe.enable_model_cpu_offload()
    pipe.vae.enable_tiling()
    
    generator = torch.Generator(device=device).manual_seed(seed)
    
    video = pipe(
        prompt=prompt,
        generator=generator,
        num_frames=121,
        num_inference_steps=50,
    ).frames[0]
    
    export_to_video(video, "output.mp4", fps=24)

关键配置

配置项必填说明示例
N_INFERENCE_GPU并行推理使用的 GPU 数量,决定 torchrun 的进程数8
CFG_DISTILLED使用 CFG 蒸馏模型推理,可提速约 2 倍true
SAGE_ATTN启用 SageAttention 加速,会禁用 Flex-Block-Attentiontrue
SPARSE_ATTN启用稀疏注意力,仅 720p 模型支持且需装 flex-block-attnfalse
CACHE_TYPE配合 ENABLE_CACHE 使用,可选 deepcache/teacache/taylorcachedeepcache
ENABLE_STEP_DISTILL启用步数蒸馏模型,480p I2V 推荐 8 或 12 步,最高 6 倍加速true

如何确认成功

运行结束后,在 --output_path 指定目录可看到生成的视频文件;Diffusers 方式会导出 output.mp4。

常见问题

Q:SageAttention 和 Flex-Block-Attention 能同时用吗?

A:不能。README 明确说明启用 SageAttention 会自动禁用 Flex-Block-Attention,二者按需二选一。

Q:稀疏注意力为什么没生效?

A:只有 720p 模型配备稀疏注意力,且必须已成功安装 flex-block-attn,否则 SPARSE_ATTN 无法发挥作用。

Q:CFG 蒸馏模型应该跑多少步?

A:README 特别提醒,官方提供的 cfg distilled 模型必须使用 50 步才能生成正确结果。

Q:480p I2V 想更快该怎么办?

A:启用步数蒸馏模型(ENABLE_STEP_DISTILL=true),推荐 8 或 12 步,最高可带来 6 倍加速。

Q:提示词改写(REWRITE)打开后报错?

A:该开关要求已部署并配置好 rewrite 的 vLLM 服务,未部署时请保持关闭。

注意事项

  • 不同模型的最优 CFG scale、flow shift、推理步数不同,请对照 README 的 Optimal Inference Configurations 表格设置。
  • Flash Attention 只用于加速和降低显存,README 未给出安装命令,需按官方仓库文档自行安装。
  • OVERLAP_GROUP_OFFLOADING 仅在启用 group offloading 时有效,会显著增加 CPU 内存占用但加快推理。
  • 仓库还提供 train.py 训练脚本,支持单卡与 torchrun 多卡训练,可用 --pretrained_model_root 指定权重目录。

核心亮点

  • 轻量化设计,支持高效视频生成,适合资源受限场景
  • 支持文生视频和图生视频双模式,覆盖主流创作需求
  • 基于腾讯Hunyuan大模型生态,技术积累深厚,生成质量有保障

不足之处

  • 文档/社区待观察

适用场景

  • 短视频内容快速生成与编辑
  • 广告创意素材制作
  • 影视预演与概念可视化

替代项目

CogVideo、ModelScope Text-to-Video、AnimateDiff

项目介绍

HunyuanVideo-1.5 是视频领域的开源项目,由 Tencent-Hunyuan 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,562)位列前 10%,在视频分类的 472 个项目里位列前 7%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。官网提供在线视频生成体验,但具体定价信息未明确,需进一步确认。从国内网络环境看,可直接访问。

它主要面向的使用场景是:短视频内容快速生成与编辑。同类可对比的替代方案包括 CogVideo、ModelScope Text-to-Video、AnimateDiff。

上一篇:VideoCrafter

下一篇:lingbot-world

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 334 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4266 2026-08-10