HunyuanVideo-Foley

看视频自动配音,让无声画面瞬间有真实的声音。

HunyuanVideo-Foley 是腾讯混元团队开源的多模态扩散模型,用于从视频内容自动生成高保真度的拟音音频(Foley Sound)。它解决了视频后期制作中人工配音耗时耗力的问题,能够根据视频画面中的动作、场景和物体,自动生成与之匹配的脚步声、碰撞声、环境音等。其核心能力在于多模态表示对齐技术,将视觉信息与音频生成模型有效融合,确保生成的音频与视频在时间、语义和物理属性上高度一致。项目基于扩散模型架构,支持文本到音频、视频到音频以及文本+视频到音频等多种输入模式,为视频创作者、游戏开发者、影视后期人员提供了高效的音频生成工具。

开源 unknown 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1056
维护状态 低维护
是否开源
定价模式 unknown

项目数据

分类视频生成
开发团队Tencent-Hunyuan
所属国家
定价模式unknown
价格说明开源项目,需自行部署,无在线服务。官网为腾讯混元视频页面,未明确该项目的定价信息。
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型aigc-audio,foley-art,foley-sound-synthesis,text-to-audio,text-to-video,text-video-to-audio,tta,video-to-audio
GitHub 星标★ 1056
30天Star增速
HF 下载量
上线时间2025-08-15 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 4 步

环境要求

  • Linux 系统(官方主要支持)
  • Python 3.8+
  • CUDA 12.4 或 11.8(推荐)
  • 显存:XXL 模型 20GB,XL 模型 16GB;启用 offload 可降至 12GB / 8GB
  • 建议使用 Conda 管理 Python 环境

安装与启动步骤

  1. 1获取项目代码

    将 HunyuanVideo-Foley 仓库下载或克隆到本地目录;README 未给出克隆命令,请自行获取代码。

  2. 2安装依赖

    在项目根目录执行,安装 requirements.txt 中列出的 Python 依赖;建议先建好 Conda 环境。

    pip install -r requirements.txt
  3. 3启动界面

    运行 Gradio 应用,终端会输出本地访问 URL,浏览器打开即可生成拟音音频。

    python3 gradio_app.py
  4. 4低显存启动

    显存不足时启用 offload,XXL 模型可降至 12GB、XL 模型降至 8GB 显存运行。

    ENABLE_OFFLOAD=true python3 gradio_app.py

关键配置

配置项必填说明示例
ENABLE_OFFLOAD启用卸载以降低显存占用,显存不足时使用true

如何确认成功

启动后终端会输出本地 URL,浏览器打开出现 Gradio 界面并能上传视频生成音频即成功。

常见问题

Q:显存不够怎么办?

A:使用 ENABLE_OFFLOAD=true python3 gradio_app.py 启动,XXL 模型显存需求可降到 12GB,XL 模型可降到 8GB。

Q:支持 Windows 或 macOS 吗?

A:README 标注 OS 为 Linux(primary support),Windows 与 macOS 未明确支持,建议在 Linux 上部署。

Q:依赖安装失败如何排查?

A:确认 Python 3.8+ 且 CUDA 为 12.4 或 11.8,推荐用 Conda 建独立环境后重新执行 pip install -r requirements.txt。

Q:不想本地部署有在线体验入口吗?

A:README 提供了 HuggingFace Demo 空间 tencent/HunyuanVideo-Foley,可直接在线试用。

注意事项

  • README 仅给出 Step 2 环境安装与启动命令,第一步获取代码未给出具体命令。
  • 模型权重见 HuggingFace 仓库 tencent/HunyuanVideo-Foley,具体下载方式 README 未说明。
  • 项目支持文本到音频、视频到音频、文本+视频到音频多种输入模式。
  • 官方 Demo:https://huggingface.co/spaces/tencent/HunyuanVideo-Foley

核心亮点

  • 多模态表示对齐技术,生成的音频与视频画面在时间和语义上高度同步,效果逼真。
  • 支持文本、视频、文本+视频多种输入方式,灵活适配不同创作场景。
  • 基于腾讯混元大模型生态,技术成熟度高,且有官方开源权重和推理代码。

不足之处

  • 对视频中复杂声源(如多人对话、嘈杂背景)的分离能力有限,可能产生混叠声音。
  • 生成音频的采样率和时长受限于模型设计,长视频或高音质需求可能需额外处理。
  • 文档/社区待观察

适用场景

  • 影视后期制作中,为无声视频自动添加环境音和动作音效,提升制作效率。
  • 游戏开发中,根据游戏场景和角色动作实时生成动态音效,增强沉浸感。
  • 短视频创作者为素材快速匹配背景音,降低音频编辑门槛。

替代项目

AudioLDM、Make-An-Audio、Diff-Foley

项目介绍

HunyuanVideo-Foley 是音频音乐领域的开源项目,由 Tencent-Hunyuan 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,056)位列前 30%,在音频音乐分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。需自行部署,无在线服务。官网为腾讯混元视频页面,未明确该项目的定价信息。

它主要面向的使用场景是:影视后期制作中,为无声视频自动添加环境音和动作音效,提升制作效率。同类可对比的替代方案包括 AudioLDM、Make-An-Audio、Diff-Foley。

上一篇:lyrictor

下一篇:edge-tts

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09