sd-wav2lip-uhq

在 Stable Diffusion WebUI 里一键生成高清唇形同步数字人视频

sd-wav2lip-uhq 是一个为 Automatic1111 Stable Diffusion WebUI 开发的扩展,旨在将 Wav2Lip 唇形同步模型升级到超高画质(UHQ)水平。它解决了传统 Wav2Lip 生成视频时面部模糊、细节丢失的问题,通过集成 GFPGAN 和 CodeFormer 等面部修复模型,在保持唇形同步准确性的同时,显著提升输出视频的面部清晰度和真实感。该扩展直接嵌入 WebUI 界面,用户无需复杂命令行操作,即可在熟悉的图像生成工作流中完成音频驱动的数字人视频制作。其核心能力包括:基于音频输入自动生成与语音匹配的唇形动画、多级画质增强管线、以及灵活的模型切换选项。项目主要面向数字人、视频配音、内容创作等场景,帮助创作者快速生成口型精准且画质逼真的虚拟人物视频。

开源 free 数字人3D
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1423
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类数字人3D
开发团队numz
所属国家
官网地址
定价模式free
价格说明开源项目,基于Apache-2.0许可证,可免费使用和修改,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型audio-driven-talking-face,deep-fake,deep-fakes,face-swapping,faceswap,image-animation,lip-sync,lipsync,meta-human-creator,stable-diffusion-web-ui,stable-diffusion-webui,stable-diffusion-webui-plugin,talking-face,talking-face-generation,talking-head,wav2lip
GitHub 星标★ 1423
30天Star增速
HF 下载量
上线时间2023-08-03 00:00:00
最近更新2026-09-02 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数8

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 7 步

环境要求

  • 已安装并可正常启动的 Automatic1111 Stable Diffusion WebUI
  • Windows 用户需安装 Visual Studio,并在安装时勾选 Python 和 C++ 组件(Face Swap 功能需要)
  • 准备好包含人脸的视频文件(avi 或 mp4)以及音频文件(或使用内置 bark 文本转语音)
  • 预留足够磁盘空间下载 Wav2Lip、s3fd、Dlib 关键点、inswapper 等模型权重文件

安装与启动步骤

  1. 1启动 WebUI

    先确认 Automatic1111 WebUI 能正常打开,扩展安装与 Wav2Lip UHQ 标签页都依赖它运行。

  2. 2安装 Visual Studio

    仅 Windows 需要:安装 Visual Studio,务必勾选 Python 和 C++ 组件,否则 Face Swap 无法运行。

  3. 3从 URL 安装扩展

    进入 WebUI 的 extensions(扩展)标签页,在 “Install from URL” 输入框粘贴本项目仓库地址,点击 Install,等待安装完成。

  4. 4应用并退出重启

    切到扩展页的 “Installed” 标签,点击 “Apply and quit”,然后重新启动 Automatic1111 使扩展生效。

  5. 5下载模型权重

    按 README 表格逐个下载 Wav2Lip、Wav2Lip+GAN、s3fd、Dlib 68 点关键点、inswapper_128.onnx,并放入表中所列的对应目录。

  6. 6按目录放置权重

    Wav2Lip 两个权重放入 extensions/sd-wav2lip-uhq/scripts/wav2lip/checkpoints/,s3fd 放入 face_detection/detection/sfd/s3fd.pth,关键点模

  7. 7打开标签页生成

    重启后在 WebUI 中找到 “Wav2Lip UHQ” 标签,选择带人脸的视频、音频或 bark 文本转语音,设置参数后开始生成;Face Swap 耗时较久需耐心等待。

关键配置

配置项必填说明示例
Wav2Lip checkpoint是选择用于唇形同步的模型权重,可为 Wav2Lip 或 Wav2Lip+GANWav2Lip + GAN
Face Index否参考图中存在多张人脸时,选择用于换脸的那一张0
Padding否调整嘴部移动位置,默认值通常可用,嘴位不对时再调默认值
Resize Factor否视频缩放系数,视频尺寸过大时可调小以提高速度1.0
Code Former Fidelity否0 画质更高但可能改变面部并闪烁,1 画质较低但更稳定0.5
Temperature否bark 文本转语音的随机性,0.7 是 bark 默认值0.7

如何确认成功

重新启动 Automatic1111 后,在界面顶部标签中能看到 “Wav2Lip UHQ” 标签页,即表示扩展安装成功。

常见问题

Q:安装后看不到 Wav2Lip UHQ 标签页怎么办?

A:README 说明需要重启 Automatic1111;若仍看不到,请确认已在扩展的 Installed 标签点击 Apply and quit 后重新启动 WebUI。

Q:视频只有一帧没有检测到人脸会怎样?

A:README 指出只要视频中有一帧没有人脸,整个处理就会失败,所以请选用全程都能检测到人脸的视频。

Q:avi 文件在 Video input 里看不到怎么办?

A:README 说明 avi 文件不会出现在视频输入列表中,但处理依然可以正常工作,可直接填入或选用后再执行。

Q:bark 生成的音频太短怎么加长?

A:bark 单次只能生成约 14 秒音频,长文本需用 [split] 分段,例如 “第一部分 [split] 第二部分” 来生成更长语音。

Q:换脸或修复后面部闪动、变化较大怎么办?

A:可调整 Code Former Fidelity:0 画质更高但可能改变面部并造成帧间闪烁,1 画质较低但更稳定;Mask Blur 建议不超过 Mouth Mask Dilate。

注意事项

  • 模型权重必须放对目录,README 特别提醒注意文件名,尤其是 s3fd。
  • 显存小于 16GB 的显卡在使用 bark 时应勾选 Low VRAM(默认已启用)。
  • Face Swap 处理耗时较长,需要耐心等待,不要中途关闭界面。
  • 输入视频需为人脸清晰的 avi 或 mp4 文件,否则处理会失败。

核心亮点

  • 直接集成 Automatic1111 WebUI,无需单独部署环境,上手门槛低
  • 内置 GFPGAN/CodeFormer 多级修复,显著提升唇部区域清晰度,避免传统 Wav2Lip 的模糊感
  • 支持自定义模型权重和参数,可灵活适配不同人脸和视频场景

不足之处

  • 依赖 Automatic1111 WebUI,无法独立运行,使用范围受限
  • 高分辨率处理时对显存和计算资源要求较高,低配设备可能卡顿

适用场景

  • 数字人视频制作:为虚拟主播或角色生成与语音同步的逼真口型
  • 视频配音/翻译:替换原视频人物口型以匹配新语言配音
  • 内容创作:快速生成教学、娱乐等视频中的说话人物动画

替代项目

Wav2Lip、SadTalker、VideoRetalking

项目介绍

sd-wav2lip-uhq 是视频领域的开源项目,由 numz 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,423)位列前 30%,在视频分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-02。基于Apache-2.0许可证,可免费使用和修改,无付费版本。

它主要面向的使用场景是:数字人视频制作:为虚拟主播或角色生成与语音同步的逼真口型。同类可对比的替代方案包括 Wav2Lip、SadTalker、VideoRetalking。

上一篇:lipsync

下一篇:NarratoAI

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09