voicefixer

一键修复受损语音,去噪去混响去削波,让声音更清晰

VoiceFixer 是一个基于深度学习的通用语音修复工具,旨在恢复受损的语音信号,使其更清晰、更自然。它能够处理多种类型的语音退化,包括背景噪声、混响、削波(clipping)和低质量录音等。该项目采用两阶段架构:首先通过分析模块估计语音的时频掩码,然后利用神经声码器(如HiFi-GAN)重建干净的语音波形。VoiceFixer 提供了简单的 Python API,支持命令行和库调用,方便集成到现有音频处理流程中。它解决了语音增强领域中对多种退化类型同时处理的难题,尤其擅长处理削波等非线性失真,这是传统方法难以应对的。核心能力包括:语音去噪、去混响、去削波,以及提升整体语音质量。项目还提供了预训练模型和示例代码,降低了使用门槛。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1378
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队haoheliu
所属国家
定价模式free
价格说明开源项目,MIT许可证,可免费使用和自行部署。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型declipping,denoise,dereverberation,mel,speech,speech-analysis,speech-enhancement,speech-processing,speech-synthesis,super-resolution,tts,vocoder
GitHub 星标★ 1378
30天Star增速
HF 下载量
上线时间2021-09-06 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 7 步

环境要求

  • Python 环境(项目为 Python 包,含命令行与 Python API)
  • Streamlit(运行网页版界面 test/streamlit.py 需要)
  • Docker(使用容器方式运行需要,镜像约 10GB)
  • 首次运行需联网下载模型 checkpoint,耗时数分钟
  • 国内用户可改用百度网盘获取 checkpoint 文件

安装与启动步骤

  1. 1克隆项目仓库

    把 VoiceFixer 源码克隆到本地,后续的 streamlit、Docker 构建都在该目录内进行。

    git clone https://github.com/haoeheliu/voicefixer.git
  2. 2准备模型目录

    首次运行会自动下载模型;若下载困难,先建好目录,再手工放入两个 checkpoint 文件。

    mkdir -p ~/.cache/voicefixer/analysis_module/checkpoints ~/.cache/voicefixer/synthesis_module/44100
  3. 3放置离线权重

    vf.ckpt 放到 analysis_module/checkpoints,model.ckpt-1490000_trimed.pt 放到 synthesis_module/44100。

    cp vf.ckpt ~/.cache/voicefixer/analysis_module/checkpoints/
    cp model.ckpt-1490000_trimed.pt ~/.cache/voicefixer/synthesis_module/44100/
  4. 4启动网页界面

    在项目根目录运行 streamlit 界面;首次打开页面可能空白数分钟,正在后台下载模型。

    streamlit run test/streamlit.py
  5. 5构建 Docker 镜像

    Docker 镜像未发布,需本地构建,镜像名沿用 README 中的 voicefixer:cpu,体积约 10GB。

    docker build -t voicefixer:cpu .
  6. 6容器内跑 CLI

    挂载当前目录的 data 到容器内,用 --infile/--outfile/--mode 处理音频,mode 可填 0、1、2、all。

    docker run --rm -v "$(pwd)/data:/opt/voicefixer/data" voicefixer:cpu --infile data/my-input.wav --outfile data/my-output.mode-all.wav --mode all
  7. 7用脚本运行

    仓库自带 run.sh 封装命令,参数与 docker run 一致,适合快速重复调用。

    ./run.sh --infile data/my-input.wav --outfile data/my-output.mode-all.wav --mode all

关键配置

配置项必填说明示例
--infile是待修复的输入音频文件路径data/my-input.wav
--outfile是修复后输出 wav 文件路径data/my-output.mode-all.wav
--mode否运行模式:0 原始模型、1 加预处理、2 训练模式、all 全部all

如何确认成功

命令结束后在 outfile 指定路径生成修复后的 wav 文件;网页版处理完成后页面直接显示结果,首次加载前会空白数分钟用于下载模型。

常见问题

Q:网页打开后一直空白怎么办?

A:属于首次运行下载模型,可能空白数分钟;查看终端里的下载进度,下载完成后刷新即可。

Q:国内下载 checkpoint 很慢或失败?

A:可用 README 提供的百度网盘(提取密码 qis6)下载两个 checkpoint,再按路径放入 ~/.cache/voicefixer 下的对应目录。

Q:四个 mode 有什么区别?

A:0 为原始模型(默认推荐),1 增加预处理模块去掉高频,2 为训练模式(对严重退化的真实语音有时有效),all 会为每种模式各输出一个 wav。

Q:Docker 镜像为什么这么大?

A:依赖约 9.8GB,生成镜像约 10GB;但 voicefixer 层是最后添加的,改源码重建每次大约只需 200MB。

注意事项

  • Docker 镜像目前未发布,必须本地构建后才能运行 voicefixer:cpu。
  • 两个 checkpoint 的存放路径必须严格对应 analysis_module/checkpoints 与 synthesis_module/44100,否则无法加载模型。
  • README 中未给出 pip 安装命令,本文所有命令均来自 README 的实际示例,安装依赖请以仓库 Dockerfile 为准。

核心亮点

  • 同时处理噪声、混响、削波等多种退化,通用性强
  • 基于神经声码器重建,音质自然,优于传统滤波方法
  • 提供预训练模型和简单API,易于集成和二次开发

不足之处

  • 模型推理速度较慢,实时性不足,不适合低延迟场景
  • 对极端退化或非语音信号效果有限,文档/社区待观察

适用场景

  • 修复老旧录音或电话语音,提升可懂度
  • 为语音识别系统预处理,提高识别准确率
  • 音频后期制作中清理环境噪声和失真

替代项目

DeepFilterNet、FRCRN、Demucs

项目介绍

voicefixer 是音频音乐领域的开源项目,由 haoheliu 开发,2021 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,378)位列前 30%,在音频音乐分类的 738 个项目里位列前 14%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,可免费使用和自行部署。

它主要面向的使用场景是:修复老旧录音或电话语音,提升可懂度。同类可对比的替代方案包括 DeepFilterNet、FRCRN、Demucs。

上一篇:optispeech

下一篇:kokoro-web

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09