voice-pro

一站式网页工具,轻松搞定语音合成、克隆与处理

voice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片化问题,提供了一站式的解决方案。核心能力包括:基于 Edge-TTS 和 kokoro 的高质量文本转语音(TTS),支持多种语言和声音;基于 E2、F5-TTS 和 CosyVoice 的零样本声音克隆,只需几秒音频即可复制音色;集成 Whisper 进行语音识别和音频转写;支持 YouTube 视频下载、Demucs 人声分离和音轨分离,以及多语言翻译。用户可以通过直观的网页界面轻松完成从素材获取、语音处理到内容生成的全流程,适用于制作播客、有声书、卡拉OK字幕、多语言配音等场景。项目代码开源,基于 Python 构建,便于二次开发和集成。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 12911
维护状态 维护中
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队abus-aikorea
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议GPL-3.0
主要语言Python
技术栈/模型audiobook,faster-whisper,gradio,karaoke,podcasts,speech-recognition,speech-synthesis,speech-to-text,subtitles,text-to-speech,transcription,translator,tts,voice-cloning,voice-conversion,webui,whisper,whisperx,yt-dlp
GitHub 星标★ 12911
30天Star增速
HF 下载量
上线时间2024-07-29 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 30 分钟 部署方式:本地安装 4 步

环境要求

  • Windows 系统(README 标注平台为 Windows,Mac/Linux 用 configure.sh 和 start.bat 对应脚本)
  • 首次运行需联网下载 uv、Python 3.12、依赖和约 10GB AI 模型
  • 建议预留充足磁盘空间(模型约 10GB 以上)
  • 可选:管理员权限运行 configure.bat 以系统级安装 git 和 ffmpeg,无管理员权限可跳过
  • 可选:NVIDIA GPU 可加速,无 GPU 时自动使用 CPU

安装与启动步骤

  1. 1运行环境配置脚本

    可选步骤,需管理员权限,仅运行一次,用于系统级安装 git 和 ffmpeg;无管理员权限可跳过,start.bat 会自动下载便携版 ffmpeg。

    configure.bat
  2. 2启动 Voice-Pro

    启动 WebUI。首次运行自动下载 uv + Python 3.12 并安装依赖,随后下载约 10GB AI 模型,耗时较长,请耐心等待。

    start.bat
  3. 3指定 GPU 或 CPU

    程序会自动检测 GPU/CPU。如需强制指定,可在启动前设置 GPU_CHOICE 环境变量,G 为 NVIDIA,C 为 CPU。

    set GPU_CHOICE=G
    start.bat
  4. 4手动打开浏览器

    若浏览器未自动打开,关闭 Windows 命令窗口后重新运行 start.bat;或手动打开浏览器,输入命令行窗口中显示的地址。

关键配置

配置项必填说明示例
GPU_CHOICE否强制指定使用 NVIDIA GPU 还是 CPU 运行G

如何确认成功

命令行窗口显示访问地址(如 http://127.0.0.1:7870),浏览器打开该地址即可看到 WebUI 界面。

常见问题

Q:首次启动卡住很久正常吗?

A:正常。首次运行要下载 uv、Python 3.12、全部依赖,以及约 10GB 的 AI 模型,这一步最慢,请保持网络畅通并耐心等待。

Q:没有管理员权限能装吗?

A:可以。跳过 configure.bat 即可,start.bat 会自动下载便携版 ffmpeg,不影响使用。

Q:启动出问题怎么办?

A:删除 installer_files 文件夹后重新运行 start.bat 重试。

Q:怎么切换到 CPU 运行?

A:设置环境变量 GPU_CHOICE=C,或删除 installer_filesgpu_choice.txt 后重新启动。

Q:怎么卸载?

A:运行 uninstall.bat 或直接删除整个文件夹(便携安装);加 silent 参数可静默卸载,model/ 和 workspace/ 目录会被保留。

注意事项

  • README 仅提供 Windows 平台的 configure.bat / start.bat 流程,Mac/Linux 需使用 configure.sh 和 start.sh,具体命令 README 未给出
  • configure.bat 为可选步骤,缺少管理员权限时跳过即可
  • 模型下载约 10GB,建议在网络稳定、磁盘充足的环境下首次运行
  • 卸载只删除 installer_files 文件夹,model/ 与 workspace/ 中的个人数据会保留

核心亮点

  • 集成 Edge-TTS、kokoro 等主流 TTS 引擎,开箱即用多种高质量语音
  • 支持零样本声音克隆(E2/F5/CosyVoice),几秒音频即可复刻音色
  • 内置 Whisper 转写、Demucs 人声分离和 YouTube 下载,音频处理全流程覆盖

不足之处

  • 依赖多个外部服务和模型,首次配置和模型下载较繁琐
  • 文档/社区待观察

适用场景

  • 播客制作:快速生成主播配音或克隆嘉宾声音
  • 有声书与多语言内容:批量合成多语言音频并翻译
  • 视频创作者:下载视频、分离人声、生成字幕或配音

替代项目

Coqui TTS、OpenVoice、Bark

项目介绍

voice-pro 是音频音乐领域的开源项目,由 abus-aikorea 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(12,911)位列前 4%,在音频音乐分类的 738 个项目里位列前 3%。

近 41 天,它的 GitHub 星标从 12,290 增加到 12,911,净增 621。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:播客制作:快速生成主播配音或克隆嘉宾声音。同类可对比的替代方案包括 Coqui TTS、OpenVoice、Bark。

上一篇:supertonic

下一篇:espeak-ng

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09