clone-voice

上传声音样本,即刻克隆音色生成语音

clone-voice 是一个带 Web 界面的声音克隆工具,使用 Python 编写。它允许用户用自己的音色或任意声音来录制音频,核心能力包括声音克隆、语音合成(TTS)和语音转换(STS)。项目解决了普通用户难以使用专业声音克隆技术的问题,通过简单的 Web 操作即可实现个性化语音生成。其技术栈涵盖语音分析、克隆、合成等环节,适合内容创作者、配音爱好者等快速生成特定音色的语音内容。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8974
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队jianchang512
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型clonevoice,speech-analysis,sts,tts,voice-assistant
GitHub 星标★ 8974
30天Star增速
HF 下载量
上线时间2023-11-19 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数8

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 8 步

环境要求

  • Python 3.9 ~ 3.11
  • 已安装 git 工具(Windows 可用 git-cmd)
  • 稳定可靠的全局代理(需从 huggingface.co 与 github.com 下载大模型)
  • ffmpeg 可执行文件(需与 app.py 放在同一目录)
  • 可选:N 卡 GPU 并正确配置 CUDA 环境以获得加速

安装与启动步骤

  1. 1拉取源码

    新建空目录(如 E:/clone-voice),在该目录地址栏输入 cmd 回车后执行,把源码克隆到当前目录,注意结尾的点号表示当前目录。

    git clone git@github.com:jianchang512/clone-voice.git .
  2. 2创建虚拟环境

    在源码目录下创建独立的 Python 虚拟环境,避免污染系统环境,目录名为 venv。

    python -m venv venv
  3. 3激活虚拟环境

    Windows 下执行 venv 内的 activate 脚本;Linux/mac 对应改为 source venv/bin/activate。

    E:/clone-voice/venv/scripts/activate
  4. 4安装依赖

    按 requirements.txt 安装依赖。若使用 N 卡 CUDA 加速,再卸载 torch 并安装 cu121 版本。

    pip install -r requirements.txt --no-deps
    pip uninstall -y torch
    pip install torch torchaudio --index-url https://download.pytorch.org/whl/cu121
  5. 5放置 ffmpeg

    Windows 解压 ffmpeg.7z,把 ffmpeg.exe 放到与 app.py 同目录;Linux/mac 从官网下载并把 ffmpeg 二进制放到根目录。

  6. 6下载模型

    首次必须先运行此脚本,同意协议时输入 y,然后等待模型下载完成。全程需稳定代理,失败多为代理问题。

    python code_dev.py
  7. 7启动服务

    模型下载完成后再启动,程序会打开 Web 界面。每次启动都会检测或更新模型,请耐心等待。

    python app.py
  8. 8可选训练

    如需训练自己的模型,先在 param.json 中调整训练参数,然后执行训练脚本。

    python train.py

关键配置

配置项必填说明示例
HTTP_PROXY是在 .env 中设置代理,用于下载 huggingface/github 上的模型http://127.0.0.1:7890

如何确认成功

cmd 窗口出现启动提示且浏览器自动打开 Web 界面,窗口内无报错信息即表示启动成功。

常见问题

Q:必须要有 N 卡 GPU 吗?

A:不需要,没有 N 卡 GPU 也能使用;若机器有 N 卡并配置好 CUDA 环境,程序会自动使用 CUDA 加速。

Q:模型下载失败或中途中断怎么办?

A:基本都是代理问题,请在 .env 中设置 HTTP_PROXY 并保证全局代理稳定可靠;始终无法完整下载的建议改用 Windows 预编译版。

Q:提示 Downloading WavLM model 错误怎么办?

A:修改 venv/Lib/site-packages/aiohttp/client.py 约 535 行,在 if proxy is not None: 上方一行添加你的代理地址,如 proxy="http://127.0.0.1:10809"。

Q:录音多长、什么质量合适?

A:建议录制 5 秒到 20 秒,发音清晰准确、无背景噪声,可使用 mp3/wav/flac 格式。

Q:不想每次启动都检测更新模型怎么办?

A:手动修改 venv/Lib/site-packages/TTS/utils/manage.py 约 389 行 def download_model 方法,注释掉其中检查 md5 的那段代码。

注意事项

  • 源码版必须在 .env 中配置代理,模型需从 huggingface.co 和 github.com 下载,国内无法直接访问。
  • 模型为 coqui.ai 出品的 xtts_v2,遵循 Coqui Public Model License 1.0.0,使用即表示同意该协议。
  • Windows 用户若不想折腾源码,可直接下载预编译版(主文件 1.7G + 模型 3G),解压后把模型解压到软件目录下的 tts 文件夹,双击 app.exe 使用。
  • 源码版启动报错绝大多数是代理不稳导致模型下载不完整,建议优先使用预编译版。

核心亮点

  • 提供直观的 Web 界面,降低声音克隆使用门槛
  • 支持任意声音样本,灵活适配多种音色需求
  • 集成 TTS 和 STS,兼顾文本转语音与声音转换

不足之处

  • 音色克隆效果可能受样本质量影响,需较高质量音频
  • 文档/社区待观察

适用场景

  • 内容创作者快速生成个性化配音
  • 有声书或播客制作中模拟特定音色
  • 语音助手或游戏角色定制声音

替代项目

Coqui TTS、OpenVoice、So-VITS-SVC

项目介绍

clone-voice 是音频音乐领域的开源项目,由 jianchang512 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(8,974)位列前 6%,在音频音乐分类的 738 个项目里位列前 4%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:内容创作者快速生成个性化配音。同类可对比的替代方案包括 Coqui TTS、OpenVoice、So-VITS-SVC。

上一篇:gitpodcast

下一篇:tts-server-android

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09