GPT-SoVITS

录一分钟声音,AI 就能用你的声音读任何文字

仅需 1 分钟语音数据即可训练出高质量 TTS 模型的少样本声音克隆方案。集成语音识别、文本转语音与声音转换能力,训练与推理全流程自动化,让个人也能轻松打造专属 AI 声线,广泛应用于配音与语音克隆场景。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 62048
维护状态 维护中
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队RVC-Boss
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型text-to-speech,tts,vits,voice-clone,voice-cloneai,voice-cloning
GitHub 星标★ 62048
30天Star增速
HF 下载量
上线时间2024-01-14 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 8 步

环境要求

  • 已安装 Conda(用于创建 python=3.10 环境)
  • Python 3.10
  • FFmpeg(含 ffprobe)
  • Windows 用户需安装 Visual Studio 2017 运行库 vc_redist.x86.exe
  • Docker 部署需已装 Docker 与 Docker Compose

安装与启动步骤

  1. 1创建 Conda 环境

    新建名为 GPTSoVits 的 Python 3.10 环境并激活,后续所有安装与运行都在该环境内进行。

    conda create -n GPTSoVits python=3.10
    conda activate GPTSoVits
  2. 2安装 Python 依赖

    先装 extra-req.txt(加 --no-deps 避免覆盖依赖),再装 requirements.txt,两条都要执行。

    pip install -r extra-req.txt --no-deps
    pip install -r requirements.txt
  3. 3安装 FFmpeg

    按系统选择:Conda 用户用 conda 安装;Ubuntu/Debian 用 apt 并装 libsox-dev;MacOS 用 brew;Windows 手动放 ffmpeg.exe 与 ffprobe.exe 到项目根目录。

    conda activate GPTSoVits
    conda install ffmpeg
  4. 4准备项目根目录

    切换到 GPT-SoVITS 项目根目录并拉取最新代码;Docker Compose 会挂载当前目录下的所有文件。

  5. 5构建 Docker 镜像

    可选方式。--cuda 后接 12.6 或 12.8,加 --lite 得到不含 ASR 与 UVR5 模型的精简镜像。

    bash docker_build.sh --cuda 12.6 --lite
  6. 6进入运行中的容器

    容器在后台运行后,用 docker exec 进入对应镜像标签的 bash,标签需与所选 CUDA 版本和 Lite 与否一致。

    docker exec -it GPT-SoVITS-CU126-Lite bash
  7. 7命令行跑 ASR(可选)

    不打开浏览器也能做数据集 ASR,-l 指定语言,中英日韩及自动检测默认走 Fun-ASR-Nano。

    python tools/asr/funasr_asr.py -i /your/path/input -o /your/path/output -l zh
  8. 8命令行跑 UVR5(可选)

    用命令行打开 UVR5 的 WebUI,依次传入推理设备、是否半精度、UVR5 的 WebUI 端口。

    python tools/uvr5/webui.py "cuda" True "9873"

关键配置

配置项必填说明示例
shm_sizeDocker Compose 共享内存大小,Windows Docker Desktop 默认过小易出异常,按内存适当调大16g
--cudadocker_build.sh 的构建参数,指定 CUDA 版本12.6
--lite构建精简镜像,不含 ASR 与 UVR5 模型,UVR5 模型需手动下载--lite

如何确认成功

执行 docker exec -it GPT-SoVITS-CU126 bash 能进入容器,说明容器已在后台运行;本地安装则 conda activate GPTSoVits 无报错、依赖安装完成即环境就绪。

常见问题

Q:Windows 上 Docker 运行异常怎么办?

A:Docker Desktop 默认共享内存较小,按系统可用内存把 Compose 里的 shm_size 调大,例如改为 16g。

Q:国内有没有在线体验方式?

A:有,README 提供 AutoDL Cloud Docker 入口,可在线体验完整功能,无需本地部署。

Q:Lite 镜像和完整镜像有什么区别?

A:Lite 镜像不包含 ASR 模型和 UVR5 模型,UVR5 模型需手动下载,ASR 模型程序会按需自动下载。

Q:Docker 镜像版本和代码不一致怎么办?

A:镜像发布周期慢于代码,先到 Docker Hub 查看最新镜像标签并按环境选择,或直接用仓库自带 Dockerfile 本地构建。

Q:有没有命令行运行方式?

A:有,可用 tools/uvr5/webui.py 打开 UVR5 WebUI,用 audio_slicer.py 切分数据集,用 tools/asr 下的脚本做 ASR。

注意事项

  • README 未给出 WebUI 主程序的启动命令,请以项目根目录内的说明为准。
  • Docker Compose 会挂载当前目录下的所有文件,使用前务必切到项目根目录并拉取最新代码。
  • Windows 用户需把 ffmpeg.exe 和 ffprobe.exe 放到 GPT-SoVITS 根目录,并安装 Visual Studio 2017 运行库。
  • audio_slicer.py 示例中的参数需自行补全,README 给出的该命令换行符可能缺失,执行前请检查。

核心亮点

  • 仅需1分钟音频即可训练出高质量声音克隆模型,大幅降低使用门槛
  • 集成语音合成、声音克隆、情感控制等多项功能,支持多语言(中、英、日等)
  • 提供WebUI和API接口,便于快速部署和二次开发

不足之处

  • 对输入音频质量敏感,噪声或混响环境下降级明显
  • 长文本合成时稳定性有待提升,偶有音色漂移
  • 文档/社区待观察

适用场景

  • 个人创作者快速生成个性化语音内容(如播客、视频配音)
  • 游戏或虚拟偶像角色声音定制
  • 低资源语言或方言的语音合成研究与原型验证

替代项目

Coqui TTS、ElevenLabs、OpenVoice

项目介绍

GPT-SoVITS 是音频音乐领域的开源项目,由 RVC-Boss 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(62,048)位列前 1%,在音频音乐分类的 738 个项目里位列前 1%。

近 44 天,它的 GitHub 星标从 60,625 增加到 62,048,净增 1,423。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:个人创作者快速生成个性化语音内容(如播客、视频配音)。同类可对比的替代方案包括 Coqui TTS、ElevenLabs、OpenVoice。

上一篇:CosyVoice

下一篇:TTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09