vits-simple-api

一键部署 VITS 语音合成 API,快速集成 TTS 到你的应用

vits-simple-api 是一个基于 Python 的轻量级 VITS 语音合成 HTTP 接口服务,通过扩展 Moegoe 项目实现。它解决了 VITS 模型部署后缺乏统一调用接口的问题,将复杂的模型推理封装为简单的 RESTful API,方便开发者快速集成文字转语音(TTS)功能。核心能力包括:支持多种 VITS 变体模型(如 bert-vits2、gpt-sovits),提供统一的文本转语音、语音合成、音色切换等接口,并支持流式输出、多说话人管理、参数调节(语速、音调等)。项目结构简洁,部署方便,适合个人开发者或小团队快速搭建语音服务,也常用于游戏、聊天机器人、有声内容生成等场景。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1049
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队Artrajz
所属国家
官网地址
定价模式free
价格说明开源项目,AGPL-3.0许可证,可自行部署使用,完全免费。
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型bert-vits2,gpt-sovits,moegoe,tts,tts-api,vits
GitHub 星标★ 1049
30天Star增速
HF 下载量
上线时间2023-03-13 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 20 分钟 部署方式:Docker 8 步

环境要求

  • Linux 系统(Docker 部署为官方推荐)
  • 已安装 Docker 与 wget 命令
  • 虚拟环境部署需 Python 3.10(官方推荐版本)
  • GPU 加速需 NVIDIA 显卡及对应版本 CUDA,如 CUDA 11.7
  • 预留足够磁盘空间存放 VITS/Bert-VITS2/GPT-SoVITS 模型文件

安装与启动步骤

  1. 1选择部署方式

    README 提供 Docker、虚拟环境、Windows 快速包、云端一键部署四种方式;Linux 推荐 Docker。无论选哪种,部署后都要导入模型才能使用。

  2. 2Docker 拉取镜像

    运行官方安装脚本,按脚本提示选择需要下载的文件并拉取镜像。配置文件与模型默认目录为 /usr/local/vits-simple-api/。

    bash -c "$(wget -O- https://raw.githubusercontent.com/Artrajz/vits-simple-api/main/vits-simple-api-installer-latest.sh)"
  3. 3装 Python 依赖

    虚拟环境部署方式:建议使用 Python 3.10 的虚拟环境,在项目目录安装 requirements.txt 中的依赖;若个别依赖安装失败请看常见问题。

    pip install -r requirements.txt
  4. 4Windows 快速包

    到 releases 页面下载最新部署包并解压。因压缩与单文件 2GB 限制,部分可选依赖模型未打包,程序加载对应声音模型时会自动下载。

  5. 5检查 CUDA 版本

    需要 GPU 加速时,先用 nvidia-smi 查看显卡支持的最高 CUDA 版本,再据此到官网下载安装对应 CUDA(示例为 CUDA 11.7)。

    nvidia-smi
  6. 6安装 PyTorch

    按显卡 CUDA 版本从 PyTorch 官网选择对应安装命令,README 给出的是 CUDA 11.8 版本示例。

    pip install torch --index-url https://download.pytorch.org/whl/cu118
  7. 7导入模型文件

    部署完成后必须把 VITS/Bert-VITS2/GPT-SoVITS 等模型导入到模型目录,服务才能实际提供语音合成,模型会按类型加载对应依赖。

  8. 8配置模型语言

    使用 Bert-VITS2 v2.0 以上模型时,可在模型 config.json 的 data 段加 lang 参数,指定要加载的语言 Bert 模型,减少无谓加载。

关键配置

配置项必填说明示例
data.lang否写在模型 config.json 的 data 段,限定该模型使用的语言与要加载的 Bert 模型["zh", "ja"]

如何确认成功

README 未给出明确启动命令与端口;部署后导入模型,可访问 /voice/speakers 查看已加载说话人列表,能返回音频即服务正常。

常见问题

Q:安装 Python 依赖时报错怎么办?

A:README 提示参考其罗列的常见问题(common problems)章节,通常是 Python 版本或个别包编译问题,建议改用 Python 3.10 虚拟环境重试。

Q:部署后可用模型列表是空的?

A:说明模型未正确加载或依赖模型缺失。请按 README 的 Troubleshooting - Successfully loaded model is empty 章节排查,必要时手动下载依赖模型。

Q:Windows 部署包怎么没有全部模型?

A:因压缩需要及 GitHub 单文件 2GB 限制,部分可选依赖模型未打包,程序加载对应声音模型时会自动下载。

Q:加载 Bert-VITS2 模型太占资源怎么办?

A:在模型 config.json 的 data 段加 lang 参数,例如只写 ["zh"] 就只加载中文 Bert 模型,避免加载用不到的语言模型。

注意事项

  • Docker 方式下项目配置与模型默认路径为 /usr/local/vits-simple-api/
  • 部署只是第一步,必须导入模型后才能使用语音合成功能
  • 只有 Bert-VITS2 v2.0 及以上模型才需要配置 data.lang 语言范围
  • 在线体验地址的 id 编号与支持语言各不相同,本地部署请以自己的说话人列表为准

核心亮点

  • 统一封装多种 VITS 模型(bert-vits2、gpt-sovits 等),无需重复开发接口
  • 提供简洁的 RESTful API,支持流式音频返回,易于对接 Web 和移动端
  • 支持多说话人切换和参数调节,灵活适配不同音色和语速需求

不足之处

  • 文档/社区待观察
  • 依赖模型文件较大,首次部署需要额外下载和配置

适用场景

  • 为聊天机器人或虚拟助手添加语音回复功能
  • 批量生成有声书或播客内容
  • 在游戏或互动应用中实现角色语音合成

替代项目

Coqui TTS、MeloTTS、ChatTTS

项目介绍

vits-simple-api 是音频音乐领域的开源项目,由 Artrajz 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,049)位列前 30%,在音频音乐分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。AGPL-3.0许可证,可自行部署使用,完全免费。

它主要面向的使用场景是:为聊天机器人或虚拟助手添加语音回复功能。同类可对比的替代方案包括 Coqui TTS、MeloTTS、ChatTTS。

上一篇:pied

下一篇:CapCut-TTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09