Chatterbox-TTS-Server

一键自托管,轻松生成高质量语音,支持声音克隆和长文本处理。

Chatterbox-TTS-Server 是一个自托管的文本转语音(TTS)服务,基于强大的 Chatterbox 模型。它解决了用户需要灵活、可扩展的语音合成服务的问题,提供了友好的 Web 界面和灵活的 API 接口,包括与 OpenAI 兼容的端点,方便集成到现有应用中。核心能力包括预设语音、声音克隆、大规模文本(如整本有声书)处理,并支持 NVIDIA (CUDA)、AMD (ROCm) 和 CPU 多种硬件加速,满足不同性能需求。项目使用 Python 和 FastAPI 构建,依赖 PyTorch 和 HuggingFace 生态,适合开发者快速部署和定制。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1449
维护状态 低维护
是否开源
定价模式 free

项目数据

分类音频音乐
开发团队devnen
所属国家
定价模式free
价格说明开源项目,MIT许可证,可自行部署,完全免费。提供Web UI和API,但需自托管。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai,api-server,audio-generation,chatterbox,chatterbox-tts,cuda,fastapi,huggingface,openai-api,python,pytorch,rocm,speech-synthesis,speech-synthesis-api,text-to-speech,tts,tts-api,voice-cloning,web-ui
GitHub 星标★ 1449
30天Star增速
HF 下载量
上线时间2025-05-31 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 8 步

环境要求

  • Python 3.10(3.11+ 缺 torchvision/ONNX 预编译 wheel,可能安装失败)
  • 首次安装需联网,磁盘需预留数 GB 空间(PyTorch 与 GPU 库)
  • NVIDIA 显卡需装最新驱动;Blackwell(RTX 50 系)需 CUDA 12.8 分支
  • AMD 显卡需在 Linux 上安装最新 ROCm 驱动;无独显可选 CPU 方案

安装与启动步骤

  1. 1克隆仓库

    把源码下载到本地并进入项目目录,后续所有命令都在此目录执行。

    git clone https://github.com/devnen/Chatterbox-TTS-Server.git
    cd Chatterbox-TTS-Server
  2. 2一键启动 Linux

    脚本自动建虚拟环境、检测硬件、装依赖并启动服务,适合大多数用户。

    chmod +x start.sh
    ./start.sh
  3. 3一键启动 Windows

    双击 start.bat,或在命令提示符中运行;便携模式会自动用内置 Python 3.10。

    start.bat
  4. 4手动建虚拟环境

    Linux/macOS 下创建并激活 venv,提示符出现 (venv) 才算成功。

    python3 -m venv venv
    source venv/bin/activate
  5. 5Windows 建虚拟环境

    在 PowerShell 中创建并激活 venv,避免与其它项目依赖冲突。

    python -m venv venv
    .envScriptsctivate
  6. 6装 NVIDIA 依赖

    CUDA 12.8 分支含 sm_120 支持;第二条必须带 --no-deps,防止 torch 被降级。

    pip install -r requirements-nvidia-cu128.txt
    pip install --no-deps git+https://github.com/devnen/chatterbox-v2.git@master
  7. 7装 AMD 依赖

    ROCm 需先装 PyTorch 栈再装其余依赖,最后同样用 --no-deps 装 chatterbox。

    pip install -r requirements-rocm-init.txt
    pip install -r requirements-rocm.txt
    pip install --no-deps git+https://github.com/devnen/chatterbox-v2.git@master
  8. 8验证安装

    检查 PyTorch 版本与 GPU 是否可见;NVIDIA 用户应能在架构列表中看到 sm_120。

    python -c "import torch; print(f'PyTorch: {torch.__version__}'); print(f'CUDA: {torch.cuda.is_available()}'); print(f'GPU: {torch.cuda.get_device_name(0)}'); print(f'Architectures: {torch.cuda.get_arch_list()}')

关键配置

配置项必填说明示例
deviceconfig.yaml 中指定运行设备,默认 auto 自动检测 CUDA/MPS/CPUauto

如何确认成功

torch 检查命令能打印出 GPU 名称与 sm_120;启动后浏览器打开 Web UI 可正常加载页面。

常见问题

Q:为什么必须用 Python 3.10?

A:它是唯一对所有依赖(torch、torchvision、ONNX)都有预编译 wheel 的版本,3.11+ 可能因缺 wheel 而失败。Windows 便携模式会自动使用嵌入式 3.10。

Q:安装 chatterbox 为什么要加 --no-deps?

A:防止 pip 把已装好的 PyTorch 降级,或在 ROCm 环境下把 torch 替换成 CPU-only 版本,导致 GPU 加速失效。

Q:RTX 50 系显卡报 no kernel image 错误?

A:Blackwell 架构为 sm_120,需使用 requirements-nvidia-cu128.txt(PyTorch 2.9.0 + CUDA 12.8),旧版 CUDA 12.1 不支持。

Q:想先试用不想安装?

A:用官方 Colab 笔记本,依次运行 cell 1 到 4,点击输出中的 https://localhost:8004 链接即可打开 Web UI。

Q:首次运行很慢且占空间大?

A:首次需联网安装 PyTorch 与 GPU 库,耗时几分钟、占用数 GB;之后启动器会复用环境,几秒即可启动。

注意事项

  • 新手优先用一键启动脚本,它会自动完成虚拟环境、硬件检测与依赖安装。
  • 手动安装时务必先激活虚拟环境,命令提示符应显示 (venv) 再执行 pip 安装。
  • 重装或排错可运行 python start.py --reinstall,加 --verbose 查看详细日志。
  • CPU-only 安装对应的 requirements 文件名在本节选中未给出,请查阅仓库安装章节 Option 1。

核心亮点

  • 提供 OpenAI 兼容 API,无缝替换现有语音服务
  • 支持声音克隆,可定制个性化语音
  • 支持 CUDA/ROCm/CPU 多平台,硬件适配灵活

不足之处

  • 文档/社区待观察
  • 大规模文本处理可能对内存和计算资源要求较高

适用场景

  • 开发者快速搭建个人或团队内部 TTS 服务
  • 有声书、播客等长音频内容的批量生成
  • 需要个性化语音的虚拟助手或游戏角色

替代项目

Coqui TTS、MeloTTS、OpenVoice

项目介绍

Chatterbox-TTS-Server 是音频音乐领域的开源项目,由 devnen 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,449)位列前 30%,在音频音乐分类的 738 个项目里位列前 13%。

近 45 天,它的 GitHub 星标从 1,397 增加到 1,449,净增 52。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。MIT许可证,可自行部署,完全免费。提供Web UI和API,但需自托管。

它主要面向的使用场景是:开发者快速搭建个人或团队内部TTS服务。同类可对比的替代方案包括 Coqui TTS、MeloTTS、OpenVoice。

上一篇:soprano

下一篇:Matcha-TTS

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 245 2026-08-09