Speech-AI-Forge

一键整合多款 TTS 引擎,快速搭建语音应用

Speech-AI-Forge 是一个围绕 TTS(文本转语音)生成模型构建的开源项目,提供 API 服务器和基于 Gradio 的 WebUI。它整合了多种主流 TTS 引擎(如 ChatTTS、CosyVoice、Fish-Speech 等),支持中英文及多语言合成,并集成了 ASR(语音识别)和 LLM 能力,可构建完整的语音对话智能体。项目解决了 TTS 模型部署和调用碎片化的问题,通过统一接口和可视化界面,让开发者能快速接入、切换和测试不同语音模型,同时支持 Colab 一键运行,大幅降低使用门槛。核心能力包括多引擎管理、实时推理、语音克隆、情感控制以及智能体工作流编排,适合语音应用开发和研究。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1421
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队lenML
所属国家
官网地址
定价模式free
价格说明开源项目,基于AGPL-3.0许可证,可自行部署使用,无付费版本。
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型agent,asr,chattts,chattts-forge,chinese,colab,cosy-voice,cosyvoice,english,firered,fireredtts,fish-speech,gpt,llama,llm,ssml,stt,text-to-speech,tts,whisper
GitHub 星标★ 1421
30天Star增速
HF 下载量
上线时间2024-06-01 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 3 步

环境要求

  • Python 运行环境(项目为 Python 开发)
  • 按官方文档 docs/dependencies.md 安装相关依赖
  • 提前下载所需 TTS 模型(见 README 模型下载章节)
  • 如需容器部署,需具备 Docker 环境

安装与启动步骤

  1. 1安装相关依赖

    按 README 要求先确保相关依赖已正确安装,具体依赖清单见仓库 docs/dependencies.md 文档。

  2. 2下载所需模型

    进入 README 的“模型下载”章节,下载你要使用的 TTS 模型,未下载模型无法正常推理。

  3. 3启动 WebUI

    在项目根目录执行启动脚本,即可拉起基于 Gradio 的 WebUI 界面。

    python webui.py

如何确认成功

终端无报错并输出 Gradio 启动日志,按日志提示的地址在浏览器打开 WebUI 页面即为成功。

常见问题

Q:依赖装不上或运行时报缺少依赖怎么办?

A:README 明确要求先确保相关依赖正确安装,请对照仓库 docs/dependencies.md 逐项检查并补齐依赖。

Q:启动后无法合成语音是什么原因?

A:多半是模型未下载。README 在安装运行部分要求先查看“模型下载”章节下载所需模型。

Q:不想自己配环境,有更省事的方式吗?

A:可以使用 Releases 中的 Windows 整合包,解压即用;也可用仓库提供的 Colab notebook 一键体验。

Q:怎么在容器里部署?

A:README 提供了 Docker 章节入口,具体容器部署命令请以仓库该章节内容为准。

注意事项

  • README 未给出具体依赖安装命令,需先查阅 docs/dependencies.md
  • 模型文件需单独下载,项目本身不包含模型
  • 除本地部署外还支持整合包、Colab 与容器部署三种方式
  • Docker 章节的具体命令未在节选中体现,请以仓库原文为准

核心亮点

  • 统一封装 ChatTTS、CosyVoice、Fish-Speech 等主流模型,切换模型无需改代码
  • 提供 API Server 和 Gradio WebUI,兼顾开发调试与可视化操作
  • 集成 ASR 和 LLM,可直接构建语音对话智能体,端到端流程完整

不足之处

  • 依赖多个外部模型和框架,安装部署体积大,环境配置复杂
  • 文档/社区待观察

适用场景

  • 快速搭建多语言语音合成服务,供应用调用
  • 在 Colab 中实验不同 TTS 模型的音色和效果
  • 开发语音交互智能体,集成识别、理解、合成全链路

替代项目

Coqui TTS、MeloTTS、Bark

项目介绍

Speech-AI-Forge 是音频音乐领域的开源项目,由 lenML 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,421)位列前 30%,在音频音乐分类的 738 个项目里位列前 13%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。基于AGPL-3.0许可证,可自行部署使用,无付费版本。

它主要面向的使用场景是:快速搭建多语言语音合成服务,供应用调用。同类可对比的替代方案包括 Coqui TTS、MeloTTS、Bark。

上一篇:OuteTTS

下一篇:SoniTranslate

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09