text_generation_webui_xtts

给文本生成界面加上XTTSv2语音输出,让AI开口说话

text_generation_webui_xtts 是一个为 oobabooga text-generation-webui 设计的 XTTSv2 扩展插件。它解决了在文本生成界面中无法直接使用高质量语音合成的问题,将 Coqui 的 XTTSv2 模型无缝集成到 text-generation-webui 中,使用户能够为生成的文本添加自然、多语言的语音输出。该扩展支持通过简单的配置调用 XTTSv2 的克隆声音、多语言合成等功能,并能在聊天或生成场景中自动触发语音播放。核心能力包括:与 text-generation-webui 的对话流程深度整合、支持自定义说话人声音、多语言支持以及本地运行。项目处于早期阶段,代码结构清晰,适合对语音合成与文本生成结合感兴趣的开发者使用。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 156
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队kanttouchthis
所属国家
官网地址
定价模式free
价格说明开源扩展,需自行部署,无在线服务,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型llm,tts,voice-cloning
GitHub 星标★ 156
30天Star增速
HF 下载量
上线时间2023-11-18 00:00:00
最近更新2026-09-19 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 无缝集成oobabooga界面,无需切换工具即可获得语音输出
  • 支持XTTSv2的多语言和声音克隆能力,语音自然度高
  • 配置简单,通过扩展机制即可启用,降低使用门槛

不足之处

  • 依赖外部XTTSv2模型,首次下载体积大且需GPU支持
  • 文档/社区待观察

适用场景

  • 在本地文本生成界面中为AI对话添加语音回复
  • 为小说或剧本生成配音,快速试听效果
  • 多语言语音助手开发,利用XTTSv2的多语种能力

替代项目

Tortoise TTS、Coqui TTS、Silero TTS

项目介绍

text_generation_webui_xtts 是音频音乐领域的开源项目,由 kanttouchthis 开发,2023 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 156。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-19。开源扩展,需自行部署,无在线服务,完全免费。

它主要面向的使用场景是:在本地文本生成界面中为AI对话添加语音回复。同类可对比的替代方案包括 Tortoise TTS、Coqui TTS、Silero TTS。

上一篇:Turkish-Text-to-Speech

下一篇:ChineseTtsTflite

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09