voicesmith

一键搞定 TTS 模型训练,从数据到模型不再头疼

VoiceSmith 是一个正在开发中的语音合成工具包,旨在简化文本到语音(TTS)模型的训练流程。它主要面向研究人员和开发者,解决了传统 TTS 训练中数据管理复杂、预处理繁琐、模型配置困难等问题。项目基于 Python,集成了数据集管理、预处理、模型训练等模块,并支持 DelightfulTTS 和 UnivNet 等主流模型架构,提供语音克隆能力。其核心能力包括:统一的数据集管理接口,支持多种数据格式;自动化的音频预处理流程,如文本清洗、音素转换、特征提取等;以及简化的模型训练和微调流程,降低上手门槛。目前项目处于早期阶段,功能仍在完善中,但已展现出成为一站式 TTS 训练平台的潜力。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 230
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队dunky11
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,需自行部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型dataset-manager,delightfultts,preprocessing,speech-synthesis,text-to-speech,toolkit,tts,univnet,voice-cloning
GitHub 星标★ 230
30天Star增速
HF 下载量
上线时间2022-05-17 00:00:00
最近更新2026-07-26 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 提供统一的数据集管理接口,支持多种数据格式,简化数据准备
  • 内置 DelightfulTTS 和 UnivNet 等先进模型,开箱即用
  • 自动化预处理流程,减少手动操作,提升训练效率

不足之处

  • 项目尚处 WIP 阶段,功能不完整,稳定性待验证
  • 文档和社区支持较少,上手可能遇到困难

适用场景

  • 研究者快速验证新的 TTS 模型架构
  • 开发者构建自定义语音克隆应用
  • 教育场景中教学 TTS 训练流程

替代项目

Coqui TTS、ESPnet、Mozilla TTS

项目介绍

voicesmith 是音频音乐领域的开源项目,由 dunky11 开发,2022 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 230。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-26。Apache-2.0许可证,完全免费,需自行部署。

它主要面向的使用场景是:研究者快速验证新的TTS模型架构。同类可对比的替代方案包括 Coqui TTS、ESPnet、Mozilla TTS。

上一篇:Crystal

下一篇:ronor

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09