TTS-dataset-tools

上传音频和文本,自动切分对齐,快速生成 TTS 数据集。

TTS-dataset-tools 是一个用于自动生成语音合成(TTS)训练数据集的 Python 工具。它解决了从原始音频和对应文本中手工切分、对齐和标注数据的痛点。核心能力包括:根据自定义时长自动切割音频,利用 Google Speech-to-Text API 进行说话人分离(diarization)和转写,或使用 aeneas 进行文本与音频的强制对齐。该工具面向语音技术开发者,能显著提升数据集构建效率,尤其适合需要批量处理有声书、播客等长音频的场景。项目处于早期阶段,功能聚焦,但依赖外部 API 和工具。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 52
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队youmebangbang
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型aeneas,deep-learning,deepvoice,google-speech,tts
GitHub 星标★ 52
30天Star增速
HF 下载量
上线时间2020-09-04 00:00:00
最近更新2025-06-11 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 自动完成音频切割、转写和对齐,省去手工标注时间
  • 支持 Google Speech-to-Text 和 aeneas 两种对齐方案,灵活适配不同需求
  • 可自定义切割长度,适应不同 TTS 模型的训练要求

不足之处

  • 依赖 Google API 和 aeneas,环境配置较复杂
  • 文档/社区待观察

适用场景

  • 为 TTS 模型准备训练数据,处理长音频文件
  • 有声书或播客的语音数据清洗与对齐
  • 快速构建多说话人语音数据集

替代项目

audiobook-dataset-tools、aeneas、MFA (Montreal Forced Aligner)

项目介绍

TTS-dataset-tools 是数据集领域的开源项目,由 youmebangbang 开发,2020 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 52。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2025-06-11。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:为TTS模型准备训练数据,处理长音频文件。同类可对比的替代方案包括 audiobook-dataset-tools、aeneas、MFA (Montreal Forced Aligner)。

上一篇:yoruba-text

下一篇:Speech-Corpus-Collection

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09