ManaTTS-Persian-Speech-Dataset

开源波斯语语音数据集,114小时转写音频,直接训练TTS模型

ManaTTS 是当前最大的开源波斯语语音数据集,包含超过 114 小时的已转写音频,并附带完整的数据收集与处理流水线工具。该项目旨在解决波斯语语音合成(TTS)领域高质量训练数据稀缺的问题,为研究人员和开发者提供可直接用于训练波斯语文本转语音模型的数据集和预处理方案。核心能力包括:大规模多说话人音频采集、自动语音转写与校对、强制对齐(forced alignment)以生成音素级标注,以及标准化的数据格式转换。项目采用 Jupyter Notebook 编写,便于用户理解和使用数据处理流程。对于构建波斯语语音助手、有声书生成、语音克隆等应用,该数据集提供了重要的基础资源。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 59
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队MahtaFetrat
所属国家
官网地址
定价模式free
价格说明开源数据集,MIT许可证,完全免费,可自行下载使用。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型data-collection,data-preprocessing,dataset-preparation,forced-alignment,mana-tts,manatts,persian,persian-speech,speech-corpus,speech-data-collection,speech-dataset,speech-processing,speech-synthesis,text-to-speech,text-to-speech-dataset,tts,tts-dataset
GitHub 星标★ 59
30天Star增速
HF 下载量
上线时间2024-06-03 00:00:00
最近更新2026-09-12 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 114+小时转写音频,规模在开源波斯语数据集中领先
  • 提供完整数据收集与预处理流水线,可复现和扩展
  • 包含强制对齐工具,生成音素级标注,提升TTS训练精度

不足之处

  • 项目处于早期阶段(57星),社区支持和文档可能不够完善
  • 数据集仅覆盖波斯语,适用场景受限

适用场景

  • 训练波斯语文本转语音(TTS)模型
  • 波斯语语音识别(ASR)模型的数据增强
  • 波斯语语音合成学术研究与基准测试

替代项目

Common Voice (Mozilla)、LibriSpeech、CSS10

项目介绍

ManaTTS-Persian-Speech-Dataset 是数据集领域的开源项目,由 MahtaFetrat 开发,2024 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 59。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-12。开源数据集,MIT许可证,完全免费,可自行下载使用。

它主要面向的使用场景是:训练波斯语文本转语音(TTS)模型。同类可对比的替代方案包括 Common Voice (Mozilla)、LibriSpeech、CSS10。

上一篇:SynParaSpeech

下一篇:jsut-lab

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09