Kokoro-Speech-Dataset 是数据集领域的开源项目,由 kaiidams 开发,2021 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 73。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-12。公开领域数据集,完全免费,无付费版本。
它主要面向的使用场景是:训练日语TTS模型。同类可对比的替代方案包括 JSUT、LibriSpeech、Common Voice。

免费日语单说话人语音数据,拿来就能训TTS
Kokoro-Speech-Dataset 是一个公开领域的单说话人日语语音数据集,旨在为文本转语音(TTS)等语音合成任务提供高质量、可自由使用的训练数据。它解决了语音合成研究中高质量日语语音数据稀缺且版权受限的问题,通过提供公共领域(public domain)的音频和对应文本,降低了开发者获取合法训练数据的门槛。该数据集包含特定说话人的清晰日语语音,并提供了配套的处理脚本(Python),方便用户进行数据预处理、格式转换和模型训练前的准备。其核心能力在于提供一份干净、标注明确、无版权负担的日语单说话人语音资源,可直接用于训练个性化的TTS模型或作为语音合成研究的基准数据。
JSUT、LibriSpeech、Common Voice
Kokoro-Speech-Dataset 是数据集领域的开源项目,由 kaiidams 开发,2021 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 73。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-12。公开领域数据集,完全免费,无付费版本。
它主要面向的使用场景是:训练日语TTS模型。同类可对比的替代方案包括 JSUT、LibriSpeech、Common Voice。
下一篇:yoruba-text
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models