cv-dataset 是数据集领域的开源项目,由 common-voice 开发,2020 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 175。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费数据集,可公开下载使用。从国内网络环境看,可直接访问。
它主要面向的使用场景是:训练多语言ASR模型前,查询并锁定特定语言、特定版本的CommonVoice数据清单。同类可对比的替代方案包括 Common Voice、LibriSpeech、VoxForge。




