Nepali-Datasets 是数据集领域的开源项目,由 pemagrg1 开发,2022 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 118。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。开源免费数据集列表。
它主要面向的使用场景是:尼泊尔语NLP研究者做前期数据调研。同类可对比的替代方案包括 Masakhane、Common Voice、OPUS。

尼泊尔语数据资源一页汇总,省去到处翻找的麻烦
Nepali-Datasets 是一个面向尼泊尔语自然语言处理的开源数据集索引项目,核心价值在于把散落在互联网各处的尼泊尔语语料、标注数据和资源链接集中整理成一份清单。尼泊尔语属于低资源语言,公开可用的训练数据稀缺且分散,研究者往往需要花费大量时间搜索和验证数据来源。该项目通过人工收集与社区贡献的方式,按类别列出可获取的数据集来源,覆盖文本、语音、词典等多种类型,并附上原始链接,方便直接定位下载。它本身不生产数据,而是承担导航和聚合角色,降低尼泊尔语 NLP 研究的启动门槛,鼓励更多人参与该语言的技术探索。适合做低资源语言研究、语料收集或模型训练前调研时作为入口参考。
Masakhane、Common Voice、OPUS
Nepali-Datasets 是数据集领域的开源项目,由 pemagrg1 开发,2022 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 118。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。开源免费数据集列表。
它主要面向的使用场景是:尼泊尔语NLP研究者做前期数据调研。同类可对比的替代方案包括 Masakhane、Common Voice、OPUS。
上一篇:cv-dataset
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models