dataset 是数据集领域的开源项目,由 darija-open-dataset 开发,2021 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 375。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-19。开源数据集,免费使用。
它主要面向的使用场景是:训练或微调Darija到英语的机器翻译模型。同类可对比的替代方案包括 OPUS、Tatoeba、FLORES-200。

给摩洛哥口语配英语翻译,低资源翻译有数据可用
这是一个面向摩洛哥阿拉伯语(Darija)与英语互译的平行语料数据集项目。Darija 是摩洛哥日常口语,长期缺乏高质量书面语料,主流机器翻译模型对其支持很差。该项目通过收集、整理 Darija 与英语的对照句子,为训练和评测翻译模型提供基础数据,解决低资源语言在 NLP 研究中数据稀缺的问题。核心能力是提供可直接用于训练、微调或评测的双语平行句对,覆盖日常口语表达,适合作为低资源翻译任务的起点数据。项目以数据集形式发布,体量适中,便于研究者快速下载使用,也可用于构建词典、语言学习工具或对话系统。对于关注阿拉伯语方言、低资源机器翻译和跨语言 NLP 的开发者与研究者,这是一个实用且门槛较低的语料资源。
OPUS、Tatoeba、FLORES-200
dataset 是数据集领域的开源项目,由 darija-open-dataset 开发,2021 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 375。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-19。开源数据集,免费使用。
它主要面向的使用场景是:训练或微调Darija到英语的机器翻译模型。同类可对比的替代方案包括 OPUS、Tatoeba、FLORES-200。
上一篇:aisheets
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models