QURAN-NLP 是数据集领域的开源项目,由 islamAndAi 开发,2022 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 146。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-19。Apache-2.0许可证,完全免费,无付费版本。
它主要面向的使用场景是:伊斯兰教义文本的语义搜索与问答系统。同类可对比的替代方案包括 Quranic Corpus、Tanzil、KSU Quran。

让古兰经文本轻松接入NLP,快速构建伊斯兰AI应用
QURAN-NLP 是一个面向《古兰经》及相关伊斯兰文本的自然语言处理工具集,旨在为研究人员和开发者提供古兰经、圣训、翻译、经注(Tafseer)及语料库语言学资源。项目解决了伊斯兰文本在NLP任务中缺乏统一、结构化数据的问题,核心能力包括语料库构建、文本检索、翻译对齐、词形分析等。它基于Jupyter Notebook开发,集成了多种NLP技术,支持构建聊天机器人、搜索引擎等应用。项目目前处于早期阶段,但已提供丰富的阿拉伯语文本处理接口,便于进行古兰经文本的深度分析与语义挖掘。
Quranic Corpus、Tanzil、KSU Quran
QURAN-NLP 是数据集领域的开源项目,由 islamAndAi 开发,2022 年首次发布。
它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 146。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-19。Apache-2.0许可证,完全免费,无付费版本。
它主要面向的使用场景是:伊斯兰教义文本的语义搜索与问答系统。同类可对比的替代方案包括 Quranic Corpus、Tanzil、KSU Quran。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models