awesome-legal-data 是数据集领域的开源项目,由 openlegaldata 开发,2019 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 308。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。开源数据集资源,免费使用。从国内网络环境看,可直接访问。
它主要面向的使用场景是:法律NLP研究者快速调研可用的公开判决与法规语料。同类可对比的替代方案包括 LexGLUE、legal-nlp-datasets。

法律文本数据集一页汇总,省去全网搜数据时间
awesome-legal-data 是一个面向法律文本处理的开源资源合集,主要收集法律领域的公开数据集、语料库及相关工具链接。它解决的核心问题是:法律 NLP 研究者与开发者往往需要花费大量时间在分散的法院判决、法规条文、合同文本等数据源中寻找可用数据,而该项目通过集中整理降低检索成本。内容覆盖多国法律文本、判决文书、法律问答、合同条款等类型,并附带数据集规模、语言、许可协议等元信息,方便快速筛选。项目以 Markdown 列表形式维护,结构清晰,适合作为法律科技、智能合同、法律问答系统等方向的数据入口。由于是资源汇总而非代码库,它本身不提供数据处理算法,但能显著缩短前期调研时间,是法律 NLP 领域较实用的索引型项目。
LexGLUE、legal-nlp-datasets
awesome-legal-data 是数据集领域的开源项目,由 openlegaldata 开发,2019 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 308。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。开源数据集资源,免费使用。从国内网络环境看,可直接访问。
它主要面向的使用场景是:法律NLP研究者快速调研可用的公开判决与法规语料。同类可对比的替代方案包括 LexGLUE、legal-nlp-datasets。
上一篇:arco-era5
下一篇:HDI-Dataset
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models