awesome-legal-data

法律文本数据集一页汇总,省去全网搜数据时间

awesome-legal-data 是一个面向法律文本处理的开源资源合集,主要收集法律领域的公开数据集、语料库及相关工具链接。它解决的核心问题是:法律 NLP 研究者与开发者往往需要花费大量时间在分散的法院判决、法规条文、合同文本等数据源中寻找可用数据,而该项目通过集中整理降低检索成本。内容覆盖多国法律文本、判决文书、法律问答、合同条款等类型,并附带数据集规模、语言、许可协议等元信息,方便快速筛选。项目以 Markdown 列表形式维护,结构清晰,适合作为法律科技、智能合同、法律问答系统等方向的数据入口。由于是资源汇总而非代码库,它本身不提供数据处理算法,但能显著缩短前期调研时间,是法律 NLP 领域较实用的索引型项目。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 308
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队openlegaldata
所属国家
定价模式free
价格说明开源数据集资源,免费使用
访问状态
是否开源
开源协议
主要语言
技术栈/模型datasets,legal,legal-tech,nlp
GitHub 星标★ 308
30天Star增速
HF 下载量
上线时间2019-02-19 00:00:00
最近更新2026-09-15 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

核心亮点

  • 按法律文本类型和语言分类整理,附数据集规模与许可信息,筛选效率高
  • 覆盖判决、法规、合同、问答等多种法律 NLP 常见任务数据源
  • 以 Markdown 维护,贡献门槛低,便于社区持续补充新数据集

不足之处

  • 仅做链接汇总,不提供数据下载、清洗或预处理代码
  • 部分链接可能随时间失效,缺少自动化校验机制

适用场景

  • 法律 NLP 研究者快速调研可用的公开判决与法规语料
  • 法律科技公司为智能合同审查或法律问答产品选型训练数据
  • 学生或初学者寻找法律文本处理练手数据集与入门资源

替代项目

LexGLUE、legal-nlp-datasets

项目介绍

awesome-legal-data 是数据集领域的开源项目,由 openlegaldata 开发,2019 年首次发布。

它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 308。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-15。开源数据集资源,免费使用。从国内网络环境看,可直接访问。

它主要面向的使用场景是:法律NLP研究者快速调研可用的公开判决与法规语料。同类可对比的替代方案包括 LexGLUE、legal-nlp-datasets。

上一篇:arco-era5

下一篇:HDI-Dataset

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09