compliance-checker 是数据集领域的开源项目,由 ioos 开发,2013 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 132。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-14。开源免费工具。
它主要面向的使用场景是:数据发布前自动扫描合规风险。同类可对比的替代方案包括 great_expectations、presidio。

一键扫描数据集,快速发现合规风险
compliance-checker 是一个用 Python 编写的开源工具,用于检查数据集是否符合合规标准。它面向数据科学家、数据工程师和合规团队,解决数据集在共享、发布或训练模型前难以快速判断是否满足隐私、许可、伦理等合规要求的问题。核心能力包括:读取数据集元数据与内容,按预设或自定义的合规规则进行扫描,输出可读的检查报告,指出潜在违规项与风险点。项目定位为轻量级、可扩展的检查器,适合集成到数据流水线或 CI 流程中,在数据进入下游前自动把关。当前星标 132,属于早期项目,规则库和生态仍在积累,但已提供基础合规检查能力,适合需要快速搭建数据合规初筛的团队参考使用。
great_expectations、presidio
compliance-checker 是数据集领域的开源项目,由 ioos 开发,2013 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 132。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-14。开源免费工具。
它主要面向的使用场景是:数据发布前自动扫描合规风险。同类可对比的替代方案包括 great_expectations、presidio。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models