great_expectations

用代码定义数据期望,自动验证并生成文档,让数据质量可控。

Great Expectations 是一个开源的数据质量工具,帮助数据团队定义、验证和文档化数据的期望。它解决了数据管道中数据质量不可控的问题,通过声明式的期望套件(Expectation Suite)来描述数据应满足的条件,如列值范围、唯一性、非空等。核心能力包括:自动生成数据文档(Data Docs)、提供丰富的内置期望(Expectations)、支持多种数据源(如 Pandas、Spark、SQL),并能与 Airflow、dbt 等编排工具集成。它让数据团队在数据进入下游前就能发现异常,确保数据可信。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 11827
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队fivetran
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型cleandata,data-engineering,data-profilers,data-profiling,data-quality,data-science,data-unit-tests,datacleaner,datacleaning,dataquality,dataunittest,eda,exploratory-analysis,exploratory-data-analysis,exploratorydataanalysis,mlops,pipeline,pipeline-debt,pipeline-testing,pipeline-tests
GitHub 星标★ 11827
30天Star增速
HF 下载量
上线时间2017-09-11 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 3 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 3.10 ~ 3.13(官方支持范围)
  • 官方推荐在虚拟环境中部署 GX Core
  • Python 3.14 及更高版本需通过 GX_PYTHON_EXPERIMENTAL 环境变量启用实验性支持
  • 可访问官网文档查看数据源与集成的兼容性说明

安装与启动步骤

  1. 1检查 Python 版本

    确认本机 Python 在 3.10 到 3.13 之间;高于 3.13 只能按实验性方式使用。

    python --version
  2. 2创建虚拟环境

    官方推荐在虚拟环境中部署 GX Core,避免与系统环境依赖冲突。

    python -m venv gx-venv
  3. 3激活虚拟环境

    激活后所有后续安装与运行都在该隔离环境中进行;Windows 可改用 gx-venvScriptsctivate。

    source gx-venv/bin/activate

关键配置

配置项必填说明示例
GX_PYTHON_EXPERIMENTAL否在 Python 3.14 及以后版本上安装 great_expectations 时启用实验性支持1

如何确认成功

激活虚拟环境后执行 python --version,输出为 Python 3.10 至 3.13 即符合官方支持范围。

常见问题

Q:支持哪些 Python 版本?

A:GX Core 官方支持 Python 3.10 到 3.13;3.14 及更高版本属于实验性支持,需要额外设置环境变量。

Q:必须用虚拟环境吗?

A:README 中官方推荐在虚拟环境内部署 GX Core,建议按此方式操作以避免依赖冲突。

Q:怎么确认支持的数据源和集成?

A:README 指向官方 compatibility reference 页面,可查询 GX 支持的数据源与其他集成。

Q:想深入了解怎么上手?

A:README 推荐先阅读官网文档中的 Introduction to GX Core 章节。

注意事项

  • README 节选中未给出具体安装命令,本教程只覆盖其明确提到的 Python 版本要求与虚拟环境准备,安装步骤请以官网文档 Introduction to GX Core 为准。
  • Python 3.14 及以上的支持是实验性的,需在安装 great_expectations 时设置 GX_PYTHON_EXPERIMENTAL 环境变量。
  • 官网文档地址:https://docs.greatexpectations.io

核心亮点

  • 提供超过 100 种内置期望,覆盖常见数据质量检查,开箱即用
  • 自动生成可交互的数据文档,直观展示数据分布和质量,便于团队协作
  • 支持 Pandas、Spark、SQL 等多种数据源,适配不同技术栈

不足之处

  • 学习曲线较陡,期望套件的概念和配置需要一定时间掌握
  • 大数据量场景下性能可能成为瓶颈,需结合分布式计算优化

适用场景

  • 数据管道中在数据加载后、分析前进行质量校验
  • 数据迁移或集成时验证新旧数据一致性
  • 为数据团队提供数据质量报告,辅助数据治理

替代项目

dbt test、pandera、Soda Core

项目介绍

great_expectations 是数据集领域的开源项目,由 fivetran 开发,2017 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(11,827)位列前 5%,在数据集分类的 279 个项目里位列前 5%。

近 41 天,它的 GitHub 星标从 11,708 增加到 11,827,净增 119。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:数据管道中在数据加载后、分析前进行质量校验。同类可对比的替代方案包括 dbt test、pandera、Soda Core。

上一篇:DataDreamer

下一篇:lightly-studio

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09