example-causal-datasets

统一格式的因果数据集,带真实因果效应,开箱即用做基准测试

example-causal-datasets 是微软开源的因果推断示例数据集集合,旨在解决因果机器学习研究中数据格式混乱、缺乏统一基准的问题。项目提供多个经典因果数据集(如 IHDP、IBM ACIC 等),每个数据集都经过统一格式化处理,包含明确的处理变量、结果变量、协变量以及真实的因果效应(ground truth),便于研究者直接加载使用。核心能力包括:标准化数据接口,减少数据预处理成本;提供已知因果效应的仿真或半仿真数据,支持因果效应估计方法的准确评估;配套教程和文档,帮助快速上手。项目适合因果推断、因果发现、异质处理效应估计等方向的算法开发与对比实验,是因果机器学习领域常用的基准数据源之一。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 118
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队cmu-phil
所属国家
官网地址
定价模式free
价格说明开源数据集,免费使用
访问状态
是否开源
开源协议CC0-1.0
主要语言
技术栈/模型
GitHub 星标★ 118
30天Star增速
HF 下载量
上线时间2022-03-13 00:00:00
最近更新2026-09-04 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

核心亮点

  • 提供 IHDP、ACIC 等经典因果数据集的统一格式化版本,省去繁琐预处理
  • 每个数据集包含 ground truth 因果效应,可直接评估估计方法的精度
  • 配套 Jupyter Notebook 教程,演示数据加载与基准测试流程

不足之处

  • 数据集数量有限,覆盖场景不够广泛
  • 项目更新频率较低,社区活跃度一般

适用场景

  • 因果效应估计算法(如 T-learner、X-learner)的基准测试
  • 因果机器学习课程教学与实验演示
  • 异质处理效应(HTE)研究中的方法对比

替代项目

causalml、EconML、DoWhy

项目介绍

example-causal-datasets 是数据集领域的开源项目,由 cmu-phil 开发,2022 年首次发布。

它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 118。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-04。开源数据集,免费使用。

它主要面向的使用场景是:因果效应估计算法(如T-learner、X-learner)的基准测试。同类可对比的替代方案包括 causalml、EconML、DoWhy。

上一篇:datasetsforecast

下一篇:predictive-maintenance

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09