example-causal-datasets 是数据集领域的开源项目,由 cmu-phil 开发,2022 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 118。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-04。开源数据集,免费使用。
它主要面向的使用场景是:因果效应估计算法(如T-learner、X-learner)的基准测试。同类可对比的替代方案包括 causalml、EconML、DoWhy。

统一格式的因果数据集,带真实因果效应,开箱即用做基准测试
example-causal-datasets 是微软开源的因果推断示例数据集集合,旨在解决因果机器学习研究中数据格式混乱、缺乏统一基准的问题。项目提供多个经典因果数据集(如 IHDP、IBM ACIC 等),每个数据集都经过统一格式化处理,包含明确的处理变量、结果变量、协变量以及真实的因果效应(ground truth),便于研究者直接加载使用。核心能力包括:标准化数据接口,减少数据预处理成本;提供已知因果效应的仿真或半仿真数据,支持因果效应估计方法的准确评估;配套教程和文档,帮助快速上手。项目适合因果推断、因果发现、异质处理效应估计等方向的算法开发与对比实验,是因果机器学习领域常用的基准数据源之一。
causalml、EconML、DoWhy
example-causal-datasets 是数据集领域的开源项目,由 cmu-phil 开发,2022 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 118。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-04。开源数据集,免费使用。
它主要面向的使用场景是:因果效应估计算法(如T-learner、X-learner)的基准测试。同类可对比的替代方案包括 causalml、EconML、DoWhy。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models