synergy-dataset

用机器学习自动筛文献,系统综述省一半人力

synergy-dataset 是面向系统综述(systematic review)研究流程的开放机器学习数据集,聚焦于文献筛选(study selection)这一最耗时的环节。系统综述通常需要研究者从成千上万篇检索结果中逐篇判断是否纳入,人工成本极高。该项目提供了经过标注的文献记录、引用网络与图结构数据,可用于训练和评估自动筛选模型,帮助研究者优先排序候选文献、减少重复劳动。数据集包含标题、摘要等文本信息以及 PRISMA 流程相关的元数据,适合自然语言处理、图神经网络和主动学习等方向的研究。它以 Python 为主要工具链,配套脚本便于加载与实验复现,是少数专门针对系统综述筛选任务的开源资源,对循证医学和信息检索交叉领域有实用价值。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 112
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队asreview
所属国家
官网地址
定价模式free
价格说明开源数据集,免费使用
访问状态
是否开源
开源协议CC0-1.0
主要语言Python
技术栈/模型citation-network,dataset,graphs,machine-learning,natural-language-processing,prisma,research,scholarly-articles,systematic-reviews-datasets,utrecht-university
GitHub 星标★ 112
30天Star增速
HF 下载量
上线时间2019-01-18 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

核心亮点

  • 专门针对系统综述的文献筛选任务,标注数据可直接用于训练纳入/排除分类器
  • 同时提供文本内容与引用网络图结构,支持 NLP 与图模型两类方法
  • 附带 PRISMA 流程相关元数据,便于复现真实综述场景并做主动学习实验

不足之处

  • 数据规模与领域覆盖有限,跨学科泛化能力需自行验证
  • 项目早期,文档与社区生态相对薄弱

适用场景

  • 循证医学团队构建自动文献初筛工具,降低人工阅读量
  • NLP 研究者评测文本分类与主动学习算法在真实综述任务上的表现
  • 图神经网络研究利用引用网络做文献相关性排序实验

替代项目

Cochrane Crowd、PubMed PICO、LitSuggest

项目介绍

synergy-dataset 是数据集领域的开源项目,由 asreview 开发,2019 年首次发布。

它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 112。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源数据集,免费使用。

它主要面向的使用场景是:循证医学团队构建自动文献初筛工具,降低人工阅读量。同类可对比的替代方案包括 Cochrane Crowd、PubMed PICO、LitSuggest。

上一篇:Minari

下一篇:datasets

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09