synergy-dataset 是数据集领域的开源项目,由 asreview 开发,2019 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 112。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源数据集,免费使用。
它主要面向的使用场景是:循证医学团队构建自动文献初筛工具,降低人工阅读量。同类可对比的替代方案包括 Cochrane Crowd、PubMed PICO、LitSuggest。

用机器学习自动筛文献,系统综述省一半人力
synergy-dataset 是面向系统综述(systematic review)研究流程的开放机器学习数据集,聚焦于文献筛选(study selection)这一最耗时的环节。系统综述通常需要研究者从成千上万篇检索结果中逐篇判断是否纳入,人工成本极高。该项目提供了经过标注的文献记录、引用网络与图结构数据,可用于训练和评估自动筛选模型,帮助研究者优先排序候选文献、减少重复劳动。数据集包含标题、摘要等文本信息以及 PRISMA 流程相关的元数据,适合自然语言处理、图神经网络和主动学习等方向的研究。它以 Python 为主要工具链,配套脚本便于加载与实验复现,是少数专门针对系统综述筛选任务的开源资源,对循证医学和信息检索交叉领域有实用价值。
Cochrane Crowd、PubMed PICO、LitSuggest
synergy-dataset 是数据集领域的开源项目,由 asreview 开发,2019 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 112。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源数据集,免费使用。
它主要面向的使用场景是:循证医学团队构建自动文献初筛工具,降低人工阅读量。同类可对比的替代方案包括 Cochrane Crowd、PubMed PICO、LitSuggest。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models