Awesome-Dataset-Distillation

一页看全数据集蒸馏论文,快速入门与追新

Awesome-Dataset-Distillation 是一个系统整理数据集蒸馏(Dataset Distillation)方向论文与资源的开源清单项目。数据集蒸馏旨在把大规模训练集压缩成少量合成样本,使模型在这些合成数据上训练后仍能达到接近原始数据的性能,从而大幅降低存储、传输与训练成本。该项目汇总了该领域的经典与前沿论文、方法分类、基准结果以及相关应用,覆盖元学习、梯度匹配、分布匹配、轨迹匹配等主流技术路线,也包含持续学习、联邦学习、神经架构搜索等下游场景。对刚进入该方向的研究者,它提供了清晰的脉络和检索入口;对已有经验的研究者,它可作为跟踪最新进展的索引。项目以 HTML 形式组织,结构清晰,便于浏览和按主题跳转。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1974
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队Guang000
所属国家
定价模式free
价格说明开源免费资源列表
访问状态
是否开源
开源协议MIT
主要语言HTML
技术栈/模型awesome-list,deep-learning
GitHub 星标★ 1974
30天Star增速
HF 下载量
上线时间2022-06-09 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

难度:入门 约 5 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可正常联网的现代浏览器(Chrome/Edge/Firefox 等)
  • git(可选,用于把仓库克隆到本地)

安装与启动步骤

  1. 1克隆仓库

    把项目克隆到本地任意目录,所需内容为仓库中的 HTML 清单文件;不克隆也可直接在线浏览。

    git clone https://github.com/Guang000/Awesome-Dataset-Distillation.git
  2. 2进入项目目录

    切换到克隆下来的仓库目录,便于查找其中的 HTML 文件。

    cd Awesome-Dataset-Distillation
  3. 3本地打开清单

    用浏览器打开目录中的 HTML 页面即可阅读论文清单,无需编译或启动服务。

    open index.html
  4. 4在线访问官网

    也可以直接访问官方站点,无需任何本地安装,适合只想检索论文的读者。

如何确认成功

浏览器中能正常显示数据集蒸馏论文清单页面(分类目录、论文链接可点击)即表示访问成功。

常见问题

Q:需要安装 Python、PyTorch 等依赖吗?

A:不需要。该项目是一个用 HTML 组织的论文资源清单(awesome-list),阅读和检索资料无需安装任何深度学习框架或运行环境。

Q:什么是数据集蒸馏?

A:指合成一个小数据集,使在其上训练的模型在原大规模数据集上仍能达到较高性能:输入是大规模真实训练集,输出是少量合成样本。

Q:这个方向最早是哪篇论文提出的?

A:由 Dataset Distillation(Tongzhou Wang 等,2018)首次提出,并用反向传播穿越优化步骤实现;随后 Medical Dataset Distillation(2019)把任务扩展到真实数据集。

Q:怎样跟踪该方向的最新进展?

A:访问官网 https://guang000.github.io/Awesome-Dataset-Distillation 查看持续更新的论文清单,比本地克隆的静态文件更新更及时。

注意事项

  • 项目本身是论文与资源清单,不包含可直接训练或复现实验的代码,README 中也没有安装、构建或启动命令。
  • 上面的步骤仅为通用准备动作(克隆、打开 HTML 页面),实际使用中直接浏览网页即可,无需任何编译或部署。
  • 清单涵盖元学习、梯度匹配、分布匹配、轨迹匹配等技术路线,以及持续学习、联邦学习、神经架构搜索等下游应用,可按需检索。

核心亮点

  • 按方法与应用场景分类整理论文,检索效率高
  • 覆盖数据集蒸馏主流技术路线与下游任务,脉络清晰
  • 持续收录新论文,适合跟踪领域进展

不足之处

  • 仅做链接汇总,缺少对方法原理与实验对比的深入解读
  • 作为清单类项目,内容质量依赖维护者更新频率

适用场景

  • 研究生入门数据集蒸馏方向时快速建立知识框架
  • 研究者写综述或找 baseline 时检索代表论文
  • 工程师评估数据压缩方案时了解可用方法与效果

替代项目

awesome-data-centric-ai、awesome-deep-learning

项目介绍

Awesome-Dataset-Distillation 是数据集领域的开源项目,由 Guang000 开发,2022 年首次发布。

在全站 12,822 个收录项目中,它的 GitHub 星标数(1,974)位列前 30%,在数据集分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-17。开源免费资源列表。

它主要面向的使用场景是:研究生入门数据集蒸馏方向时快速建立知识框架。同类可对比的替代方案包括 awesome-data-centric-ai、awesome-deep-learning。

上一篇:datasets

下一篇:vega-datasets

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09