fastdup

快速扫描海量图像视频,自动揪出重复、异常和标签错误

fastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识别重复或近似重复的图像、异常值、损坏文件、标签错误以及数据分布不平衡等问题,并提供直观的可视化报告和聚类视图,让用户能快速定位需要清洗或修正的数据。fastdup 支持大规模数据集(百万级图像),计算速度快,且无需 GPU 即可运行,显著降低了数据清洗和标注修正的人工成本。其核心能力包括重复检测、异常检测、标签质量分析、数据分布概览等,适用于计算机视觉模型训练前的数据准备阶段。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1904
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队visual-layer
所属国家
定价模式free
价格说明开源免费工具,定价信息待确认
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型data-augmentation,data-curation,dataset,deep-learning,image,image-analysis,image-classfication,image-classification,image-duplicate-detection,image-processing,image-similarity,machine-learning,novelty-detection,object-detection,outlier-detection,python,visual-search,visualization,visualization-tools
GitHub 星标★ 1904
30天Star增速
HF 下载量
上线时间2022-05-11 00:00:00
最近更新2026-08-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-24
浏览次数0

核心亮点

  • 处理速度极快,百万级图像分钟级完成分析,无需 GPU
  • 自动识别重复/近似重复图像、异常值、损坏文件,减少人工排查
  • 提供可视化聚类和报告,直观展示数据分布与标签问题

不足之处

  • 文档和社区支持相对有限,新手入门可能需摸索
  • 对视频数据的分析功能可能不如图像完善

适用场景

  • 训练视觉模型前,清洗大规模图像数据集
  • 检测标注数据中的标签错误和噪声
  • 快速评估数据集的多样性和分布,辅助数据采集决策

替代项目

Cleanlab、FiftyOne、Lightly

项目介绍

fastdup 是一个数据集领域的开源项目,官方简介:fastdup is a powerful, free tool designed to rapidly generate valuable insights from image and video datasets. It helps enhance the quality of both images and labels, while significantly reducing data operation costs, all with unmatched scalability.。项目使用 Python 开发,在 GitHub 上获得 1904 星标。

上一篇:tech.ml.dataset

下一篇:markup

同类项目推荐

be_great 开源

用大模型生成以假乱真的表格数据,解决隐私和数据短缺问题。

A novel approach for synthesizing tabular data using pretrained large language model···

★ 365 2026-08-17
University1652-Baseline 开源

拿无人机图像定位全球建筑,跨视角检索基准一键跑通

ACM Multimedia2020 University-1652: A Multi-view Multi-source Benchmark for Drone-ba···

★ 673 2026-08-13
SDMetrics 开源

给合成数据打分,快速判断质量好坏

Metrics to evaluate quality and efficacy of synthetic datasets.

★ 261 2026-08-10