fastdup

快速扫描海量图像视频,自动揪出重复、异常和标签错误

fastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识别重复或近似重复的图像、异常值、损坏文件、标签错误以及数据分布不平衡等问题,并提供直观的可视化报告和聚类视图,让用户能快速定位需要清洗或修正的数据。fastdup 支持大规模数据集(百万级图像),计算速度快,且无需 GPU 即可运行,显著降低了数据清洗和标注修正的人工成本。其核心能力包括重复检测、异常检测、标签质量分析、数据分布概览等,适用于计算机视觉模型训练前的数据准备阶段。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1913
维护状态 维护中
是否开源 是
定价模式 free

项目预览

项目数据

分类数据集
开发团队visual-layer
所属国家
定价模式free
价格说明开源免费工具,定价信息待确认
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型data-augmentation,data-curation,dataset,deep-learning,image,image-analysis,image-classfication,image-classification,image-duplicate-detection,image-processing,image-similarity,machine-learning,novelty-detection,object-detection,outlier-detection,python,visual-search,visualization,visualization-tools
GitHub 星标★ 1913
30天Star增速
HF 下载量
上线时间2022-05-11 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-24
浏览次数5

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3.9 / 3.10 / 3.11 / 3.12
  • 操作系统:macOS、Linux 或 Windows(WSL2)
  • 可用的 pip 包管理环境
  • 待分析的图像文件夹路径

安装与启动步骤

  1. 1安装 fastdup

    从 PyPI 安装 fastdup 库,建议在虚拟环境中执行以避免依赖冲突。

    pip install fastdup
  2. 2初始化并运行分析

    在 Python 中导入 fastdup,用 create 指定图像文件夹,再调用 run 开始扫描。

    import fastdup
    
    fd = fastdup.create(input_dir="IMAGE_FOLDER/")
    fd.run()
  3. 3查看可视化报告

    运行结束后调用各画廊方法,生成重复、异常、聚类等可视化结果。

    fd.vis.duplicates_gallery()
    fd.vis.outliers_gallery()
    fd.vis.component_gallery()
    fd.vis.stats_gallery()
    fd.vis.similarity_gallery()
  4. 4一键删除重复图

    调用 remove_duplicates 直接删除磁盘上的重复图像,默认相似度阈值 0.96。

    import fastdup
    fastdup.remove_duplicates("IMAGE_FOLDER/")
  5. 5预览删除结果

    删除前先设置 dry_run=True 预览会被删除的文件,确认无误再去掉该参数。

    import fastdup
    fastdup.remove_duplicates("IMAGE_FOLDER/", dry_run=True)

关键配置

配置项必填说明示例
input_dir是指定待分析的图像文件夹路径IMAGE_FOLDER/
distance否控制 remove_duplicates 的相似度阈值0.96
dry_run否设为 True 时只预览不实际删除文件True

如何确认成功

调用 fd.run() 完成后无报错,并能生成 duplicates_gallery 等可视化画廊,即表示运行成功。

常见问题

Q:需要 GPU 吗?

A:不需要,fastdup 无需 GPU 即可运行,CPU 环境即可完成百万级图像分析。

Q:remove_duplicates 会直接删除文件吗?

A:会。默认删除相似度大于 0.96 的重复图像,建议先用 dry_run=True 预览。

Q:支持哪些 Python 版本?

A:官方标识支持 Python 3.9、3.10、3.11、3.12。

Q:支持哪些操作系统?

A:支持 macOS、Linux,Windows 需在 WSL2 环境下使用。

注意事项

  • 删除文件前务必使用 dry_run=True 预览,避免误删数据。
  • 更多安装选项见官方文档 installation 页面。
  • 可调整 distance 参数改变判重相似度阈值。

核心亮点

  • 处理速度极快,百万级图像分钟级完成分析,无需 GPU
  • 自动识别重复/近似重复图像、异常值、损坏文件,减少人工排查
  • 提供可视化聚类和报告,直观展示数据分布与标签问题

不足之处

  • 文档和社区支持相对有限,新手入门可能需摸索
  • 对视频数据的分析功能可能不如图像完善

适用场景

  • 训练视觉模型前,清洗大规模图像数据集
  • 检测标注数据中的标签错误和噪声
  • 快速评估数据集的多样性和分布,辅助数据采集决策

替代项目

Cleanlab、FiftyOne、Lightly

项目介绍

fastdup 是数据集领域的开源项目,由 visual-layer 开发,2022 年首次发布。

在全站 13,916 个收录项目中,它的 GitHub 星标数(1,913)位列前 30%,在数据集分类中处于中上游。

项目仍在小幅维护中,最近一次代码更新于 2026-08-23。开源免费工具。从国内网络环境看,可直接访问。

它主要面向的使用场景是:训练视觉模型前,清洗大规模图像数据集。同类可对比的替代方案包括 Cleanlab、FiftyOne、Lightly。

上一篇:tech.ml.dataset

下一篇:markup

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10608 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1650 2026-09-20
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3409 2026-08-10