fastdup 是数据集领域的开源项目,由 visual-layer 开发,2022 年首次发布。
在全站 13,916 个收录项目中,它的 GitHub 星标数(1,913)位列前 30%,在数据集分类中处于中上游。
项目仍在小幅维护中,最近一次代码更新于 2026-08-23。开源免费工具。从国内网络环境看,可直接访问。
它主要面向的使用场景是:训练视觉模型前,清洗大规模图像数据集。同类可对比的替代方案包括 Cleanlab、FiftyOne、Lightly。

快速扫描海量图像视频,自动揪出重复、异常和标签错误
fastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识别重复或近似重复的图像、异常值、损坏文件、标签错误以及数据分布不平衡等问题,并提供直观的可视化报告和聚类视图,让用户能快速定位需要清洗或修正的数据。fastdup 支持大规模数据集(百万级图像),计算速度快,且无需 GPU 即可运行,显著降低了数据清洗和标注修正的人工成本。其核心能力包括重复检测、异常检测、标签质量分析、数据分布概览等,适用于计算机视觉模型训练前的数据准备阶段。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
1安装 fastdup
从 PyPI 安装 fastdup 库,建议在虚拟环境中执行以避免依赖冲突。
pip install fastdup2初始化并运行分析
在 Python 中导入 fastdup,用 create 指定图像文件夹,再调用 run 开始扫描。
import fastdup
fd = fastdup.create(input_dir="IMAGE_FOLDER/")
fd.run()3查看可视化报告
运行结束后调用各画廊方法,生成重复、异常、聚类等可视化结果。
fd.vis.duplicates_gallery()
fd.vis.outliers_gallery()
fd.vis.component_gallery()
fd.vis.stats_gallery()
fd.vis.similarity_gallery()4一键删除重复图
调用 remove_duplicates 直接删除磁盘上的重复图像,默认相似度阈值 0.96。
import fastdup
fastdup.remove_duplicates("IMAGE_FOLDER/")5预览删除结果
删除前先设置 dry_run=True 预览会被删除的文件,确认无误再去掉该参数。
import fastdup
fastdup.remove_duplicates("IMAGE_FOLDER/", dry_run=True)| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
input_dir | 是 | 指定待分析的图像文件夹路径 | IMAGE_FOLDER/ |
distance | 否 | 控制 remove_duplicates 的相似度阈值 | 0.96 |
dry_run | 否 | 设为 True 时只预览不实际删除文件 | True |
调用 fd.run() 完成后无报错,并能生成 duplicates_gallery 等可视化画廊,即表示运行成功。
Q:需要 GPU 吗?
A:不需要,fastdup 无需 GPU 即可运行,CPU 环境即可完成百万级图像分析。
Q:remove_duplicates 会直接删除文件吗?
A:会。默认删除相似度大于 0.96 的重复图像,建议先用 dry_run=True 预览。
Q:支持哪些 Python 版本?
A:官方标识支持 Python 3.9、3.10、3.11、3.12。
Q:支持哪些操作系统?
A:支持 macOS、Linux,Windows 需在 WSL2 环境下使用。
Cleanlab、FiftyOne、Lightly
fastdup 是数据集领域的开源项目,由 visual-layer 开发,2022 年首次发布。
在全站 13,916 个收录项目中,它的 GitHub 星标数(1,913)位列前 30%,在数据集分类中处于中上游。
项目仍在小幅维护中,最近一次代码更新于 2026-08-23。开源免费工具。从国内网络环境看,可直接访问。
它主要面向的使用场景是:训练视觉模型前,清洗大规模图像数据集。同类可对比的替代方案包括 Cleanlab、FiftyOne、Lightly。
上一篇:tech.ml.dataset
下一篇:markup
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···