
fastdup
快速扫描海量图像视频,自动揪出重复、异常和标签错误
fastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识别重复或近似重复的图像、异常值、损坏文件、标签错误以及数据分布不平衡等问题,并提供直观的可视化报告和聚类视图,让用户能快速定位需要清洗或修正的数据。fastdup 支持大规模数据集(百万级图像),计算速度快,且无需 GPU 即可运行,显著降低了数据清洗和标注修正的人工成本。其核心能力包括重复检测、异常检测、标签质量分析、数据分布概览等,适用于计算机视觉模型训练前的数据准备阶段。
项目数据
核心亮点
- 处理速度极快,百万级图像分钟级完成分析,无需 GPU
- 自动识别重复/近似重复图像、异常值、损坏文件,减少人工排查
- 提供可视化聚类和报告,直观展示数据分布与标签问题
不足之处
- 文档和社区支持相对有限,新手入门可能需摸索
- 对视频数据的分析功能可能不如图像完善
适用场景
- 训练视觉模型前,清洗大规模图像数据集
- 检测标注数据中的标签错误和噪声
- 快速评估数据集的多样性和分布,辅助数据采集决策
替代项目
Cleanlab、FiftyOne、Lightly
项目介绍
上一篇:tech.ml.dataset
下一篇:markup
同类项目推荐
OpenConstructionEstimate-DDC-CWI···
开源
让AI代理秒查全球建筑成本数据,造价估算更智能。
Open multilingual construction cost database for AI Agents - 55K+ work items, 27K+ r···
be_great
开源
用大模型生成以假乱真的表格数据,解决隐私和数据短缺问题。
A novel approach for synthesizing tabular data using pretrained large language model···
University1652-Baseline
开源
拿无人机图像定位全球建筑,跨视角检索基准一键跑通
ACM Multimedia2020 University-1652: A Multi-view Multi-source Benchmark for Drone-ba···
SDMetrics
开源
给合成数据打分,快速判断质量好坏
Metrics to evaluate quality and efficacy of synthetic datasets.