
flickr_scraper
按关键词批量抓 Flickr 图片,快速攒出 CV 训练集
flickr_scraper 是一个基于 Python 的 Flickr 图片抓取工具,专门用于按关键词批量下载图片,快速构建计算机视觉数据集。它通过 Flickr API 获取搜索结果,支持分页遍历,能突破单次请求的数量限制,持续拉取大量图片。项目内置去重机制,避免重复下载相同图片,节省存储与后续标注成本。输出结构适合直接用于训练目标检测、图像分类等模型,技术栈标签中包含 ultralytics,说明可与 YOLO 系列工作流衔接。对于需要特定关键词(如某种动物、场景、商品)训练数据的开发者,它省去了手动收集和整理图片的繁琐过程,只需配置 API Key 和关键词即可运行。整体代码轻量,依赖清晰,适合作为数据集构建流水线的第一步。
项目数据
使用教程
核心亮点
- 支持分页抓取,可突破单次 API 返回数量上限,持续拉取大量图片
- 内置去重逻辑,减少重复图片,降低后续清洗和标注成本
- 基于关键词搜索构建数据集,流程直接,适合目标检测/分类等 CV 任务
不足之处
- 依赖 Flickr API Key,受官方速率限制和配额约束
- 功能相对单一,缺少图片质量过滤、自动标注等后处理能力
适用场景
- 为 YOLO 等目标检测模型收集特定类别图片
- 按关键词构建图像分类数据集的初始图片池
- 快速验证某个视觉任务是否有足够公开图片可用
替代项目
google-images-download、icrawler
项目介绍
同类项目推荐
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models
stopes
开源
一键准备多语言翻译数据,从清洗到挖掘平行语料
A library for preparing data for machine translation research (monolingual preproces···