flickr_scraper

按关键词批量抓 Flickr 图片,快速攒出 CV 训练集

flickr_scraper 是一个基于 Python 的 Flickr 图片抓取工具,专门用于按关键词批量下载图片,快速构建计算机视觉数据集。它通过 Flickr API 获取搜索结果,支持分页遍历,能突破单次请求的数量限制,持续拉取大量图片。项目内置去重机制,避免重复下载相同图片,节省存储与后续标注成本。输出结构适合直接用于训练目标检测、图像分类等模型,技术栈标签中包含 ultralytics,说明可与 YOLO 系列工作流衔接。对于需要特定关键词(如某种动物、场景、商品)训练数据的开发者,它省去了手动收集和整理图片的繁琐过程,只需配置 API Key 和关键词即可运行。整体代码轻量,依赖清晰,适合作为数据集构建流水线的第一步。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 299
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队ultralytics
所属国家
定价模式free
价格说明开源免费工具,需自行部署使用
访问状态
是否开源
开源协议AGPL-3.0
主要语言Python
技术栈/模型computer-vision,dataset-creation,flickr,flickr-api,image-downloader,image-scraper,pagination,python,scraper,ultralytics
GitHub 星标★ 299
30天Star增速
HF 下载量
上线时间2020-02-21 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-18
浏览次数0

使用教程

核心亮点

  • 支持分页抓取,可突破单次 API 返回数量上限,持续拉取大量图片
  • 内置去重逻辑,减少重复图片,降低后续清洗和标注成本
  • 基于关键词搜索构建数据集,流程直接,适合目标检测/分类等 CV 任务

不足之处

  • 依赖 Flickr API Key,受官方速率限制和配额约束
  • 功能相对单一,缺少图片质量过滤、自动标注等后处理能力

适用场景

  • 为 YOLO 等目标检测模型收集特定类别图片
  • 按关键词构建图像分类数据集的初始图片池
  • 快速验证某个视觉任务是否有足够公开图片可用

替代项目

google-images-download、icrawler

项目介绍

flickr_scraper 是一个数据集领域的开源项目,官方简介:Python Flickr image scraper for building keyword-based computer vision datasets with pagination and deduplication.。项目使用 Python 开发,在 GitHub 上获得 299 星标。

上一篇:spotlight

下一篇:hflow

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
stopes 开源

一键准备多语言翻译数据,从清洗到挖掘平行语料

A library for preparing data for machine translation research (monolingual preproces···

★ 313 2026-08-10