image-classification
本站收录 51 个带「image-classification」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
ultralyticsUltralytics 是计算机视觉领域最流行的开源工具包,提供 YOLO 系列目标检测模型(包括 YOLOv8、YOLO11 及最新的 YOLO26)的一站式★ 62,103
yolov5YOLOv5 是 Ultralytics 团队开发的基于 PyTorch 的目标检测框架,是目前计算机视觉领域最流行的开源项目之一。它解决了实时目标检测、实例分★ 58,097
pytorch-image-modelspytorch-image-models(常被称为 timm)是 PyTorch 生态中规模最大的图像编码器与骨干网络集合,由 Hugging Face 维护。★ 37,182
label-studio支持多类型数据标注的开源工具,覆盖图像、文本、音频、视频等多种数据格式,输出格式标准化,方便直接对接模型训练流程。提供灵活的标注界面、协作审核机制与丰富的集成能★ 28,371
vit-pytorchvit-pytorch 是一个基于 PyTorch 实现的 Vision Transformer(ViT)模型库,由 Phil Wang(lucidrains)★ 25,525
cvatCVAT(Computer Vision Annotation Tool)是一个开源的计算机视觉标注平台,旨在帮助AI团队高效构建高质量视觉数据集。它解决了从原★ 16,821
pytorch-grad-campytorch-grad-cam 是一个用于计算机视觉模型可解释性的高级工具库,基于 PyTorch 实现 Grad-CAM 及其多种变体。它解决了深度学习模型★ 12,984
fiftyoneFiftyOne 是一个面向计算机视觉团队的开源数据集管理与模型评估工具,由 Voxel51 开发。它解决了视觉 AI 开发中数据质量差、模型错误难以定位、数据★ 11,130
X-AnyLabelingX-AnyLabeling 是一款轻量、高效、跨平台的桌面标注工具,专为文本、图像、视频和多模态数据设计。它集成了丰富的内置标注工具(如矩形框、多边形、关键点等★ 10,569
techniques这是一个专注于卫星与航空影像深度学习技术的开源项目,汇集了针对地球观测数据的卷积神经网络、数据集构建、图像分类等核心方法。它解决了遥感领域缺乏系统化深度学习实践★ 10,269
InternVLInternVL 是一个开源的多模态对话模型家族,旨在成为 GPT-4o 的开源替代方案,在 CVPR 2024 上获得 Oral 论文。它解决了开源社区缺乏高★ 10,169
notebooks这是一个计算机视觉领域的教程合集,基于 Jupyter Notebook 编写,旨在帮助开发者从基础到前沿系统学习视觉模型与技术。项目覆盖了从 ResNet 等★ 9,696
catalystCatalyst 是一个面向深度学习研究与开发的 Python 框架,旨在加速从实验设计到模型部署的全流程。它解决了深度学习项目中代码重复、实验管理混乱、复现困★ 3,387
VideoPipeVideoPipe 是一个基于计算机视觉模型和多模态大语言模型(mLLM)的跨平台视频结构化分析框架。它解决的是视频数据从原始帧到结构化信息的端到端处理问题,将★ 2,962
autodistillAutodistill 是一个面向计算机视觉的自动化标注与训练工具,旨在解决监督学习依赖大量人工标注的问题。它利用基础模型(如 GPT-4V、CLIP、Grou★ 2,783
deepdetectdeepdetect 是一个开源的深度学习服务器和命令行工具,最初由 Jolibrain 开发,旨在简化深度学习模型的部署和服务化。它支持多种深度学习框架,包括★ 2,551
bootcampBootcamp 是一个专注于非结构化数据搜索与分析的教程型开源项目,涵盖反向图像搜索、音频搜索、分子搜索、视频分析、问答系统及 NLP 等主题。它通过 Jup★ 2,445
ailia-modelsailia-models 是一个汇集了预训练、前沿 AI 模型的集合,专为 ailia SDK 设计。它解决了 AI 模型从研究到部署之间的鸿沟,提供了统一、易★ 2,393
emgucvEmgu CV 是 OpenCV 图像处理库的跨平台 .NET 封装,让 C#、VB.NET、F# 等 .NET 开发者无需编写 C++ 代码,即可直接调用 O★ 2,301
MambaVisionMambaVision是CVPR 2025官方发布的PyTorch实现,提出了一种混合Mamba-Transformer视觉骨干网络。它针对视觉任务中Mamba★ 2,235
fastdupfastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识★ 1,911
TensorRT-YOLOTensorRT-YOLO 是一个面向 NVIDIA GPU 的 YOLO 系列模型部署工具包,旨在让 YOLO 的推理部署更简单、更快速。它基于 Tensor★ 1,892
torchdistilltorchdistill 是一个基于 PyTorch 的免编码深度学习框架,专注于知识蒸馏(Knowledge Distillation)研究。它解决了知识蒸馏★ 1,633
getigeti 是英特尔推出的计算机视觉模型训练平台,旨在用更少的数据和更短的时间构建高性能视觉模型。它解决了传统深度学习模型开发中数据标注成本高、训练周期长、调参复★ 1,344
xtreme1Xtreme1 是一个面向多模态训练数据的一体化标注平台,支持 3D LiDAR 点云、2D 图像和大语言模型(LLM)数据的标注与处理。它解决的是 AI 团队★ 1,325
cleanvisionCleanVision 是一个用于图像数据集质量检测的开源 Python 库,旨在自动发现图像数据中的各类问题,帮助数据科学家和机器学习工程师实践以数据为中心的★ 1,207
torchxrayvisionTorchXRayVision 是一个面向胸部 X 光影像的开源工具库,集成了多个公开数据集和预训练模型,覆盖分类、分割和自编码器三大任务。它解决了医学影像研究★ 1,201
Awesome-CV-MasterHubAwesome-CV-MasterHub 是一个计算机视觉领域的论文精选列表,汇总了图像生成、分类、描述、去雾、去噪、增强、融合等多个方向的最新研究成果。它解决★ 978
FasterViTFasterViT 是一个面向视觉任务的高效 Transformer 模型,由 NVIDIA 研究人员开发,相关论文发表于 ICLR 2024。它旨在解决传统 ★ 925
caercaer 是一个面向计算机视觉研究的高性能 Python 库,旨在减少样板代码,让研究者专注于核心算法。它整合了图像处理、数据增强、模型训练与评估等常用功能,提★ 818
ISP-GuideISP-Guide 是一个关于图像信号处理(ISP)的综合性学习指南,旨在帮助开发者系统理解从图像/视频传感器原始数据到最终数字图像的完整处理流程。它通过整理和★ 712
AlbumentationsXAlbumentationsX 是经典图像增强库 Albumentations 的延续版本,面向计算机视觉训练场景,提供高性能、多样化的数据增强能力。它解决的核★ 563
yolo-ios-appyolo-ios-app 是 Ultralytics 官方推出的 iOS 应用与 Swift Package,把 YOLO 系列模型通过 Core ML 部署到★ 516
KG-MM-SurveyKG-MM-Survey 是一份关于知识图谱与多模态学习交叉领域的系统性综述列表。它整理了知识图谱如何与图像、文本等多模态数据结合的研究工作,覆盖跨模态检索、实★ 507
yolo-flutter-appyolo-flutter-app 是 Ultralytics 官方推出的 Flutter 插件,让移动端应用可以直接调用 YOLO 系列模型完成实时视觉推理。它★ 498
ModelAssistantModelAssistant 是矽递科技(Seeed Studio)推出的开源嵌入式 AI 工具链,属于 SenseCraft 生态的一部分。它面向边缘设备上的★ 446
ImageIndexerImageIndexer 是一个本地优先的图像索引与标注工具,用 Python 编写。它解决的是个人或小团队海量图片难以检索和管理的问题。核心能力是自动扫描指定★ 397
AgMLAgML 是一个面向农业机器学习的集中式框架,旨在解决农业领域深度学习研究中数据分散、基准不统一、模型复用难的问题。它聚合了多个公开农业数据集,覆盖图像分类、目★ 344
everything-aieverything-ai 是一个本地运行的 AI 聊天助手项目,旨在提供全面且无需联网的智能对话体验。它解决了用户对隐私保护和离线可用性的需求,无需将数据发送★ 251
chitrachitra 是一个面向全栈深度学习的多功能 Python 库,旨在简化从模型构建到 API 开发再到模型部署的完整流程。它解决了深度学习项目中常见的工程化痛点★ 234
HugsVisionHugsVision 是一个基于 Hugging Face 生态的计算机视觉工具包装库,旨在让开发者用极简的代码调用最新的视觉模型。它解决了传统视觉任务中模型集★ 199
polynomial_netsΠ-nets(多项式神经网络)是CVPR'20论文的官方实现,并扩展至T-PAMI-21版本。该项目旨在用多项式函数替代传统神经网络中的非线性激活和权重组合,通★ 174
MHLAMHLA 是一个面向图像生成与语言建模的线性注意力机制改进项目,旨在解决线性注意力在表达力上的不足。传统线性注意力通过核函数近似 softmax 注意力,虽降低★ 157
EVE-Online-BotEVE-Online-Bot 是一个面向《EVE Online》的开源自动化机器人项目,用 Jupyter Notebook 编写,结合机器学习与图像处理技术让★ 139
ComfyUI-Forbidden-VisionComfyUI-Forbidden-Vision 是一个为 ComfyUI 设计的图像处理插件,专注于人脸检测、分割与增强。它通过自定义训练的模型,解决了在动漫★ 102
serving-pytorch-modelsserving-pytorch-models 是一个面向 PyTorch 模型生产部署的教程型开源项目,主要展示如何使用 TorchServe 将训练好的 Py★ 102
image-rankerimage-ranker 是一个在浏览器中通过两两对比来给图像排序的开源工具,基于 TrueSkill 算法。它主要解决图像数据集构建和排序中的主观评估问题,让★ 92
pixlstashPixlStash 是一个用于管理混乱图像库的开源工具。它通过自动导入和打标签(captioning)功能,帮助用户整理大量图片。用户可以通过内容或人脸进行搜索★ 89
Image_Preprocessing_Techniques这是一个图像预处理技术集合库,专注于为图像分类和图像生成任务提供多种预处理方法。项目基于Python和Keras实现,收集了包括归一化、数据增强、滤波、几何变换★ 79
computer-vision-challenge这是一个面向所有人的计算机视觉实战项目合集,基于Jupyter Notebook编写,涵盖CNN、图像分类、目标检测等经典算法。项目通过一系列可运行的代码示例和★ 68