object-detection
本站收录 108 个带「object-detection」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
ultralyticsUltralytics 是计算机视觉领域最流行的开源工具包,提供 YOLO 系列目标检测模型(包括 YOLOv8、YOLO11 及最新的 YOLO26)的一站式★ 62,103
yolov5YOLOv5 是 Ultralytics 团队开发的基于 PyTorch 的目标检测框架,是目前计算机视觉领域最流行的开源项目之一。它解决了实时目标检测、实例分★ 58,097
supervisionsupervision 是一个专注于计算机视觉的可复用工具库,旨在简化视觉任务的开发流程。它解决了开发者在目标检测、分割、分类等任务中重复编写样板代码的问题,提★ 51,079
LocalAI开源的本地 AI 推理引擎,无需 GPU 即可在任何硬件上运行 LLM、视觉、语音、图像与视频等多种模型,兼容 OpenAI API 接口,是构建私有化 AI ★ 49,323
frigateFrigate 是一个开源的网络录像机(NVR),专为 IP 摄像头设计,内置实时本地对象检测功能。它解决了传统监控系统依赖云端或高延迟检测的问题,通过边缘计算★ 36,178
cvatCVAT(Computer Vision Annotation Tool)是一个开源的计算机视觉标注平台,旨在帮助AI团队高效构建高质量视觉数据集。它解决了从原★ 16,821
pytorch-grad-campytorch-grad-cam 是一个用于计算机视觉模型可解释性的高级工具库,基于 PyTorch 实现 Grad-CAM 及其多种变体。它解决了深度学习模型★ 12,984
fiftyoneFiftyOne 是一个面向计算机视觉团队的开源数据集管理与模型评估工具,由 Voxel51 开发。它解决了视觉 AI 开发中数据质量差、模型错误难以定位、数据★ 11,130
autogluonAutoGluon 是一个自动化机器学习(AutoML)库,旨在用三行代码实现快速且准确的模型训练。它解决了传统机器学习中模型选择、超参数调优和特征工程耗时费力★ 10,754
yolov3这是一个基于PyTorch实现的YOLOv3目标检测项目,支持YOLOv3、YOLOv3-SPP和YOLOv3-tiny三种模型。它解决了从模型训练到部署的全流★ 10,612
X-AnyLabelingX-AnyLabeling 是一款轻量、高效、跨平台的桌面标注工具,专为文本、图像、视频和多模态数据设计。它集成了丰富的内置标注工具(如矩形框、多边形、关键点等★ 10,569
techniques这是一个专注于卫星与航空影像深度学习技术的开源项目,汇集了针对地球观测数据的卷积神经网络、数据集构建、图像分类等核心方法。它解决了遥感领域缺乏系统化深度学习实践★ 10,269
notebooks这是一个计算机视觉领域的教程合集,基于 Jupyter Notebook 编写,旨在帮助开发者从基础到前沿系统学习视觉模型与技术。项目覆盖了从 ResNet 等★ 9,696
rf-detrRF-DETR 是 Roboflow 推出的实时目标检测与实例分割模型,基于 DETR 架构,在 COCO 数据集上达到当前最优水平(SOTA),并针对微调场景★ 9,651
TensorLayerTensorLayer 是一个面向科学家和工程师的深度学习与强化学习库,基于 Python 构建。它旨在解决深度学习研究和工程应用中模型搭建复杂、调试困难、部署★ 7,382
sahiSAHI 是一个专注于计算机视觉的切片推理框架,旨在解决大尺寸图像(如卫星影像、医学图像)在目标检测和实例分割时因内存限制或小目标密集而导致的性能问题。它支持任★ 5,518
sportssports 是一个专注于计算机视觉在体育领域应用的开源项目,主要解决体育视频和图像中的目标检测、关键点检测、球员追踪、动作识别等问题。项目以足球为主要场景,提★ 5,395
Object-Detection-MetricsObject-Detection-Metrics 是一个用于评估目标检测算法性能的 Python 工具库,主要实现了 PASCAL VOC 竞赛中定义的平均精度★ 5,103
mlkitmlkit 是 Google 官方维护的 ML Kit 示例应用集合,覆盖 Android 和 iOS 双平台。它通过完整可运行的代码演示了 ML Kit 的核★ 4,298
viseronViseron 是一款自托管的本地 NVR 与 AI 计算机视觉软件,专注于隐私保护,所有视频处理均在本地完成,无需云端依赖。它解决传统监控系统智能化不足的问题★ 3,553
catalystCatalyst 是一个面向深度学习研究与开发的 Python 框架,旨在加速从实验设计到模型部署的全流程。它解决了深度学习项目中代码重复、实验管理混乱、复现困★ 3,387
D-FINED-FINE 是一个基于 DETR 的端到端目标检测模型,核心创新在于将 DETR 中的回归任务重新定义为细粒度分布细化问题。它通过引入精细的分布建模和迭代优化★ 3,341
DeepCameraDeepCamera 是一个开源的 AI 摄像头技能平台,定位为智能 NVR 和闭路监控系统。它解决传统监控只能录像、无法理解视频内容的问题,通过本地 VLM(★ 3,079
VideoPipeVideoPipe 是一个基于计算机视觉模型和多模态大语言模型(mLLM)的跨平台视频结构化分析框架。它解决的是视频数据从原始帧到结构化信息的端到端处理问题,将★ 2,962
autodistillAutodistill 是一个面向计算机视觉的自动化标注与训练工具,旨在解决监督学习依赖大量人工标注的问题。它利用基础模型(如 GPT-4V、CLIP、Grou★ 2,783
evadbEvaDB 是一个专为 AI 应用设计的数据库系统,旨在简化 AI 功能的集成。它允许开发者通过类似 SQL 的查询语言,在数据库内部直接调用机器学习模型,处理★ 2,674
deepdetectdeepdetect 是一个开源的深度学习服务器和命令行工具,最初由 Jolibrain 开发,旨在简化深度学习模型的部署和服务化。它支持多种深度学习框架,包括★ 2,551
inferenceinference 是一个将任何计算机或边缘设备转变为计算机视觉项目指挥中心的开源工具。它解决了视觉模型从开发到生产部署的复杂性问题,提供统一的推理 API,支★ 2,462
ailia-modelsailia-models 是一个汇集了预训练、前沿 AI 模型的集合,专为 ailia SDK 设计。它解决了 AI 模型从研究到部署之间的鸿沟,提供了统一、易★ 2,393
Open3D-MLOpen3D-ML 是 Open3D 的扩展库,专注于 3D 机器学习任务,如点云语义分割、物体检测和实例分割。它提供统一的数据集加载接口(支持 Semanti★ 2,351
MambaVisionMambaVision是CVPR 2025官方发布的PyTorch实现,提出了一种混合Mamba-Transformer视觉骨干网络。它针对视觉任务中Mamba★ 2,235
DEIMv2DEIMv2 是一个基于 DINOv3 的实时目标检测框架,旨在解决传统检测器在速度和精度之间难以平衡的问题。它利用 DETR 风格的 Transformer ★ 2,049
photonixPhotonix 是一个基于 Web 的现代化照片管理服务器,可部署在家用服务器上,让你在任何设备上快速找到目标照片。它通过对象识别、人脸识别、位置感知、颜色分★ 1,956
fastdupfastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识★ 1,911
TensorRT-YOLOTensorRT-YOLO 是一个面向 NVIDIA GPU 的 YOLO 系列模型部署工具包,旨在让 YOLO 的推理部署更简单、更快速。它基于 Tensor★ 1,892
CoreML-ModelsCoreML-Models 是一个将多种主流深度学习模型转换为 Apple Core ML 格式的模型仓库(Model Zoo)。它解决了 iOS/macOS ★ 1,878
Weighted-Boxes-FusionWeighted-Boxes-Fusion 是一个用于目标检测模型集成预测的 Python 库,核心实现了论文《Weighted boxes fusion (W★ 1,830
awesome-yolo-object-detectionawesome-yolo-object-detection 是一个精选 YOLO 目标检测系列开源项目和数据集的资源合集。它系统整理了 YOLO 从 v1 到 ★ 1,794
react-native-executorchreact-native-executorch 是一个将 Meta 的 ExecuTorch 推理引擎封装为 React Native 原生模块的开源库,让开发★ 1,750
awesome-segment-anything这是一个精选资源列表,系统整理了与 Segment Anything 模型(SAM)相关的论文、项目和工具。它解决了 AI 社区中 SAM 生态信息分散、难以追★ 1,702
lightly-trainlightly-train 是一个面向视觉模型的一体化训练框架,支持 YOLO、ViT、RT-DETR、DINOv3 等主流架构,覆盖预训练、微调和蒸馏全流程。★ 1,692
AutonomousVehicleControlBeginnersGuide本项目是面向自动驾驶控制算法初学者的开源技术指南,提供Python示例代码和配套文档,系统讲解车辆控制、定位、建图、标定、目标检测等核心模块。它解决初学者入门门★ 1,656
torchdistilltorchdistill 是一个基于 PyTorch 的免编码深度学习框架,专注于知识蒸馏(Knowledge Distillation)研究。它解决了知识蒸馏★ 1,633
clearcamClearCam 是一个开源的智能安防摄像头增强工具,通过 AI 技术为普通 RTSP 摄像头添加物体检测、追踪、移动通知和视频搜索能力。它解决了传统安防摄像头★ 1,633
OpenCVTutorialsOpenCVTutorials 是一份 OpenCV-Python 4.1 的中文文档项目,旨在为中文开发者提供系统、易懂的 OpenCV 学习资料。它解决了官★ 1,431
CVPR2024-Papers-with-Code-Demo这是一个CVPR 2024论文与代码的精选合集,旨在解决计算机视觉领域研究者难以快速获取最新成果和复现资源的问题。项目系统性地整理了CVPR 2024上发表的论★ 1,411
getigeti 是英特尔推出的计算机视觉模型训练平台,旨在用更少的数据和更短的时间构建高性能视觉模型。它解决了传统深度学习模型开发中数据标注成本高、训练周期长、调参复★ 1,344
frigate-hass-integrationFrigate Hass Integration 是 Home Assistant 的官方集成组件,用于将 Frigate NVR(网络视频录像机)无缝接入 H★ 1,273
nncfNNCF(Neural Network Compression Framework)是 Intel 开源的神经网络压缩框架,专为提升 OpenVINO 推理性能★ 1,204
VisionLLMVisionLLM 是一个专注于视觉-语言大模型的开源系列项目,旨在弥合视觉理解与语言模型之间的鸿沟。它解决的核心问题是传统视觉模型难以直接与大型语言模型高效协★ 1,154