computer-vision
本站收录 366 个带「computer-vision」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
opencvOpenCV(Open Source Computer Vision Library)是一个开源的计算机视觉和机器学习软件库,提供超过2500种优化算法,涵盖图★ 91,011
cs-video-courses这是一个精心整理的计算机科学视频课程清单,收录了全球顶尖大学和机构的免费视频讲座,涵盖算法、人工智能、系统、理论、生物信息学、计算物理等广泛领域。项目解决了计算★ 83,580
AI-For-Beginners微软出品的AI入门教程,专为初学者设计,用12周24课时的结构系统讲解人工智能核心知识。课程覆盖神经网络基础、计算机视觉(CNN)、自然语言处理(RNN)、生成★ 69,261
ultralyticsUltralytics 是计算机视觉领域最流行的开源工具包,提供 YOLO 系列目标检测模型(包括 YOLOv8、YOLO11 及最新的 YOLO26)的一站式★ 62,103
ai-engineering-from-scratch这是一个面向AI工程师的免费开源课程,旨在帮助学习者从零开始掌握AI工程的核心技能。项目内容涵盖机器学习、深度学习、生成式AI、计算机视觉、大语言模型和智能体等★ 61,160
yolov5YOLOv5 是 Ultralytics 团队开发的基于 PyTorch 的目标检测框架,是目前计算机视觉领域最流行的开源项目之一。它解决了实时目标检测、实例分★ 58,097
supervisionsupervision 是一个专注于计算机视觉的可复用工具库,旨在简化视觉任务的开发流程。它解决了开发者在目标检测、分割、分类等任务中重复编写样板代码的问题,提★ 51,079
mediapipeMediaPipe 是 Google 开源的跨平台机器学习解决方案框架,专为实时和流媒体场景设计。它解决的是开发者难以高效构建、部署和优化多模态 ML 应用的问★ 37,118
500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code这是一个收录了约500个AI、机器学习、深度学习、计算机视觉和自然语言处理项目的代码合集仓库,本质上是面向学习者和开发者的资源索引。它解决的核心问题是:初学者面★ 37,051
label-studio支持多类型数据标注的开源工具,覆盖图像、文本、音频、视频等多种数据格式,输出格式标准化,方便直接对接模型训练流程。提供灵活的标注界面、协作审核机制与丰富的集成能★ 28,371
vit-pytorchvit-pytorch 是一个基于 PyTorch 实现的 Vision Transformer(ViT)模型库,由 Phil Wang(lucidrains)★ 25,525
pytorch-CycleGAN-and-pix2pixPyTorch 实现的经典图像到图像转换框架,包含 pix2pix 与 CycleGAN 两大模型,支持风格迁移、图像修复、超分辨率等任务,是学习与复现 GAN★ 25,254
CV这是一份已完结的深度学习综合学习笔记,整合了多个知名课程的精髓,包括土堆的Pytorch教程、李沐的《动手学深度学习》、吴恩达的《深度学习》以及大飞的《大模型A★ 23,851
MaaAssistantArknightsMaaAssistantArknights 是一款专为《明日方舟》游戏设计的自动化辅助工具,常被玩家称为“MAA”。它通过计算机视觉技术识别游戏画面,自动完成日★ 23,518
learnopencvLearn OpenCV 是一个专注于 OpenCV 与计算机视觉教学的开源项目,由 Satya Mallick 等人维护,提供大量 C++ 和 Python ★ 23,171
datasetsdatasets 是 Hugging Face 推出的开源数据集库,旨在成为 AI 模型就绪数据集的中心枢纽。它解决了机器学习从业者在数据获取、处理和加载过程中★ 22,016
screenpipescreenpipe 是一个本地优先的屏幕录制与 AI 代理连接工具,由 YC 孵化的开源项目。它持续记录屏幕内容(24/7),并通过本地、私密、安全的方式将录★ 21,777
visionvision 是 Hugging Face 团队开发的计算机视觉工具库,专注于提供图像、视频数据集、变换(transforms)和预训练模型的一站式接口。它解决★ 17,935
cvatCVAT(Computer Vision Annotation Tool)是一个开源的计算机视觉标注平台,旨在帮助AI团队高效构建高质量视觉数据集。它解决了从原★ 16,821
labelmelabelme 是一个基于 Python 的图像标注工具,主要用于计算机视觉和深度学习任务中的数据准备。它解决了研究人员和开发者需要手动标注图像以构建训练数据集★ 16,201
dlibdlib 是一个用 C++ 编写的现代机器学习工具包,旨在帮助开发者构建真实世界的机器学习和数据分析应用。它解决了从算法原型到产品部署过程中的工程化难题,提供了★ 14,453
carlaCARLA 是一个开源的自动驾驶研究模拟器,基于 C++ 和虚幻引擎构建,提供高保真的城市环境、车辆动力学、传感器模拟(如摄像头、激光雷达)以及交通流控制。它解★ 14,443
open_clipOpen_CLIP 是 CLIP 模型的开源实现,由 LAION 等社区维护,旨在复现并扩展 OpenAI 的 CLIP 模型。它解决了 CLIP 原始代码未开★ 14,174
MeshroomMeshroom 是一款基于节点的开源三维重建软件,由 AliceVision 项目提供支持。它通过可视化节点图(Node Graph)将摄影测量(Photog★ 12,987
pytorch-grad-campytorch-grad-cam 是一个用于计算机视觉模型可解释性的高级工具库,基于 PyTorch 实现 Grad-CAM 及其多种变体。它解决了深度学习模型★ 12,984
deep-learning-drizzle这是一个深度学习相关学习资源的精选合集,汇集了全球顶尖大学和机构的免费视频讲座,覆盖深度学习、强化学习、机器学习、计算机视觉和自然语言处理等核心领域。项目以分类★ 12,956
CycleGAN经典无监督图像风格迁移框架,无需成对数据即可实现照片转绘画、马变斑马等趣味效果,广泛应用于风格迁移与图像翻译领域,是计算机视觉领域教科书级的开源项目。★ 12,876
colmapCOLMAP 是一个通用的运动恢复结构(SfM)和多视角立体视觉(MVS)管线,以 C++ 实现,提供命令行和图形界面。它解决的核心问题是从无序图像集合中自动重★ 12,839
ludwigLudwig 是一个基于 Python 的低代码机器学习框架,旨在让开发者无需编写大量底层代码即可构建、训练和部署定制化的大语言模型、神经网络及其他 AI 模型★ 11,771
segmentation_models.pytorchsegmentation_models.pytorch 是一个基于 PyTorch 的语义分割模型库,提供 500+ 预训练骨干网络(涵盖卷积和 Transfo★ 11,749
rerunrerun 是一个用于多模态机器人数据可视化和流式处理的开源工具,采用 Rust 编写,提供 Python 和 C++ 接口。它解决机器人开发中传感器数据(如摄★ 11,515
korniaKornia 是一个基于 PyTorch 的可微计算机视觉库,专注于几何视觉和空间 AI。它解决了深度学习与经典视觉算法之间的鸿沟,提供了一组可微分的图像变换、★ 11,390
pclPCL(Point Cloud Library)是一个大型开源的C++点云处理库,专门用于2D/3D图像和点云数据的处理。它解决了机器人、自动驾驶、三维建模等领★ 11,135
fiftyoneFiftyOne 是一个面向计算机视觉团队的开源数据集管理与模型评估工具,由 Voxel51 开发。它解决了视觉 AI 开发中数据质量差、模型错误难以定位、数据★ 11,130
openvinoOpenVINO 是英特尔开源的 AI 推理优化与部署工具包,旨在帮助开发者将训练好的深度学习模型(如 PyTorch、TensorFlow、ONNX 等格式)★ 10,935
autogluonAutoGluon 是一个自动化机器学习(AutoML)库,旨在用三行代码实现快速且准确的模型训练。它解决了传统机器学习中模型选择、超参数调优和特征工程耗时费力★ 10,754
pix2pix基于条件对抗网络的开创性图像到图像翻译模型,只需成对数据即可实现线稿上色、语义图转照片、街景转换等任务,是 pix2pix 家族的奠基之作,对后续研究影响深远。★ 10,662
yolov3这是一个基于PyTorch实现的YOLOv3目标检测项目,支持YOLOv3、YOLOv3-SPP和YOLOv3-tiny三种模型。它解决了从模型训练到部署的全流★ 10,612
X-AnyLabelingX-AnyLabeling 是一款轻量、高效、跨平台的桌面标注工具,专为文本、图像、视频和多模态数据设计。它集成了丰富的内置标注工具(如矩形框、多边形、关键点等★ 10,569
notebooks这是一个计算机视觉领域的教程合集,基于 Jupyter Notebook 编写,旨在帮助开发者从基础到前沿系统学习视觉模型与技术。项目覆盖了从 ResNet 等★ 9,696
rf-detrRF-DETR 是 Roboflow 推出的实时目标检测与实例分割模型,基于 DETR 架构,在 COCO 数据集上达到当前最优水平(SOTA),并针对微调场景★ 9,651
deeplake面向 AI Agent 的数据运行时,提供无服务器 PostgreSQL 与多模态数据湖,支持大规模数据的高效检索与训练。开发者可以像使用数据库一样管理图像、文★ 9,245
introtodeeplearningMIT 6.S191《深度学习导论》课程的官方实验材料,包含一系列Jupyter Notebook教程,覆盖深度学习基础、计算机视觉、自然语言处理、生成模型等核★ 8,822
mmagicOpenMMLab 推出的多模态生成智能创作工具箱,提供开箱即用的 AIGC 能力、易用 API 与丰富模型库,涵盖文生图、图像/视频修复与增强等任务,是搭建生★ 7,470
lancelance 是一个面向多模态 AI 数据的开源列式存储格式,基于 Rust 和 Apache Arrow 构建。它解决了传统 Parquet 格式在随机访问、向★ 7,123
openMVGopenMVG(open Multiple View Geometry)是一个用 C++ 编写的开源多视图几何库,主要面向三维计算机视觉与运动恢复结构(Stru★ 6,563
courses这是一个精选的AI学习资源集合,收录了关于人工智能、机器学习、深度学习、计算机视觉、自然语言处理、多模态、生成模型和MLOps等领域的课程与资料链接。项目以Ma★ 6,487
smileSmile是一个基于Java的统计机器智能与学习引擎,专注于提供全面、高效的机器学习与数据挖掘工具。它解决了Java生态中缺乏功能完整且性能优异的ML库的问题,★ 6,414
remove-ai-watermarks这是一个用于移除AI生成图像水印的命令行工具和Python库,主要针对Google Gemini(Nano Banana)的可见星标水印、SynthID隐形水印★ 5,716
sahiSAHI 是一个专注于计算机视觉的切片推理框架,旨在解决大尺寸图像(如卫星影像、医学图像)在目标检测和实例分割时因内存限制或小目标密集而导致的性能问题。它支持任★ 5,518