计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

NegPrompt 开源

用负提示让AI识别未知,开箱即用提升OOD检测

NegPrompt 是 CVPR 2024 论文的官方实现,专注于解决深度学习模型在开放世界中的分布外(OOD)检测···

★ 62 评分 2024-03-15
yolo-flutter-app 开源

Flutter 一行调用,手机端跑 YOLO 实时识别

yolo-flutter-app 是 Ultralytics 官方推出的 Flutter 插件,让移动端应用可以直接调用 YOLO 系列模···

★ 497 评分 2024-03-12
GEM-3D 开源

用扩散模型增强三维医学图像,提升生成质量与完整性

GEM-3D 是一个面向三维医学图像生成的增强工具,发表于 IJCV 2026。它针对医学影像数据稀缺、质量不···

★ 81 评分 2024-03-11
WinCLIP 开源

用 CLIP 实现零样本工业异常检测,无需训练样本即可定位缺陷

WinCLIP 是 CVPR 2023 论文《WinCLIP: Zero-/few-shot anomaly classification and segmentation》···

★ 74 评分 2024-03-11
Stable-Diffusion-Seg 开源

用 Stable Diffusion 单步反演,让医学图像分割又快又准

Stable-Diffusion-Seg 是 MICCAI 2024 论文的官方代码库,专注于利用 Stable Diffusion 模型进行生···

★ 116 评分 2024-03-07
GiT 开源

一个Transformer搞定分类、检测、分割和生成,视觉任务不再分家。

GiT是一个面向通用视觉任务的Transformer模型,源自ECCV 2024 Oral论文。它通过统一的语言接口,将···

★ 365 评分 2024-03-07
InCTRL 开源

给几个正常样本,就能检测任何新场景的异常

InCTRL 是 CVPR 2024 论文的官方实现,提出了一种基于上下文残差学习的通用异常检测方法。它解决的···

★ 202 评分 2024-03-02
EndoDAC 开源

让基础模型秒变内窥镜深度感知专家,无需标注即可用

EndoDAC 是一个面向内窥镜手术场景的自监督深度估计模型,发表于 MICCAI 2024。它解决了基础模型(···

★ 97 评分 2024-02-20
ComfyUI-YoloWorld-EfficientSAM 开源

在 ComfyUI 里用一句话圈出物体,自动分割并精准编辑。

这是一个为 ComfyUI 开发的插件,非官方实现了 YOLO-World 与 EfficientSAM 的结合。它主要解决在图···

★ 827 评分 2024-02-19
yolo-ios-app 开源

把 YOLO 塞进 iPhone,相机一开就能实时识别与分割

yolo-ios-app 是 Ultralytics 官方推出的 iOS 应用与 Swift Package,把 YOLO 系列模型通过 Core M···

★ 515 评分 2024-02-11
ID-Card-Passport-Recognition-Android 开源

拍证件自动识别真伪,Android 端一站式 eKYC 核验

这是一个面向 Android 平台的证件识别 SDK,主要解决移动端 eKYC(电子身份认证)场景下的证件信息···

★ 202 评分 2024-01-31
ComfyUI-Qwen-VL-API 开源

在ComfyUI里直接调用通义千问视觉模型,让图像生成更智能

ComfyUI-Qwen-VL-API 是一个将阿里云通义千问视觉语言模型(Qwen-VL-Plus 和 Qwen-VL-Max)集成到 ···

★ 219 评分 2024-01-30
EscherNet 开源

从几张照片生成任意视角新图,3D重建更轻松

EscherNet是一个基于生成模型的视图合成工具,由CVPR 2024作为Oral论文提出。它解决了从少量输入图···

★ 380 评分 2024-01-30
TensorRT-YOLO 开源

把 YOLO 模型在 NVIDIA 上跑得又快又省心

TensorRT-YOLO 是一个面向 NVIDIA GPU 的 YOLO 系列模型部署工具包,旨在让 YOLO 的推理部署更简单···

★ 1889 评分 2024-01-28
latent-diffusion-segmentation 开源

用扩散模型做开放世界分割,一句话就能分割并修复图像

这是一个基于潜在扩散模型(Latent Diffusion)的开放世界全景分割与掩码修复工具,来自ECCV 2024论···

★ 109 评分 2024-01-15
osam 开源

本地一键运行多种SAM分割模型,快速验证提示视觉能力

osam 是一个本地运行提示型视觉模型的工具,支持 SAM1、SAM2、SAM3、EfficientSAM、YOLO-World 等模···

★ 96 评分 2024-01-14
Hands-On-Learning-in-Computer-Vision 开源

打开 Notebook 就能跑,边做边学计算机视觉

这是一个以 Jupyter Notebook 形式组织的计算机视觉动手学习项目,把从图像基础操作到深度学习模型···

★ 579 评分 2024-01-12
surya 开源

多语言文档一键 OCR,版面表格阅读顺序全搞定

Surya 是一个面向文档智能的开源工具包,核心解决多语言文档的 OCR 与结构化理解问题。它不仅能做传···

★ 21415 评分 2024-01-10
ocean 开源

Meta 出品的跨平台 CV/AR 框架,一套 C++ 代码跑多端视觉应用

Ocean 是 Meta 内部开源的计算机视觉与增强现实应用框架,主要用 C/C++ 实现,强调平台无关性。它把···

★ 794 评分 2024-01-06
ocrs 开源

Rust 原生 OCR,图片转文字,部署零依赖

ocrs 是一个用 Rust 编写的 OCR 库和命令行工具,目标是从图片中提取文字。它把机器学习模型推理封···

★ 1891 评分 2024-01-02
Construction-Hazard-Detection 开源

YOLO+聚类自动圈出工地危险区,实时告警

Construction-Hazard-Detection 是一个面向建筑工地安全的开源计算机视觉项目。它基于 YOLO 目标检···

★ 350 评分 2024-01-02
amodal 开源

看穿遮挡,AI补全物体被遮住的完整模样

Amodal是CVPR 2024 Highlight论文《Amodal Completion via Progressive Mixed Context Diffusion》···

★ 56 评分 2023-12-31
ArXiv_CV_Papers_Daily 开源

每天自动汇总 arXiv 最新 CV 论文,省去手动翻页

这是一个自动抓取 arXiv 上最新计算机视觉论文的每日订阅工具,用 Python 编写。它解决的是 CV 研究···

★ 253 评分 2023-12-28
pix2gestalt 开源

从部分可见图像,零样本补全出完整物体形状

pix2gestalt 是 CVPR 2024 论文的开源代码,专注于模态补全(amodal completion)任务,即从部分可···

★ 210 评分 2023-12-22