NegPrompt
开源
用负提示让AI识别未知,开箱即用提升OOD检测
NegPrompt 是 CVPR 2024 论文的官方实现,专注于解决深度学习模型在开放世界中的分布外(OOD)检测···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
NegPrompt
开源
用负提示让AI识别未知,开箱即用提升OOD检测
NegPrompt 是 CVPR 2024 论文的官方实现,专注于解决深度学习模型在开放世界中的分布外(OOD)检测···
yolo-flutter-app
开源
Flutter 一行调用,手机端跑 YOLO 实时识别
yolo-flutter-app 是 Ultralytics 官方推出的 Flutter 插件,让移动端应用可以直接调用 YOLO 系列模···
GEM-3D
开源
用扩散模型增强三维医学图像,提升生成质量与完整性
GEM-3D 是一个面向三维医学图像生成的增强工具,发表于 IJCV 2026。它针对医学影像数据稀缺、质量不···
WinCLIP
开源
用 CLIP 实现零样本工业异常检测,无需训练样本即可定位缺陷
WinCLIP 是 CVPR 2023 论文《WinCLIP: Zero-/few-shot anomaly classification and segmentation》···
Stable-Diffusion-Seg
开源
用 Stable Diffusion 单步反演,让医学图像分割又快又准
Stable-Diffusion-Seg 是 MICCAI 2024 论文的官方代码库,专注于利用 Stable Diffusion 模型进行生···
GiT
开源
一个Transformer搞定分类、检测、分割和生成,视觉任务不再分家。
GiT是一个面向通用视觉任务的Transformer模型,源自ECCV 2024 Oral论文。它通过统一的语言接口,将···
InCTRL
开源
给几个正常样本,就能检测任何新场景的异常
InCTRL 是 CVPR 2024 论文的官方实现,提出了一种基于上下文残差学习的通用异常检测方法。它解决的···
EndoDAC
开源
让基础模型秒变内窥镜深度感知专家,无需标注即可用
EndoDAC 是一个面向内窥镜手术场景的自监督深度估计模型,发表于 MICCAI 2024。它解决了基础模型(···
ComfyUI-YoloWorld-EfficientSAM
开源
在 ComfyUI 里用一句话圈出物体,自动分割并精准编辑。
这是一个为 ComfyUI 开发的插件,非官方实现了 YOLO-World 与 EfficientSAM 的结合。它主要解决在图···
yolo-ios-app
开源
把 YOLO 塞进 iPhone,相机一开就能实时识别与分割
yolo-ios-app 是 Ultralytics 官方推出的 iOS 应用与 Swift Package,把 YOLO 系列模型通过 Core M···
ID-Card-Passport-Recognition-Android
开源
拍证件自动识别真伪,Android 端一站式 eKYC 核验
这是一个面向 Android 平台的证件识别 SDK,主要解决移动端 eKYC(电子身份认证)场景下的证件信息···
ComfyUI-Qwen-VL-API
开源
在ComfyUI里直接调用通义千问视觉模型,让图像生成更智能
ComfyUI-Qwen-VL-API 是一个将阿里云通义千问视觉语言模型(Qwen-VL-Plus 和 Qwen-VL-Max)集成到 ···
EscherNet
开源
从几张照片生成任意视角新图,3D重建更轻松
EscherNet是一个基于生成模型的视图合成工具,由CVPR 2024作为Oral论文提出。它解决了从少量输入图···
TensorRT-YOLO
开源
把 YOLO 模型在 NVIDIA 上跑得又快又省心
TensorRT-YOLO 是一个面向 NVIDIA GPU 的 YOLO 系列模型部署工具包,旨在让 YOLO 的推理部署更简单···
latent-diffusion-segmentation
开源
用扩散模型做开放世界分割,一句话就能分割并修复图像
这是一个基于潜在扩散模型(Latent Diffusion)的开放世界全景分割与掩码修复工具,来自ECCV 2024论···
osam
开源
本地一键运行多种SAM分割模型,快速验证提示视觉能力
osam 是一个本地运行提示型视觉模型的工具,支持 SAM1、SAM2、SAM3、EfficientSAM、YOLO-World 等模···
Hands-On-Learning-in-Computer-Vision
开源
打开 Notebook 就能跑,边做边学计算机视觉
这是一个以 Jupyter Notebook 形式组织的计算机视觉动手学习项目,把从图像基础操作到深度学习模型···
surya
开源
多语言文档一键 OCR,版面表格阅读顺序全搞定
Surya 是一个面向文档智能的开源工具包,核心解决多语言文档的 OCR 与结构化理解问题。它不仅能做传···
ocean
开源
Meta 出品的跨平台 CV/AR 框架,一套 C++ 代码跑多端视觉应用
Ocean 是 Meta 内部开源的计算机视觉与增强现实应用框架,主要用 C/C++ 实现,强调平台无关性。它把···
ocrs
开源
Rust 原生 OCR,图片转文字,部署零依赖
ocrs 是一个用 Rust 编写的 OCR 库和命令行工具,目标是从图片中提取文字。它把机器学习模型推理封···
Construction-Hazard-Detection
开源
YOLO+聚类自动圈出工地危险区,实时告警
Construction-Hazard-Detection 是一个面向建筑工地安全的开源计算机视觉项目。它基于 YOLO 目标检···
amodal
开源
看穿遮挡,AI补全物体被遮住的完整模样
Amodal是CVPR 2024 Highlight论文《Amodal Completion via Progressive Mixed Context Diffusion》···
ArXiv_CV_Papers_Daily
开源
每天自动汇总 arXiv 最新 CV 论文,省去手动翻页
这是一个自动抓取 arXiv 上最新计算机视觉论文的每日订阅工具,用 Python 编写。它解决的是 CV 研究···
pix2gestalt
开源
从部分可见图像,零样本补全出完整物体形状
pix2gestalt 是 CVPR 2024 论文的开源代码,专注于模态补全(amodal completion)任务,即从部分可···