计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

samexporter 开源

把 SAM 系列模型一键导出 ONNX,秒级部署到任意平台

samexporter 是一个专注于将 Segment Anything 系列模型导出为 ONNX 格式的工具,支持 SAM、Mobile···

★ 428 评分 2023-05-11
RT-DETR 开源

无 NMS 端到端检测,精度速度双超 YOLO

RT-DETR 是百度提出的实时目标检测 Transformer,论文发表于 CVPR 2024,官方仓库同时提供 PaddleP···

★ 5557 评分 2023-05-10
Awesome-ICCV2023-Low-Level-Vision 开源

按图索骥,快速获取ICCV低层视觉论文与代码

这是一个整理ICCV 2023及2021低层视觉(Low-Level Vision)方向论文与代码的精选列表,涵盖去模糊、···

★ 194 评分 2023-04-27
CLIP-API-service 开源

把 CLIP 模型变成一行代码就能调用的 API,快速实现图文搜索与识别。

CLIP-API-service 是一个基于 OpenAI CLIP 模型封装的即用型 API 服务,旨在将 CLIP 的图文跨模态能···

★ 67 评分 2023-04-18
ISAT_with_segment_anything 开源

点几下就自动抠图,图像分割标注提速数倍

ISAT_with_segment_anything 是一款基于 Segment Anything 系列模型的交互式半自动图像标注工具,用···

★ 2182 评分 2023-04-18
awesome-segment-anything 开源

一网打尽 SAM 生态资源,快速上手图像分割

这是一个精选资源列表,系统整理了与 Segment Anything 模型(SAM)相关的论文、项目和工具。它解决···

★ 1700 评分 2023-04-12
STU-Net 开源

14亿参数医学分割大模型,开箱即用提升精度

STU-Net 是基于最大公开医学图像分割数据集(超过10万标注)训练的超大规模预训练模型,参数量达14···

★ 373 评分 2023-04-12
ShowAnything 开源

用语言或点击,轻松编辑视频中的任意目标

ShowAnything 是一个基于视觉与语言模型的视频生成与编辑工具,旨在通过自然语言指令或交互式点击,···

★ 84 评分 2023-04-11
sd-webui-segment-anything 开源

在 Stable Diffusion 里框选物体,即可精准重绘或替换

sd-webui-segment-anything 是一个为 Stable Diffusion WebUI 开发的插件,它将 Meta 的 Segment A···

★ 3498 评分 2023-04-10
grounded-segment-anything-colab 开源

一句话输入,自动检测分割并重绘图像,Colab 免费跑通全流程

这是一个基于 Colab 的交互式笔记本,整合了 Grounding DINO、Segment Anything 和 Stable Diffusi···

★ 191 评分 2023-04-10
awesome-segment-anything-extensions 开源

一网打尽 SAM 生态,找扩展项目不迷路

这是一个精选列表,汇集了围绕 Meta 的 Segment Anything Model (SAM) 生态的各类扩展项目、工具和···

★ 348 评分 2023-04-10
segment-anything-video 开源

一行命令给图片和视频做 SAM 分割,还能接 YOLO 检测

segment-anything-video(MetaSeg)是 Meta 的 Segment Anything(SAM)模型的工程化封装版本,主要···

★ 983 评分 2023-04-06
yolo-streamlit-detection-tracking 开源

上传视频或接摄像头,网页里实时看目标检测与跟踪效果

这是一个基于 YOLO 与 Streamlit 的实时目标检测与跟踪演示项目,面向需要快速验证视频流分析能力的···

★ 427 评分 2023-03-18
RiDDLE 开源

给照片人脸加密,可还原还能换身份,隐私保护一步到位

RiDDLE是CVPR 2023论文《Reversible and Diversified De-identification with Latent Encryptor》的···

★ 56 评分 2023-03-03
BlackVIP 开源

黑盒模型也能迁移学习,用视觉提示搞定下游任务

BlackVIP 是 CVPR 2023 论文的官方实现,专注于黑盒视觉提示(Black-Box Visual Prompting)技术。···

★ 107 评分 2023-02-27
yolo_ros 开源

在 ROS 2 里一行启动 YOLO 检测,图像进结果出

yolo_ros 是把 Ultralytics YOLO 系列模型(YOLOv8/v9/v10/v11/v12)封装成 ROS 2 节点的开源项目,···

★ 1140 评分 2023-02-21
InstructCV 开源

用一句话指令,让扩散模型搞定多种视觉任务

InstructCV 是一个基于指令微调文本到图像扩散模型的视觉通用框架,源自 ICLR 2024 论文。它旨在解···

★ 461 评分 2023-02-04
obsidian-text-extractor 开源

图片PDF一键变可搜索文字,笔记整理效率翻倍

obsidian-text-extractor 是一个 Obsidian 笔记软件的配套插件,用于从图片和 PDF 文件中提取文字。···

★ 640 评分 2022-12-20
STranslate 开源

选中即译、截图即识,Windows 上最顺手的翻译 OCR 小工具

STranslate 是一款基于 WPF 开发的 Windows 桌面翻译与 OCR 工具,主打“即用即走”的轻量交互。它···

★ 8114 评分 2022-12-17
awesome-industrial-anomaly-detection 开源

一库在手,快速检索工业缺陷检测论文与数据集

这是一个持续更新的工业图像异常/缺陷检测论文与数据集检索库,汇集了该领域从经典到前沿的学术资源···

★ 3798 评分 2022-12-02
sparsefusion 开源

从稀疏视角生成高质量3D模型,重建新视角图像

SparseFusion 是一个基于视图条件扩散模型的 3D 重建开源项目,发表于 CVPR 2023。它解决的是从少量···

★ 380 评分 2022-12-01
supervision 开源

写视觉代码太繁琐?用 supervision 几行搞定检测、分割和可视化。

supervision 是一个专注于计算机视觉的可复用工具库,旨在简化视觉任务的开发流程。它解决了开发者···

★ 51050 评分 2022-11-28
Conffusion 开源

给扩散模型生成结果加上统计置信区间,量化不确定性

Conffusion 是论文《Conffusion: Confidence Intervals for Diffusion Models》的官方实现,旨在为···

★ 143 评分 2022-11-17
EVA 开源

用智源EVA视觉大模型,轻松提升图像任务精度

EVA是北京智源人工智能研究院(BAAI)开源的一系列视觉基础模型,专注于视觉表示学习。它通过大规模···

★ 2695 评分 2022-11-14