计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

MaterialPalette 开源

一张照片,提取材质贴图,直接用于渲染和编辑。

MaterialPalette 是 CVPR 2024 的官方实现,旨在从单张真实世界图像中提取材质属性(包括反照率、法···

★ 283 评分 2023-10-01
SLiMe 开源

一张示例图,让Stable Diffusion学会分割任意目标

SLiMe是一个基于Stable Diffusion的单样本图像分割工具,只需一张标注示例图像即可分割出目标对象,···

★ 143 评分 2023-09-27
sd-webui-reactor-sfw 开源

在 Stable Diffusion 里一键换脸,安全无 NSFW,快速出图

sd-webui-reactor-sfw 是一个面向 Stable Diffusion WebUI 的快速人脸替换扩展,兼容 A1111、SD.Ne···

★ 313 评分 2023-09-23
talk2bev 开源

让自动驾驶地图能听懂人话,直接问答周围环境

Talk2BEV 是一个面向自动驾驶场景的语言增强型鸟瞰图(BEV)地图开源项目,发表于 ICRA 2024。它解···

★ 125 评分 2023-09-15
GraspGPT_public 开源

从图像直接预测机器人抓取姿态,快速复现SOTA抓取模型。

GraspGPT_public 是 GraspGPT 和 FoundationGrasp 模型的官方代码实现,专注于机器人抓取领域。它解···

★ 149 评分 2023-08-16
GPT4Point 开源

让AI看懂3D点云,听懂人话,直接生成和编辑3D模型。

GPT4Point 是一个面向3D点云与语言统一理解与生成的框架,来自CVPR 2024 Highlight。它解决的是3D点···

★ 447 评分 2023-08-12
DriveLM 开源

用图问答让自动驾驶学会推理和解释

DriveLM 是一个面向自动驾驶的视觉问答(VQA)基准与数据集,源自 ECCV 2024 Oral 论文。它提出用图···

★ 1347 评分 2023-08-08
RawMangaReader 开源

本地离线识别日文漫画文字,保护隐私免上传

RawMangaReader 是一款面向漫画爱好者的 OCR 桌面应用,主要解决生肉日文漫画阅读时的文字识别与翻···

★ 102 评分 2023-08-07
LISA 开源

让大模型看懂指令,直接分割出你想要的物体

LISA 是一个基于大型语言模型(LLM)的推理分割(Reasoning Segmentation)项目。它解决的是传统图···

★ 2682 评分 2023-08-01
DZ-FaceDetailer 开源

在 ComfyUI 中一键修复和增强生成图像的人脸细节。

DZ-FaceDetailer 是一个专为 ComfyUI 设计的节点,用于人脸修复、编辑和增强。它利用人脸识别技术,···

★ 234 评分 2023-07-26
llm_aided_ocr 开源

用 LLM 把扫描 PDF 变成干净 Markdown,识别更准、格式更规整。

llm_aided_ocr 是一个利用大语言模型(LLM)增强 Tesseract OCR 输出的开源工具。它解决传统 OCR 识···

★ 3004 评分 2023-07-26
Awesome-LLMs-for-Video-Understanding 开源

一页看全视频大模型论文代码数据集

这是一个面向视频理解领域的大语言模型(Vid-LLMs)资源汇总仓库,系统整理了最新论文、代码与数据···

★ 3289 评分 2023-07-16
MovieChat 开源

把整部电影装进模型,问啥答啥,长视频理解不再难。

MovieChat 是一个面向长视频理解的开源模型,由 CVPR 2024 论文提出。它解决了现有视频理解模型难以···

★ 707 评分 2023-06-26
APTM 开源

用自然语言精准找目标人物,多属性提示学习提升检索准确率

APTM 是论文《Towards Unified Text-based Person Retrieval: A Large-scale Multi-Attribute and ···

★ 177 评分 2023-06-19
STU-Net 开源

14亿参数医学分割大模型,预训练即拿高分

STU-Net 是一个基于大规模预训练的医学图像分割模型,参数量达 14 亿,是目前已知最大的医学分割模···

★ 116 评分 2023-06-15
universal-medical-image-segmentation 开源

一个模型搞定多种医学图像分割任务

这是一个面向医学图像分割的开源项目,旨在提供统一的医学图像分割解决方案。它解决了医学影像分析···

★ 84 评分 2023-06-01
Conceptor 开源

读懂扩散模型的隐藏语言,精准操控图像生成

Conceptor 是论文《The Hidden Language of Diffusion Models》的官方实现,旨在揭示并操控 Stable···

★ 78 评分 2023-05-30
VisCy 开源

显微图像自动提取单细胞特征,省去人工分析

VisCy 是一个面向单细胞表型分析的开源计算机视觉工具库,主要服务于生物图像分析场景。它把深度学···

★ 104 评分 2023-05-30
gen-cv 开源

用自然语言搞定视觉任务,快速搭建生成式视觉应用

gen-cv 是微软推出的视觉 AI 解决方案加速器,旨在帮助开发者快速构建基于生成式计算机视觉的应用。···

★ 435 评分 2023-05-26
AL_Yolo 开源

实时检测画面目标并自动跟踪,低延迟响应

AL_Yolo 是一个基于 YOLOv5 的实时计算机视觉系统,专注于低延迟的视觉目标检测与跟踪。它把 YOLOv···

★ 366 评分 2023-05-22
FasterViT 开源

让视觉 Transformer 又快又准,高分辨率图像处理利器

FasterViT 是一个面向视觉任务的高效 Transformer 模型,由 NVIDIA 研究人员开发,相关论文发表于 ···

★ 924 评分 2023-05-19
OpenShape_code 开源

让AI看懂任意3D形状,零样本也能分类检索

OpenShape是面向开放世界3D形状理解的表示学习框架,旨在解决传统3D模型在类别覆盖和语义泛化上的局···

★ 321 评分 2023-05-18
darknet 开源

轻量 C 框架,CPU 也能跑 YOLO 实时检测

Darknet 是一个用 C 和 CUDA 编写的开源神经网络框架,由 Joseph Redmon 创建,最著名的用途是训练···

★ 853 评分 2023-05-18
ladi-vton 开源

上传衣服和模特图,AI 生成自然逼真的试穿效果

LaDI-VTON 是一个基于潜在扩散模型(Latent Diffusion)的虚拟试穿项目,发表于 ACM MM 2023。它解···

★ 465 评分 2023-05-17