计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

VideoGLaMM 开源

让AI看懂视频里每个像素,指哪打哪精准分割

VideoGLaMM 是一个面向视频像素级视觉定位的大型多模态模型,由南洋理工大学等机构在 CVPR 2025 发···

★ 106 评分 2024-10-31
scene-language 开源

用程序+文字+嵌入,一句话生成可编辑的3D场景

Scene Language 是一个 CVPR 2025 Highlight 项目,提出了一种用程序、文字和嵌入向量统一表示3D场···

★ 270 评分 2024-10-27
text-extract-api 开源

一条 API 把 PDF/图片变成干净 JSON,还能自动抹掉隐私信息

text-extract-api 是一个基于 Python 的文档解析服务,旨在将 PDF、Word、PPTX 等格式的文档以及图···

★ 3180 评分 2024-10-23
VLM-Grounder 开源

零样本 3D 定位,用自然语言直接找到目标物体

VLM-Grounder 是一个面向零样本 3D 视觉定位的智能体框架,基于视觉语言模型(VLM)实现。它解决了···

★ 133 评分 2024-10-17
SensorLLM 开源

让大模型读懂传感器数据,零样本识别人类活动

SensorLLM是EMNLP 2025的官方实现,旨在将大语言模型与运动传感器数据对齐,用于人类活动识别。它解···

★ 110 评分 2024-10-12
Awesome-Try-On-Models 开源

一站式找到虚拟试穿最新论文和代码,快速上手。

这是一个虚拟试穿(Virtual Try-on)领域的资源聚合仓库,系统整理了相关论文、代码和工具。它解决···

★ 452 评分 2024-10-10
SG-Nav 开源

给机器人装上'3D地图+大脑',零训练就能找东西

SG-Nav 是一个面向机器人导航的零样本目标定位框架,核心解决大型语言模型(LLM)在未知环境中无法···

★ 353 评分 2024-10-06
Pair-VPR 开源

用视觉Transformer让机器人认路更准,不怕光照季节变化

Pair-VPR 是一个基于视觉 Transformer 的视觉地点识别(VPR)开源模型,发表于 IEEE RA-L 2025。它···

★ 66 评分 2024-10-04
litepali 开源

轻量级图像检索,云端部署省资源,检索快人一步

LitePali 是一个轻量高效的 ColPali 实现,专注于图像检索与索引,专为云端部署优化。它解决了传统···

★ 132 评分 2024-09-13
notebooks 开源

云端一键跑通 YOLO 训练与推理全流程

这是 Ultralytics 官方维护的 YOLO 系列教程笔记本合集,主要面向 Colab、Kaggle 和 SageMaker 等云···

★ 243 评分 2024-08-26
SARATR-X 开源

用基础模型让雷达图像识别更准更省标注

SARATR-X 是一个面向合成孔径雷达(SAR)目标识别的基础模型,旨在解决传统 SAR 图像解译依赖人工特···

★ 270 评分 2024-08-18
scribe.js 开源

浏览器里直接识别图片和 PDF 文字,无需后端

scribe.js 是一个纯 JavaScript 的 OCR 与文本提取库,可在浏览器和 Node.js 中直接识别图片与 PDF···

★ 321 评分 2024-08-15
Awesome-Robotics-3D 开源

一网打尽机器人3D视觉前沿论文与代码

Awesome-Robotics-3D 是一个精选资源列表,专注于大模型(LLM/VLM)时代下机器人领域的 3D 视觉研究···

★ 825 评分 2024-08-12
D-FINE 开源

把 DETR 回归变细粒度,定位更准、收敛更快

D-FINE 是一个基于 DETR 的端到端目标检测模型,核心创新在于将 DETR 中的回归任务重新定义为细粒度···

★ 3334 评分 2024-08-12
PartGLEE 开源

识别并解析任意物体的部件,让AI看懂物体内部结构

PartGLEE是一个基于深度学习的视觉基础模型,旨在实现开放世界中的任意物体识别与解析。它能够同时···

★ 66 评分 2024-08-08
AnomalyDINO 开源

用少量正常样本,精准揪出图像中的异常区域

AnomalyDINO 是一个基于 DINOv2 的少样本异常检测开源模型,发表于 WACV2025。它针对工业质检中标注···

★ 255 评分 2024-07-30
ImageIndexer 开源

本地跑大模型,自动给图片打标签,搜图快人一步

ImageIndexer 是一个本地优先的图像索引与标注工具,用 Python 编写。它解决的是个人或小团队海量图···

★ 396 评分 2024-07-23
FiT3D 开源

给二维视觉模型装上三维感知,微调后特征更懂空间结构

FiT3D 是一个针对二维基础模型(如 DINOv2、MAE 等)进行三维感知微调的开源框架,其研究成果发表于···

★ 331 评分 2024-07-20
photoprism-vision 开源

快速搭建视觉实验环境,验证模型效果不费劲

photoprism-vision 是一个计算机视觉实验场,基于 Python 构建,旨在为开发者提供一个快速测试和验···

★ 60 评分 2024-07-15
YoChameleon 开源

上传一张照片,生成你主演的各种场景图

YoChameleon 是一个 CVPR 2025 开源项目,旨在实现个性化图像生成中的身份保持与编辑。它解决的是在···

★ 151 评分 2024-07-15
DTrOCR 开源

用纯解码器 Transformer 直接生成文字,简化 OCR 识别流程

DTrOCR 是论文《DTrOCR: Decoder-only Transformer for Optical Character Recognition》的 PyTorc···

★ 206 评分 2024-07-13
VSLAM-LAB 开源

一条命令跑通多种 VSLAM 算法与数据集对比

VSLAM-LAB 是一个面向视觉 SLAM(VSLAM)研究的综合性开源框架,目标是统一管理各类 VSLAM 系统与数···

★ 557 评分 2024-07-13
genima 开源

用扩散模型教机器人从演示中学会精细操作

GENIMA 是一个基于扩散模型的机器人操作学习框架,核心思路是通过行为克隆(Behavioral Cloning)和···

★ 77 评分 2024-07-09
Autoregressive-Models-in-Vision-Surv··· 开源

看这一篇,搞懂视觉自回归模型全貌

这是一份关于视觉自回归模型(AR models)的综述论文项目,发表于TMLR 2025。它系统梳理了自回归模···

★ 808 评分 2024-07-01