VideoGLaMM
开源
让AI看懂视频里每个像素,指哪打哪精准分割
VideoGLaMM 是一个面向视频像素级视觉定位的大型多模态模型,由南洋理工大学等机构在 CVPR 2025 发···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
VideoGLaMM
开源
让AI看懂视频里每个像素,指哪打哪精准分割
VideoGLaMM 是一个面向视频像素级视觉定位的大型多模态模型,由南洋理工大学等机构在 CVPR 2025 发···
scene-language
开源
用程序+文字+嵌入,一句话生成可编辑的3D场景
Scene Language 是一个 CVPR 2025 Highlight 项目,提出了一种用程序、文字和嵌入向量统一表示3D场···
text-extract-api
开源
一条 API 把 PDF/图片变成干净 JSON,还能自动抹掉隐私信息
text-extract-api 是一个基于 Python 的文档解析服务,旨在将 PDF、Word、PPTX 等格式的文档以及图···
VLM-Grounder
开源
零样本 3D 定位,用自然语言直接找到目标物体
VLM-Grounder 是一个面向零样本 3D 视觉定位的智能体框架,基于视觉语言模型(VLM)实现。它解决了···
SensorLLM
开源
让大模型读懂传感器数据,零样本识别人类活动
SensorLLM是EMNLP 2025的官方实现,旨在将大语言模型与运动传感器数据对齐,用于人类活动识别。它解···
Awesome-Try-On-Models
开源
一站式找到虚拟试穿最新论文和代码,快速上手。
这是一个虚拟试穿(Virtual Try-on)领域的资源聚合仓库,系统整理了相关论文、代码和工具。它解决···
SG-Nav
开源
给机器人装上'3D地图+大脑',零训练就能找东西
SG-Nav 是一个面向机器人导航的零样本目标定位框架,核心解决大型语言模型(LLM)在未知环境中无法···
Pair-VPR
开源
用视觉Transformer让机器人认路更准,不怕光照季节变化
Pair-VPR 是一个基于视觉 Transformer 的视觉地点识别(VPR)开源模型,发表于 IEEE RA-L 2025。它···
litepali
开源
轻量级图像检索,云端部署省资源,检索快人一步
LitePali 是一个轻量高效的 ColPali 实现,专注于图像检索与索引,专为云端部署优化。它解决了传统···
notebooks
开源
云端一键跑通 YOLO 训练与推理全流程
这是 Ultralytics 官方维护的 YOLO 系列教程笔记本合集,主要面向 Colab、Kaggle 和 SageMaker 等云···
SARATR-X
开源
用基础模型让雷达图像识别更准更省标注
SARATR-X 是一个面向合成孔径雷达(SAR)目标识别的基础模型,旨在解决传统 SAR 图像解译依赖人工特···
scribe.js
开源
浏览器里直接识别图片和 PDF 文字,无需后端
scribe.js 是一个纯 JavaScript 的 OCR 与文本提取库,可在浏览器和 Node.js 中直接识别图片与 PDF···
Awesome-Robotics-3D
开源
一网打尽机器人3D视觉前沿论文与代码
Awesome-Robotics-3D 是一个精选资源列表,专注于大模型(LLM/VLM)时代下机器人领域的 3D 视觉研究···
D-FINE
开源
把 DETR 回归变细粒度,定位更准、收敛更快
D-FINE 是一个基于 DETR 的端到端目标检测模型,核心创新在于将 DETR 中的回归任务重新定义为细粒度···
PartGLEE
开源
识别并解析任意物体的部件,让AI看懂物体内部结构
PartGLEE是一个基于深度学习的视觉基础模型,旨在实现开放世界中的任意物体识别与解析。它能够同时···
AnomalyDINO
开源
用少量正常样本,精准揪出图像中的异常区域
AnomalyDINO 是一个基于 DINOv2 的少样本异常检测开源模型,发表于 WACV2025。它针对工业质检中标注···
ImageIndexer
开源
本地跑大模型,自动给图片打标签,搜图快人一步
ImageIndexer 是一个本地优先的图像索引与标注工具,用 Python 编写。它解决的是个人或小团队海量图···
FiT3D
开源
给二维视觉模型装上三维感知,微调后特征更懂空间结构
FiT3D 是一个针对二维基础模型(如 DINOv2、MAE 等)进行三维感知微调的开源框架,其研究成果发表于···
photoprism-vision
开源
快速搭建视觉实验环境,验证模型效果不费劲
photoprism-vision 是一个计算机视觉实验场,基于 Python 构建,旨在为开发者提供一个快速测试和验···
YoChameleon
开源
上传一张照片,生成你主演的各种场景图
YoChameleon 是一个 CVPR 2025 开源项目,旨在实现个性化图像生成中的身份保持与编辑。它解决的是在···
DTrOCR
开源
用纯解码器 Transformer 直接生成文字,简化 OCR 识别流程
DTrOCR 是论文《DTrOCR: Decoder-only Transformer for Optical Character Recognition》的 PyTorc···
VSLAM-LAB
开源
一条命令跑通多种 VSLAM 算法与数据集对比
VSLAM-LAB 是一个面向视觉 SLAM(VSLAM)研究的综合性开源框架,目标是统一管理各类 VSLAM 系统与数···
genima
开源
用扩散模型教机器人从演示中学会精细操作
GENIMA 是一个基于扩散模型的机器人操作学习框架,核心思路是通过行为克隆(Behavioral Cloning)和···
Autoregressive-Models-in-Vision-Surv···
开源
看这一篇,搞懂视觉自回归模型全貌
这是一份关于视觉自回归模型(AR models)的综述论文项目,发表于TMLR 2025。它系统梳理了自回归模···