计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

Lexicon3D 开源

测出视觉模型对三维世界的真实理解力

Lexicon3D 是一个面向复杂三维场景理解的开源评测框架,发表于 NeurIPS 2024。它系统性地探究了视觉···

★ 102 评分 2024-06-24
RGBT-Tiny 开源

双模态小目标检测基准,直接跑通基线对比

RGBT-Tiny 是论文《Visible-Thermal Tiny Object Detection: A Benchmark Dataset and Baselines》···

★ 240 评分 2024-06-19
FungalLight 开源

用 Rust 模拟真菌生长,生成有机形态与光影艺术

FungalLight 是一个基于 Rust 和 Bevy 引擎的真菌形态模拟项目,专注于图形生成、人工生命和动态光···

★ 322 评分 2024-06-16
MambaVision 开源

混合Mamba与Transformer,让视觉模型在高分辨率下又快又准

MambaVision是CVPR 2025官方发布的PyTorch实现,提出了一种混合Mamba-Transformer视觉骨干网络。它···

★ 2235 评分 2024-06-10
Mamba-YOLO 开源

用 Mamba 替 YOLO 主干,精度更高算力更省

Mamba-YOLO 是论文《Mamba-YOLO: SSMs-based for Object Detection》的官方 PyTorch 实现,把状态空···

★ 655 评分 2024-06-09
Exp-CLIP 开源

用LLM知识让CLIP看懂表情,零样本识别更准

Exp-CLIP 是一个面向零样本面部表情识别(FER)的开源模型,发表于 WACV 2025 Oral。它针对传统 CL···

★ 64 评分 2024-05-29
PerCo 开源

超低码率下用扩散模型生成真实感图像,压缩不失真

PerCo 是一个基于 PyTorch 的开源图像压缩工具,对应 ICLR 2024 论文《Towards Image Compression ···

★ 106 评分 2024-05-24
DiffCut 开源

无需标注,用扩散模型特征实现零样本图像分割

DiffCut 是一个基于扩散模型的无监督零样本语义分割工具,其核心创新在于结合 Stable Diffusion 的···

★ 53 评分 2024-05-21
SPVD 开源

用稀疏点体素扩散,高效生成高精度3D点云

SPVD 是一个基于稀疏点体素扩散模型的高效可扩展点云生成框架。它针对现有扩散模型在大规模点云生成···

★ 64 评分 2024-05-17
ha-llmvision 开源

让 Home Assistant 看懂摄像头,自动触发智能场景

ha-llmvision 是一个将视觉语言模型(VLM)集成到 Home Assistant 的开源项目,旨在为家庭自动化系···

★ 1478 评分 2024-05-14
sports 开源

用AI看懂体育比赛,一键提取球员位置和动作数据

sports 是一个专注于计算机视觉在体育领域应用的开源项目,主要解决体育视频和图像中的目标检测、关···

★ 5390 评分 2024-05-13
PPOCRLabel 开源

内置OCR预识别,拉框改字就能产出训练数据

PPOCRLabel 是飞桨 OCR 生态中的半自动图形标注工具,专为 OCR 数据集制作而设计。它内置 PP-OCR 模···

★ 450 评分 2024-05-13
albucore 开源

让图像增强算子跑得更快,训练数据管道不再卡顿

albucore 是 Albumentations 团队拆分出的底层图像处理库,用 OpenCV、NumPy、SimSIMD 等实现高性能···

★ 123 评分 2024-05-12
gcd 开源

单目视频一键生成动态新视角,让相机自由飞

GCD(Generative Camera Dolly)是ECCV 2024 Oral的官方实现,专注于极端单目动态新视角合成。它解···

★ 292 评分 2024-05-07
EgoLife 开源

戴上眼镜录视频,AI帮你回忆和检索生活瞬间

EgoLife 是一个基于第一人称视频(egocentric video)的智能生活助手开源项目,来自 CVPR 2025。它···

★ 464 评分 2024-05-03
ocr 开源

在 JS/RN 里直接跑 PaddleOCR 文字检测,无需 Python 后端

这是一个基于 PaddleOCR 模型与 ONNX Runtime 构建的高精度文字检测 OCR 库,支持 JavaScript/Type···

★ 209 评分 2024-05-01
Mamba-in-Computer-Vision 开源

一张图看懂Mamba如何革新计算机视觉,快速跟上前沿

这是一个关于Mamba模型在计算机视觉领域应用的综合性综述项目,系统梳理了Mamba(状态空间模型)在···

★ 145 评分 2024-04-23
Groma 开源

让多模态模型精准指认图像中的每个区域,实现细粒度视觉定位。

Groma 是一个基于多模态大语言模型(MLLM)的视觉定位模型,核心创新在于“局部视觉标记化”(Loca···

★ 586 评分 2024-04-21
Awesome_Mamba 开源

一网打尽医学影像中的高效状态空间模型研究

Awesome_Mamba 是一个关于状态空间模型(State Space Models, SSMs)在医学图像分析中应用的综合性···

★ 270 评分 2024-04-02
foundational_fsod 开源

用视觉语言模型让少样本检测更准,小数据也能快速上手

这是一个少样本目标检测(FSOD)的开源实现,对应论文《Revisiting Few Shot Object Detection wit···

★ 93 评分 2024-04-01
ComfyUI-BiRefNet-ZHO 开源

拖拽节点即可实现图像/视频高精度抠图,边缘细节惊艳

ComfyUI-BiRefNet-ZHO 是 BiRefNet 模型在 ComfyUI 中的增强版插件,支持图像和视频的高精度前景抠···

★ 412 评分 2024-03-31
ComfyUI-Depth-Anything-Tensorrt 开源

ComfyUI 里跑深度图,TensorRT 加速最高 14 倍,快人一步。

ComfyUI-Depth-Anything-Tensorrt 是一个为 ComfyUI 设计的自定义节点,它集成了 Depth Anything 系···

★ 134 评分 2024-03-23
mvdfusion 开源

单张图片,生成多视角一致的3D模型

MVD-Fusion 是一个基于深度一致的多视图生成框架,用于从单张图像重建高质量的 3D 模型。它解决了传···

★ 133 评分 2024-03-19
EcoDepth 开源

用扩散模型让单目深度估计更准,零样本也能测深度。

EcoDepth是CVPR 2024收录的单目深度估计项目,旨在解决扩散模型在深度估计中条件利用不足的问题。它···

★ 220 评分 2024-03-17