测出视觉模型对三维世界的真实理解力
Lexicon3D 是一个面向复杂三维场景理解的开源评测框架,发表于 NeurIPS 2024。它系统性地探究了视觉···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
测出视觉模型对三维世界的真实理解力
Lexicon3D 是一个面向复杂三维场景理解的开源评测框架,发表于 NeurIPS 2024。它系统性地探究了视觉···
RGBT-Tiny
开源
双模态小目标检测基准,直接跑通基线对比
RGBT-Tiny 是论文《Visible-Thermal Tiny Object Detection: A Benchmark Dataset and Baselines》···
FungalLight
开源
用 Rust 模拟真菌生长,生成有机形态与光影艺术
FungalLight 是一个基于 Rust 和 Bevy 引擎的真菌形态模拟项目,专注于图形生成、人工生命和动态光···
MambaVision
开源
混合Mamba与Transformer,让视觉模型在高分辨率下又快又准
MambaVision是CVPR 2025官方发布的PyTorch实现,提出了一种混合Mamba-Transformer视觉骨干网络。它···
Mamba-YOLO
开源
用 Mamba 替 YOLO 主干,精度更高算力更省
Mamba-YOLO 是论文《Mamba-YOLO: SSMs-based for Object Detection》的官方 PyTorch 实现,把状态空···
Exp-CLIP
开源
用LLM知识让CLIP看懂表情,零样本识别更准
Exp-CLIP 是一个面向零样本面部表情识别(FER)的开源模型,发表于 WACV 2025 Oral。它针对传统 CL···
PerCo
开源
超低码率下用扩散模型生成真实感图像,压缩不失真
PerCo 是一个基于 PyTorch 的开源图像压缩工具,对应 ICLR 2024 论文《Towards Image Compression ···
DiffCut
开源
无需标注,用扩散模型特征实现零样本图像分割
DiffCut 是一个基于扩散模型的无监督零样本语义分割工具,其核心创新在于结合 Stable Diffusion 的···
SPVD
开源
用稀疏点体素扩散,高效生成高精度3D点云
SPVD 是一个基于稀疏点体素扩散模型的高效可扩展点云生成框架。它针对现有扩散模型在大规模点云生成···
ha-llmvision
开源
让 Home Assistant 看懂摄像头,自动触发智能场景
ha-llmvision 是一个将视觉语言模型(VLM)集成到 Home Assistant 的开源项目,旨在为家庭自动化系···
sports
开源
用AI看懂体育比赛,一键提取球员位置和动作数据
sports 是一个专注于计算机视觉在体育领域应用的开源项目,主要解决体育视频和图像中的目标检测、关···
PPOCRLabel
开源
内置OCR预识别,拉框改字就能产出训练数据
PPOCRLabel 是飞桨 OCR 生态中的半自动图形标注工具,专为 OCR 数据集制作而设计。它内置 PP-OCR 模···
albucore
开源
让图像增强算子跑得更快,训练数据管道不再卡顿
albucore 是 Albumentations 团队拆分出的底层图像处理库,用 OpenCV、NumPy、SimSIMD 等实现高性能···
gcd
开源
单目视频一键生成动态新视角,让相机自由飞
GCD(Generative Camera Dolly)是ECCV 2024 Oral的官方实现,专注于极端单目动态新视角合成。它解···
EgoLife
开源
戴上眼镜录视频,AI帮你回忆和检索生活瞬间
EgoLife 是一个基于第一人称视频(egocentric video)的智能生活助手开源项目,来自 CVPR 2025。它···
ocr
开源
在 JS/RN 里直接跑 PaddleOCR 文字检测,无需 Python 后端
这是一个基于 PaddleOCR 模型与 ONNX Runtime 构建的高精度文字检测 OCR 库,支持 JavaScript/Type···
Mamba-in-Computer-Vision
开源
一张图看懂Mamba如何革新计算机视觉,快速跟上前沿
这是一个关于Mamba模型在计算机视觉领域应用的综合性综述项目,系统梳理了Mamba(状态空间模型)在···
Groma
开源
让多模态模型精准指认图像中的每个区域,实现细粒度视觉定位。
Groma 是一个基于多模态大语言模型(MLLM)的视觉定位模型,核心创新在于“局部视觉标记化”(Loca···
Awesome_Mamba
开源
一网打尽医学影像中的高效状态空间模型研究
Awesome_Mamba 是一个关于状态空间模型(State Space Models, SSMs)在医学图像分析中应用的综合性···
foundational_fsod
开源
用视觉语言模型让少样本检测更准,小数据也能快速上手
这是一个少样本目标检测(FSOD)的开源实现,对应论文《Revisiting Few Shot Object Detection wit···
ComfyUI-BiRefNet-ZHO
开源
拖拽节点即可实现图像/视频高精度抠图,边缘细节惊艳
ComfyUI-BiRefNet-ZHO 是 BiRefNet 模型在 ComfyUI 中的增强版插件,支持图像和视频的高精度前景抠···
ComfyUI-Depth-Anything-Tensorrt
开源
ComfyUI 里跑深度图,TensorRT 加速最高 14 倍,快人一步。
ComfyUI-Depth-Anything-Tensorrt 是一个为 ComfyUI 设计的自定义节点,它集成了 Depth Anything 系···
mvdfusion
开源
单张图片,生成多视角一致的3D模型
MVD-Fusion 是一个基于深度一致的多视图生成框架,用于从单张图像重建高质量的 3D 模型。它解决了传···
EcoDepth
开源
用扩散模型让单目深度估计更准,零样本也能测深度。
EcoDepth是CVPR 2024收录的单目深度估计项目,旨在解决扩散模型在深度估计中条件利用不足的问题。它···