计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

ZeroShape 开源

单张图片,零样本重建三维形状,无需额外训练

ZeroShape是一个基于回归的零样本三维形状重建项目,旨在从单张图像直接恢复物体的三维几何结构。它···

★ 141 评分 2023-12-21
CLOUDS 开源

多模型协作,让语义分割在陌生场景下依然稳准狠

CLOUDS 是 CVPR 2024 收录的官方实现,针对域泛化语义分割任务,提出协作基础模型框架。它解决单一···

★ 77 评分 2023-12-15
tokenize-anything 开源

一个模型,提示任意视觉概念,统一分割与识别

Tokenize Anything via Prompting 是一个来自 ECCV 2024 的视觉模型,旨在通过统一的提示框架将任意···

★ 600 评分 2023-12-14
GenHowTo 开源

从教学视频学习动作生成,让 AI 看懂操作步骤

GenHowTo 是 CVPR 2024 论文的官方代码实现,专注于从教学视频中学习生成动作和状态转换。它解决的···

★ 54 评分 2023-12-11
SIFU 开源

单张照片秒变3D人体,侧视补全细节,动画直接可用

SIFU是CVPR 2024 Highlight论文的官方实现,专注于从单张RGB图像重建穿着衣服的3D人体模型。它解决···

★ 275 评分 2023-12-10
fm-boosting 开源

用流匹配加速扩散模型,生成更快更清晰的图像

FMBoost 是一个基于流匹配(Flow Matching)的潜在扩散模型加速与增强工具,源自 ECCV 2024 Oral 论···

★ 259 评分 2023-12-09
MuscleMap 开源

一键量化全身肌肉 MRI,让科研分析标准化。

MuscleMap 是一个开源、社区支持的全身肌肉定量 MRI 分析平台。它解决的是肌肉萎缩、肥胖、代谢疾病···

★ 132 评分 2023-12-06
receipt-ocr 开源

拍张票据照片,自动提取金额日期等关键字段

receipt-ocr 是一个面向小票、发票等票据图像的 OCR 处理引擎,用 Python 编写。它要解决的问题是:···

★ 725 评分 2023-12-01
computer-vision-challenge 开源

边做边学,用Jupyter玩转计算机视觉经典任务

这是一个面向所有人的计算机视觉实战项目合集,基于Jupyter Notebook编写,涵盖CNN、图像分类、目标···

★ 68 评分 2023-11-29
vivid123 开源

一张图生成多视角视频,3D重建更轻松

ViVid-1-to-3 是一个基于视频扩散模型的单图生成多视角新视图的开源项目,由 CVPR 2024 Highlight ···

★ 180 评分 2023-11-27
street-tryon-benchmark 开源

让AI在真实街景中试穿衣服,评估更靠谱

StreetTryOn 是一个面向真实街景场景的虚拟试穿基准测试集,由 WACV'25 论文提出。它解决了现有虚拟···

★ 160 评分 2023-11-26
diffseg 开源

用扩散模型注意力,零标注自动分割图像

DiffSeg 是一种基于 Stable Diffusion 注意力信息的无监督零样本分割方法。它利用扩散模型在生成图···

★ 329 评分 2023-11-22
ovam 开源

用扩散模型生成精准的开放词汇语义分割图

ovam 是 CVPR 2024 论文的开源实现,旨在解决扩散模型在语义分割任务中应用时注意力图不准确的问题···

★ 70 评分 2023-11-22
traffic-monitor 开源

摄像头加雷达,边缘端自己算车流和车速

traffic-monitor 是一个面向道路场景的边缘端交通监测开源项目,核心思路是把机器学习目标检测与多···

★ 128 评分 2023-11-21
GLiNER 开源

一句话描述实体类型,零样本提取任意实体,轻量高效。

GLiNER是一个通用且轻量的命名实体识别(NER)模型,旨在解决传统NER模型只能识别预定义实体类型、···

★ 3954 评分 2023-11-14
VoxPoser 开源

说句话,机器人就能干活,无需训练直接上手

VoxPoser 是一个将大语言模型(LLM)与机器人操作相结合的框架,旨在让机器人仅通过自然语言指令就···

★ 839 评分 2023-11-02
groundingLMM 开源

让AI边聊边精准圈出图像中的每个物体

GLaMM(Grounding Large Multimodal Model)是CVPR 2024提出的首个能够将自然语言响应与对象分割掩···

★ 970 评分 2023-11-02
SurgicalDINO 开源

用基础模型适配器,让内窥镜图像秒变深度图,助力手术导航。

SurgicalDINO 是一个针对内窥镜手术场景的深度估计开源模型,基于视觉基础模型 DINOv2 进行适配器学···

★ 70 评分 2023-11-01
Flipped-VQA 开源

翻转问答顺序,让LLM更懂视频因果

Flipped-VQA 是一个面向视频问答(VideoQA)的推理框架,核心思想是让大型语言模型(LLM)作为时间···

★ 77 评分 2023-10-19
PonderV2 开源

统一 3D 预训练范式,让模型从无标注数据中学会通用特征

PonderV2 是一个面向 3D 视觉基础模型的开源预训练框架,发表于 T-PAMI 2025。它提出一种通用的预训···

★ 377 评分 2023-10-13
ArtEq 开源

让AI看懂没见过的姿势,人体重建更稳更准

ArtEq 是一个基于神经网络的 3D 人体姿态拟合工具,核心创新在于利用 articulated SE(3) 等变性,将···

★ 57 评分 2023-10-12
EmerNeRF 开源

自监督分解动态场景,轻松重建三维世界

EmerNeRF 是一个基于 PyTorch 的神经辐射场(NeRF)实现,通过自监督学习将动态场景分解为静态背景···

★ 642 评分 2023-10-11
Uni3D 开源

一个预训练模型搞定多种3D理解任务,零样本也能识别物体。

Uni3D 是北京智源人工智能研究院(BAAI)提出的一个3D视觉基础模型,旨在学习通用的3D物体表征,以···

★ 687 评分 2023-10-10
comfyui_segment_anything 开源

在ComfyUI里用一句话,自动分割图像中任何物体

这是一个为ComfyUI设计的自定义节点插件,基于GroundingDino和SAM(Segment Anything Model)实现语···

★ 1115 评分 2023-10-07