ZeroShape
开源
单张图片,零样本重建三维形状,无需额外训练
ZeroShape是一个基于回归的零样本三维形状重建项目,旨在从单张图像直接恢复物体的三维几何结构。它···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
ZeroShape
开源
单张图片,零样本重建三维形状,无需额外训练
ZeroShape是一个基于回归的零样本三维形状重建项目,旨在从单张图像直接恢复物体的三维几何结构。它···
CLOUDS
开源
多模型协作,让语义分割在陌生场景下依然稳准狠
CLOUDS 是 CVPR 2024 收录的官方实现,针对域泛化语义分割任务,提出协作基础模型框架。它解决单一···
tokenize-anything
开源
一个模型,提示任意视觉概念,统一分割与识别
Tokenize Anything via Prompting 是一个来自 ECCV 2024 的视觉模型,旨在通过统一的提示框架将任意···
GenHowTo
开源
从教学视频学习动作生成,让 AI 看懂操作步骤
GenHowTo 是 CVPR 2024 论文的官方代码实现,专注于从教学视频中学习生成动作和状态转换。它解决的···
SIFU
开源
单张照片秒变3D人体,侧视补全细节,动画直接可用
SIFU是CVPR 2024 Highlight论文的官方实现,专注于从单张RGB图像重建穿着衣服的3D人体模型。它解决···
fm-boosting
开源
用流匹配加速扩散模型,生成更快更清晰的图像
FMBoost 是一个基于流匹配(Flow Matching)的潜在扩散模型加速与增强工具,源自 ECCV 2024 Oral 论···
MuscleMap
开源
一键量化全身肌肉 MRI,让科研分析标准化。
MuscleMap 是一个开源、社区支持的全身肌肉定量 MRI 分析平台。它解决的是肌肉萎缩、肥胖、代谢疾病···
receipt-ocr
开源
拍张票据照片,自动提取金额日期等关键字段
receipt-ocr 是一个面向小票、发票等票据图像的 OCR 处理引擎,用 Python 编写。它要解决的问题是:···
computer-vision-challenge
开源
边做边学,用Jupyter玩转计算机视觉经典任务
这是一个面向所有人的计算机视觉实战项目合集,基于Jupyter Notebook编写,涵盖CNN、图像分类、目标···
vivid123
开源
一张图生成多视角视频,3D重建更轻松
ViVid-1-to-3 是一个基于视频扩散模型的单图生成多视角新视图的开源项目,由 CVPR 2024 Highlight ···
street-tryon-benchmark
开源
让AI在真实街景中试穿衣服,评估更靠谱
StreetTryOn 是一个面向真实街景场景的虚拟试穿基准测试集,由 WACV'25 论文提出。它解决了现有虚拟···
diffseg
开源
用扩散模型注意力,零标注自动分割图像
DiffSeg 是一种基于 Stable Diffusion 注意力信息的无监督零样本分割方法。它利用扩散模型在生成图···
ovam
开源
用扩散模型生成精准的开放词汇语义分割图
ovam 是 CVPR 2024 论文的开源实现,旨在解决扩散模型在语义分割任务中应用时注意力图不准确的问题···
traffic-monitor
开源
摄像头加雷达,边缘端自己算车流和车速
traffic-monitor 是一个面向道路场景的边缘端交通监测开源项目,核心思路是把机器学习目标检测与多···
GLiNER
开源
一句话描述实体类型,零样本提取任意实体,轻量高效。
GLiNER是一个通用且轻量的命名实体识别(NER)模型,旨在解决传统NER模型只能识别预定义实体类型、···
VoxPoser
开源
说句话,机器人就能干活,无需训练直接上手
VoxPoser 是一个将大语言模型(LLM)与机器人操作相结合的框架,旨在让机器人仅通过自然语言指令就···
groundingLMM
开源
让AI边聊边精准圈出图像中的每个物体
GLaMM(Grounding Large Multimodal Model)是CVPR 2024提出的首个能够将自然语言响应与对象分割掩···
SurgicalDINO
开源
用基础模型适配器,让内窥镜图像秒变深度图,助力手术导航。
SurgicalDINO 是一个针对内窥镜手术场景的深度估计开源模型,基于视觉基础模型 DINOv2 进行适配器学···
Flipped-VQA
开源
翻转问答顺序,让LLM更懂视频因果
Flipped-VQA 是一个面向视频问答(VideoQA)的推理框架,核心思想是让大型语言模型(LLM)作为时间···
PonderV2
开源
统一 3D 预训练范式,让模型从无标注数据中学会通用特征
PonderV2 是一个面向 3D 视觉基础模型的开源预训练框架,发表于 T-PAMI 2025。它提出一种通用的预训···
ArtEq
开源
让AI看懂没见过的姿势,人体重建更稳更准
ArtEq 是一个基于神经网络的 3D 人体姿态拟合工具,核心创新在于利用 articulated SE(3) 等变性,将···
EmerNeRF
开源
自监督分解动态场景,轻松重建三维世界
EmerNeRF 是一个基于 PyTorch 的神经辐射场(NeRF)实现,通过自监督学习将动态场景分解为静态背景···
Uni3D
开源
一个预训练模型搞定多种3D理解任务,零样本也能识别物体。
Uni3D 是北京智源人工智能研究院(BAAI)提出的一个3D视觉基础模型,旨在学习通用的3D物体表征,以···
在ComfyUI里用一句话,自动分割图像中任何物体
这是一个为ComfyUI设计的自定义节点插件,基于GroundingDino和SAM(Segment Anything Model)实现语···