计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

ComfyUI-Forbidden-Vision 开源

在ComfyUI中,轻松搞定动漫与写实人脸检测修复

ComfyUI-Forbidden-Vision 是一个为 ComfyUI 设计的图像处理插件,专注于人脸检测、分割与增强。它···

★ 101 评分 2025-07-06
SDMatte 开源

点几下鼠标,扩散模型帮你生成精准抠图

SDMatte 是 ICCV2025 论文的官方实现,提出一种将 Stable Diffusion 模型嫁接(grafting)到交互式···

★ 204 评分 2025-06-26
AlbumentationsX 开源

一行代码给图像加增强,标注同步不跑偏

AlbumentationsX 是经典图像增强库 Albumentations 的延续版本,面向计算机视觉训练场景,提供高性···

★ 561 评分 2025-06-19
readur 开源

上传图片即出文字,自建 OCR 像用网盘一样简单

readur 是一个用 Rust 和 TypeScript 编写的开源 OCR 平台,目标是让文字识别变得快速、无痛且直观···

★ 795 评分 2025-06-17
fractogenesis 开源

从单点出发,用算法长出一整片分形宇宙

fractogenesis 是一个用 JavaScript 实现的生成艺术工具,专注于从单一像素点生长出分形结构。它支···

★ 115 评分 2025-06-04
AntiCAP-WebApi 开源

上传验证码图片,直接返回识别结果

AntiCAP-WebApi 是一个基于 AntiCAP 引擎构建的验证码识别 Web 服务,把多种验证码的识别能力封装成···

★ 370 评分 2025-05-30
4KAgent 开源

上传任意糊图,自动恢复成 4K 高清大片

4KAgent 是一个基于智能体(Agent)的任意图像 4K 超分辨率开源项目,发表于 NeurIPS 2025。它解决···

★ 830 评分 2025-05-27
system-ocr 开源

调系统自带 OCR,截图取字不装大模型

system-ocr 是一个用 Rust 编写的 OCR 工具,核心思路是直接调用操作系统自带的文字识别能力,而不···

★ 113 评分 2025-05-21
gen2seg 开源

用生成模型让实例分割无需标注,开箱即用

gen2seg 是一个基于生成式模型(如 Stable Diffusion)实现通用实例分割的开源项目,对应 ICLR 202···

★ 77 评分 2025-05-20
ppu-paddle-ocr 开源

TypeScript 版 PaddleOCR,哪都能跑,识别快

ppu-paddle-ocr 是一个用 TypeScript 重写的 PaddleOCR 轻量级 SDK,目标是在任何能运行 JavaScrip···

★ 138 评分 2025-05-08
MIPHEI-ViT 开源

用 ViT 把 H&E 病理图直接转成免疫荧光图,省去染色实验

MIPHEI-ViT 是一个用于训练 H&E 染色图像到免疫荧光图像转换模型的早期开源项目。它基于 Vision Tr···

★ 61 评分 2025-05-06
TesserAct 开源

让机器人看懂并预测4D世界,实现具身智能

TesserAct 是 ICCV 2025 收录的 4D 具身世界模型项目,旨在解决机器人或具身智能体对动态三维世界的···

★ 408 评分 2025-04-29
tessera 开源

让卫星影像按时间流动,一键提取地表变化规律

TESSERA 是剑桥大学推出的基础模型,专为处理时间序列卫星影像而设计,可应用于土地分类、植被冠层···

★ 751 评分 2025-04-29
comfyui-daam 开源

在 ComfyUI 中可视化每个词对生成图像的注意力影响

comfyui-daam 是一个 ComfyUI 的自定义节点插件,它将 Diffusion Attentive Attribution Maps (DAA···

★ 55 评分 2025-04-16
ComfyUI-MiniCPM 开源

在 ComfyUI 里直接调用 MiniCPM,给图像自动生成描述

ComfyUI-MiniCPM 是一个为 ComfyUI 设计的自定义节点,用于集成 MiniCPM 视觉语言模型。它支持 Min···

★ 156 评分 2025-04-13
ocr-rs 开源

Rust 一行调用,多语言 OCR 本地跑

ocr-rs 是一个基于 Rust 编写的高性能 OCR 识别库,底层使用 PaddleOCR v4/v5/v6 模型并采用 MNN 推···

★ 328 评分 2025-04-12
RomanTex 开源

用注意力网络生成3D模型无缝高保真纹理

RomanTex 是一个用于数字人3D纹理生成的深度学习项目,核心是提出了一种解耦的3D感知旋转位置嵌入多···

★ 82 评分 2025-03-20
DynamicVis 开源

用动态视觉机制,高效理解遥感图像。

DynamicVis 是一个面向遥感图像理解的高效通用视觉基础模型,基于论文实现。它解决遥感图像中目标多···

★ 87 评分 2025-03-20
3dgrut 开源

给高斯泼溅加上光线追踪,渲染出真实反射与阴影

3dgrut 是 NVIDIA 开源的高斯粒子渲染框架,核心是把 3D Gaussian Splatting(3DGS)与光线追踪、混···

★ 2444 评分 2025-03-20
rf-detr 开源

开箱即用的实时检测分割模型,微调后轻松落地

RF-DETR 是 Roboflow 推出的实时目标检测与实例分割模型,基于 DETR 架构,在 COCO 数据集上达到当···

★ 9604 评分 2025-03-19
NuiScene 开源

一键生成无边界的真实户外3D场景,效率与细节兼得

NuiScene 是一个基于 ICCV 2025 论文的开源项目,专注于高效生成无界户外场景。它解决的是传统 3D ···

★ 95 评分 2025-03-18
VLM-CADFeatureRecognition 开源

用视觉语言模型自动识别CAD制造特征,无需人工规则

VLM-CADFeatureRecognition 是一个利用视觉语言模型(VLM)自动识别 CAD 设计中制造特征的开源项目···

★ 78 评分 2025-03-17
SteerX 开源

免相机标定,一键生成可操控的 3D/4D 动态场景

SteerX 是一个基于 PyTorch 的开源项目,对应 ICCV 2025 论文,旨在实现无需相机参数即可创建任意 ···

★ 52 评分 2025-03-14
pdf-ocr-obsidian 开源

PDF 秒变 Obsidian 可用的 Markdown 笔记

pdf-ocr-obsidian 是一个基于 Mistral OCR 的 Python 工具,用于将 PDF 文档批量转换为 Markdown 文···

★ 345 评分 2025-03-09