ComfyUI-Forbidden-Vision
开源
在ComfyUI中,轻松搞定动漫与写实人脸检测修复
ComfyUI-Forbidden-Vision 是一个为 ComfyUI 设计的图像处理插件,专注于人脸检测、分割与增强。它···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
ComfyUI-Forbidden-Vision
开源
在ComfyUI中,轻松搞定动漫与写实人脸检测修复
ComfyUI-Forbidden-Vision 是一个为 ComfyUI 设计的图像处理插件,专注于人脸检测、分割与增强。它···
SDMatte
开源
点几下鼠标,扩散模型帮你生成精准抠图
SDMatte 是 ICCV2025 论文的官方实现,提出一种将 Stable Diffusion 模型嫁接(grafting)到交互式···
AlbumentationsX
开源
一行代码给图像加增强,标注同步不跑偏
AlbumentationsX 是经典图像增强库 Albumentations 的延续版本,面向计算机视觉训练场景,提供高性···
readur
开源
上传图片即出文字,自建 OCR 像用网盘一样简单
readur 是一个用 Rust 和 TypeScript 编写的开源 OCR 平台,目标是让文字识别变得快速、无痛且直观···
fractogenesis
开源
从单点出发,用算法长出一整片分形宇宙
fractogenesis 是一个用 JavaScript 实现的生成艺术工具,专注于从单一像素点生长出分形结构。它支···
AntiCAP-WebApi
开源
上传验证码图片,直接返回识别结果
AntiCAP-WebApi 是一个基于 AntiCAP 引擎构建的验证码识别 Web 服务,把多种验证码的识别能力封装成···
4KAgent
开源
上传任意糊图,自动恢复成 4K 高清大片
4KAgent 是一个基于智能体(Agent)的任意图像 4K 超分辨率开源项目,发表于 NeurIPS 2025。它解决···
system-ocr
开源
调系统自带 OCR,截图取字不装大模型
system-ocr 是一个用 Rust 编写的 OCR 工具,核心思路是直接调用操作系统自带的文字识别能力,而不···
gen2seg
开源
用生成模型让实例分割无需标注,开箱即用
gen2seg 是一个基于生成式模型(如 Stable Diffusion)实现通用实例分割的开源项目,对应 ICLR 202···
ppu-paddle-ocr
开源
TypeScript 版 PaddleOCR,哪都能跑,识别快
ppu-paddle-ocr 是一个用 TypeScript 重写的 PaddleOCR 轻量级 SDK,目标是在任何能运行 JavaScrip···
MIPHEI-ViT
开源
用 ViT 把 H&E 病理图直接转成免疫荧光图,省去染色实验
MIPHEI-ViT 是一个用于训练 H&E 染色图像到免疫荧光图像转换模型的早期开源项目。它基于 Vision Tr···
TesserAct
开源
让机器人看懂并预测4D世界,实现具身智能
TesserAct 是 ICCV 2025 收录的 4D 具身世界模型项目,旨在解决机器人或具身智能体对动态三维世界的···
tessera
开源
让卫星影像按时间流动,一键提取地表变化规律
TESSERA 是剑桥大学推出的基础模型,专为处理时间序列卫星影像而设计,可应用于土地分类、植被冠层···
comfyui-daam
开源
在 ComfyUI 中可视化每个词对生成图像的注意力影响
comfyui-daam 是一个 ComfyUI 的自定义节点插件,它将 Diffusion Attentive Attribution Maps (DAA···
ComfyUI-MiniCPM
开源
在 ComfyUI 里直接调用 MiniCPM,给图像自动生成描述
ComfyUI-MiniCPM 是一个为 ComfyUI 设计的自定义节点,用于集成 MiniCPM 视觉语言模型。它支持 Min···
ocr-rs
开源
Rust 一行调用,多语言 OCR 本地跑
ocr-rs 是一个基于 Rust 编写的高性能 OCR 识别库,底层使用 PaddleOCR v4/v5/v6 模型并采用 MNN 推···
RomanTex
开源
用注意力网络生成3D模型无缝高保真纹理
RomanTex 是一个用于数字人3D纹理生成的深度学习项目,核心是提出了一种解耦的3D感知旋转位置嵌入多···
DynamicVis
开源
用动态视觉机制,高效理解遥感图像。
DynamicVis 是一个面向遥感图像理解的高效通用视觉基础模型,基于论文实现。它解决遥感图像中目标多···
3dgrut
开源
给高斯泼溅加上光线追踪,渲染出真实反射与阴影
3dgrut 是 NVIDIA 开源的高斯粒子渲染框架,核心是把 3D Gaussian Splatting(3DGS)与光线追踪、混···
rf-detr
开源
开箱即用的实时检测分割模型,微调后轻松落地
RF-DETR 是 Roboflow 推出的实时目标检测与实例分割模型,基于 DETR 架构,在 COCO 数据集上达到当···
NuiScene
开源
一键生成无边界的真实户外3D场景,效率与细节兼得
NuiScene 是一个基于 ICCV 2025 论文的开源项目,专注于高效生成无界户外场景。它解决的是传统 3D ···
VLM-CADFeatureRecognition
开源
用视觉语言模型自动识别CAD制造特征,无需人工规则
VLM-CADFeatureRecognition 是一个利用视觉语言模型(VLM)自动识别 CAD 设计中制造特征的开源项目···
SteerX
开源
免相机标定,一键生成可操控的 3D/4D 动态场景
SteerX 是一个基于 PyTorch 的开源项目,对应 ICCV 2025 论文,旨在实现无需相机参数即可创建任意 ···
pdf-ocr-obsidian
开源
PDF 秒变 Obsidian 可用的 Markdown 笔记
pdf-ocr-obsidian 是一个基于 Mistral OCR 的 Python 工具,用于将 PDF 文档批量转换为 Markdown 文···