计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

face-emotion-recognition 开源

摄像头前做表情,AI陪你聊情绪

这是一个基于轻量级CNN的实时人脸表情识别系统,结合OpenCV进行摄像头推理,并集成GroqCloud提供聊···

★ 54 评分 2026-04-08
Falcon-Perception 开源

原生多模态模型推理,看图识文一步到位

Falcon-Perception 是 Falcon 系列多模态模型的推理仓库,包含 Falcon-Perception 与 Falcon-OCR 两···

★ 776 评分 2026-03-31
LIGHT 开源

无需分类器,轻松生成自然的人-物交互3D动画

LIGHT 是一个面向数字人3D动画的开源项目,专注于人体-物体交互(HOI)动画生成。它提出了一种无需···

★ 59 评分 2026-03-27
Graph-CAD 开源

用自然语言直接生成 CAD 模型,几何感知更精准

Graph-CAD 是一个面向文本到 CAD 建模任务的开源项目,旨在通过学习层级化且几何感知的图表示来提升···

★ 141 评分 2026-03-26
MagicBokeh 开源

一键生成高倍变焦电影级散景,告别生硬抠图

MagicBokeh 是一个专为高倍变焦场景设计的端到端散景渲染开源项目,由 CVPR 2026 Oral 提名并入围最···

★ 59 评分 2026-03-20
TurboOCR 开源

每秒200+张图,TensorRT加速的OCR服务,开箱即用。

TurboOCR 是一个基于 C++ 实现的高性能 OCR 服务,专为追求极致吞吐量的场景设计。它集成了百度飞桨···

★ 1090 评分 2026-03-20
HandX 开源

让数字人双手协作,生成自然交互动作

HandX 是一个面向双手(双人)运动与交互生成的开源项目,发表于 CVPR 2026。它解决的是现有数字人···

★ 142 评分 2026-03-19
MonoArt 开源

从单张照片,逐步推理出带关节的3D模型

MonoArt 是论文“MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Recon···

★ 71 评分 2026-03-17
DART 开源

用前沿模型实时检测视频里的任何目标

DART 是一个基于前沿目标检测模型的实时检测工具,用 Python 实现,核心目标是把高性能检测模型落地···

★ 758 评分 2026-03-11
paddleocr-local 开源

本地把 PDF/Office 转 Markdown,五种 OCR 模型随你换

paddleocr-local 是一个本地优先的文档解析工作台,把 PDF、Office 等格式的文件转换成 Markdown,···

★ 131 评分 2026-02-23
modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

modlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)···

★ 4045 评分 2026-02-22
noai-watermark 开源

一键去除 AI 隐形水印,清理生成痕迹

noai-watermark 是一个开源的 Python 命令行工具,用于移除图像中的隐形 AI 水印(如 SynthID、Sta···

★ 190 评分 2026-02-21
OccAny 开源

让3D占用预测适配任意城市,开箱即用

OccAny 是一个面向城市级 3D 占用预测的统一框架,旨在解决传统模型在多样化和非受限城市场景中泛化···

★ 164 评分 2026-02-21
oximedia 开源

用纯 Rust 一站式搞定音视频与视觉处理,安全无专利负担

OxiMedia 是一个用纯 Rust 编写的开源多媒体处理框架,目标是重建 FFmpeg 与 OpenCV 的能力并统一到···

★ 257 评分 2026-02-12
AWESOME-OCR-LLM 开源

一张清单看懂大模型时代 OCR 怎么选

AWESOME-OCR-LLM 是一个聚焦“大语言模型时代的 OCR”的开源资源集合,系统整理了将 LLM 与多模态大···

★ 722 评分 2026-02-10
liteparse 开源

秒级解析 PDF 和扫描件,提取文本数据,开源免费。

liteparse 是一个用 Rust 编写的高性能开源文档解析器,专注于从 PDF、扫描件和图片中快速提取文本···

★ 12653 评分 2026-02-09
PAct 开源

一张照片,生成可活动的3D关节模型

PAct 是一个面向单张图像的三维关节物体生成项目,被 SIGGRAPH Asia 2026 条件接收。它解决的是从单···

★ 86 评分 2026-02-07
CC-Pan 开源

用扩散模型高效融合遥感图像,全色锐化又快又准

CC-Pan 是论文《CC-Pan: Channel-wise Compression based Diffusion for Efficient Pan-Sharpening···

★ 248 评分 2026-02-01
AdaRefSR 开源

一张参考图,单步扩散,超分又快又真

AdaRefSR 是一个基于参考图像的单步扩散超分辨率框架,论文已被 ICLR2026 接收。它解决传统参考超分···

★ 69 评分 2026-01-30
AnomalyVFM 开源

零样本异常检测,无需训练直接部署

AnomalyVFM 是一个面向工业视觉异常检测的零样本检测框架,发表于 CVPR 2026。它旨在解决传统异常检···

★ 74 评分 2026-01-27
fashn-vton-1.5 开源

上传衣服和照片,秒出试穿效果,无需手动抠图

FASHN VTON v1.5 是一个基于扩散模型的虚拟试穿(Virtual Try-On)开源项目,专注于在像素空间实现···

★ 329 评分 2026-01-09
RotoAI 开源

用一句话描述视频中的物体,自动完成逐帧分割抠像。

RotoAI 是一个开源的视频分割工作室,专注于提示词驱动的视频分割(rotoscoping)任务。它结合了 S···

★ 63 评分 2025-12-26
jietuba 开源

Windows 截图后长截图、OCR、翻译、录屏一站搞定

jietuba 是一款面向 Windows 平台的开源截图工具,使用 Python 与 PySide6 构建,目标是把日常截图···

★ 218 评分 2025-12-25
GutenOCR 开源

用 VLM 做 OCR 的训练评测一条龙工具

GutenOCR 是一个面向 OCR 场景的开源工具集,专注于视觉语言模型(VLM)的训练与评测。它解决的核心···

★ 191 评分 2025-12-18