计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

vision-demos 开源

克隆即跑的趣味 CV 演示,几分钟看到识别效果

vision-demos 是一个用 Python 编写的计算机视觉演示项目,目标是把常见 CV 能力做成能直接跑起来、···

★ 349 评分 2026-09-08
SimdPaddleOCR 开源

纯C#跑PP-OCRv6,SIMD加速,多平台离线文字识别

SimdPaddleOCR 是一个用纯 C# 实现的 PP-OCRv6 推理库,目标是在 .NET 生态里直接跑通 PaddleOCR 的···

★ 336 评分 2026-09-05
lw.PPOCR.C 开源

纯 C 无依赖跑 PP-OCR,端侧和浏览器都能直接 OCR

lw.PPOCR.C 是一个用纯 C 语言实现的轻量级 PP-OCR 推理运行时,目标是在不引入任何运行时依赖的前···

★ 150 评分 2026-08-26
ocr-it 开源

框选一次屏幕区域,快捷键反复离线取字

ocr-it 是一款 Chrome 浏览器扩展,专为需要反复识别同一屏幕区域文字的用户设计。它解决的核心问题···

★ 399 评分 2026-08-21
Looking-Back-OCR 开源

用 AI 把越南语古籍旧书扫描件转成可编辑文字

Looking-Back-OCR 是一个面向越南语古籍与文档的 OCR 工具,基于 TypeScript 开发,通过封装 Gemin···

★ 105 评分 2026-08-14
TeleOCR 开源

Telegram 图片自动转文字,聊天记录秒变可搜索文本

TeleOCR 是一个基于 Python 的开源 OCR 工具,主要面向从 Telegram 聊天记录、频道或群组中批量提取···

★ 227 评分 2026-08-13
dsh-vision-router 开源

一条命令给文本 agent 装上眼睛,免费看图问答

dsh-vision-router 是给纯文本 DeepSeek Harness(dsh)智能体装上"眼睛"的插件。dsh 这类 agent 本···

★ 1118 评分 2026-08-13
production-ocr-course 开源

用 Rust+K8s 把 OCR 从 Demo 做成能扛并发的生产服务

这是一个面向生产环境的 OCR 课程与配套代码库,用 Rust 编写核心服务,结合 vLLM 做视觉语言模型推···

★ 414 评分 2026-07-22
lucida 开源

专治玻璃、迷彩等难抠图,保留关键细节

lucida 是一个基于 BiRefNet 微调的图像抠图工具,专注于处理传统背景移除方法容易失败的复杂场景,···

★ 171 评分 2026-07-10
MonkeyOCRv2 开源

专为文档打造的视觉骨干,让 OCR 与版面理解更准

MonkeyOCRv2 是一个面向文档理解场景的原生视觉编码器(Vision Encoder),定位为文档专用视觉骨干···

★ 1453 评分 2026-07-10
neverclick 开源

用键盘加本地视觉识别,替代鼠标点按操作

neverclick 是一个用本地计算机视觉驱动的键盘鼠标控制工具,目标是让用户尽量不碰鼠标也能操作桌面···

★ 469 评分 2026-07-08
nobg 开源

一行代码调用多种抠图模型,快速生成透明背景图

nobg 是一个专注于背景移除的 Python 库,旨在统一和简化多种背景分割与抠图模型的使用。它解决了开···

★ 165 评分 2026-07-07
galaxy-explorer 开源

浏览器里漫游程序化生成的银河系,无需后端和构建步骤

galaxy-explorer 是一个基于 WebGL 和 three.js 的交互式程序化银河系浏览器端项目,无需后端和构建···

★ 95 评分 2026-07-04
claude-real-video 开源

让 Claude 看懂视频:自动提取关键帧和字幕,喂给大模型

claude-real-video 是一个让 Claude 等大语言模型真正“看懂”视频的开源工具。它解决的是 LLM 无法···

★ 2175 评分 2026-06-30
franken_ocr 开源

不装 Python 不靠 GPU,纯 Rust 在 CPU 上跑 3B OCR 大模型

franken_ocr 是一个用纯 Rust 实现的 CPU 端 OCR 推理引擎,目标模型是百度 Unlimited-OCR——一个···

★ 330 评分 2026-06-25
mac-ocr 开源

用苹果自带识别,把图片和扫描 PDF 一键变成可搜索文本

mac-ocr 是一个基于苹果 Vision 框架的 macOS 命令行工具,用 Swift 编写,用于对图片和 PDF 做文字···

★ 516 评分 2026-06-13
cosmo-edge 开源

一套 C++ 代码,跨 Sophon/RKNN/x86 跑通边缘视频 AI

cosmo-edge 是一个面向生产环境的 C++ 边缘 AI 推理引擎,专注视频分析与端侧视觉语言模型(VLM)部···

★ 1232 评分 2026-06-09
VLM-AutoYOLO 开源

VLM 自动画框,一键训出 YOLO 检测模型

VLM-AutoYOLO 是一个面向目标检测的端到端自动标注与 YOLO 训练平台。它想解决的问题是:做目标检测···

★ 249 评分 2026-06-02
locate-anything 开源

一句话框出图中任意物体,本地GPU一键跑

locate-anything 是一个为 NVIDIA LocateAnything-3B 模型打造的轻量级 Web 界面,通过一条 docker···

★ 158 评分 2026-05-27
desk-ocr 开源

框选屏幕任意区域,OCR 取字后直接搜索,省去手动录入。

desk-ocr 是一个基于 TypeScript 开发的桌面端 OCR 工具,核心功能是截取屏幕任意区域,调用 OCR 引···

★ 108 评分 2026-05-25
ViGeo 开源

让视频几何估计更连贯,重建更稳定

ViGeo 是一个面向视频几何一致性估计的开源项目,旨在从视频序列中稳定地估计相机位姿和场景几何结···

★ 137 评分 2026-05-21
mamma 开源

从视频直接捕捉多人3D动作,无需标记点,精度高。

MAMMA 是一个面向多人体运动捕捉的开源项目,主打无标记(markerless)且高精度的多人运动获取。它···

★ 806 评分 2026-05-06
OmniShotCut 开源

自动找出视频里每个镜头切换点,省去手动标记

OmniShotCut 是一个专注于镜头边界检测(Shot Boundary Detection)的开源项目,用 Python 实现。它···

★ 313 评分 2026-04-24
PhysInOne 开源

让视频生成懂物理规律,动态重建更真实

PhysInOne 是一个基于 Python 的物理感知视频生成与动态重建框架,相关论文被 CVPR 2026 接收。它旨···

★ 111 评分 2026-04-12