vision-demos
开源
克隆即跑的趣味 CV 演示,几分钟看到识别效果
vision-demos 是一个用 Python 编写的计算机视觉演示项目,目标是把常见 CV 能力做成能直接跑起来、···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
vision-demos
开源
克隆即跑的趣味 CV 演示,几分钟看到识别效果
vision-demos 是一个用 Python 编写的计算机视觉演示项目,目标是把常见 CV 能力做成能直接跑起来、···
SimdPaddleOCR
开源
纯C#跑PP-OCRv6,SIMD加速,多平台离线文字识别
SimdPaddleOCR 是一个用纯 C# 实现的 PP-OCRv6 推理库,目标是在 .NET 生态里直接跑通 PaddleOCR 的···
lw.PPOCR.C
开源
纯 C 无依赖跑 PP-OCR,端侧和浏览器都能直接 OCR
lw.PPOCR.C 是一个用纯 C 语言实现的轻量级 PP-OCR 推理运行时,目标是在不引入任何运行时依赖的前···
ocr-it
开源
框选一次屏幕区域,快捷键反复离线取字
ocr-it 是一款 Chrome 浏览器扩展,专为需要反复识别同一屏幕区域文字的用户设计。它解决的核心问题···
Looking-Back-OCR
开源
用 AI 把越南语古籍旧书扫描件转成可编辑文字
Looking-Back-OCR 是一个面向越南语古籍与文档的 OCR 工具,基于 TypeScript 开发,通过封装 Gemin···
TeleOCR
开源
Telegram 图片自动转文字,聊天记录秒变可搜索文本
TeleOCR 是一个基于 Python 的开源 OCR 工具,主要面向从 Telegram 聊天记录、频道或群组中批量提取···
dsh-vision-router
开源
一条命令给文本 agent 装上眼睛,免费看图问答
dsh-vision-router 是给纯文本 DeepSeek Harness(dsh)智能体装上"眼睛"的插件。dsh 这类 agent 本···
production-ocr-course
开源
用 Rust+K8s 把 OCR 从 Demo 做成能扛并发的生产服务
这是一个面向生产环境的 OCR 课程与配套代码库,用 Rust 编写核心服务,结合 vLLM 做视觉语言模型推···
lucida
开源
专治玻璃、迷彩等难抠图,保留关键细节
lucida 是一个基于 BiRefNet 微调的图像抠图工具,专注于处理传统背景移除方法容易失败的复杂场景,···
MonkeyOCRv2
开源
专为文档打造的视觉骨干,让 OCR 与版面理解更准
MonkeyOCRv2 是一个面向文档理解场景的原生视觉编码器(Vision Encoder),定位为文档专用视觉骨干···
neverclick
开源
用键盘加本地视觉识别,替代鼠标点按操作
neverclick 是一个用本地计算机视觉驱动的键盘鼠标控制工具,目标是让用户尽量不碰鼠标也能操作桌面···
nobg
开源
一行代码调用多种抠图模型,快速生成透明背景图
nobg 是一个专注于背景移除的 Python 库,旨在统一和简化多种背景分割与抠图模型的使用。它解决了开···
galaxy-explorer
开源
浏览器里漫游程序化生成的银河系,无需后端和构建步骤
galaxy-explorer 是一个基于 WebGL 和 three.js 的交互式程序化银河系浏览器端项目,无需后端和构建···
claude-real-video
开源
让 Claude 看懂视频:自动提取关键帧和字幕,喂给大模型
claude-real-video 是一个让 Claude 等大语言模型真正“看懂”视频的开源工具。它解决的是 LLM 无法···
franken_ocr
开源
不装 Python 不靠 GPU,纯 Rust 在 CPU 上跑 3B OCR 大模型
franken_ocr 是一个用纯 Rust 实现的 CPU 端 OCR 推理引擎,目标模型是百度 Unlimited-OCR——一个···
mac-ocr
开源
用苹果自带识别,把图片和扫描 PDF 一键变成可搜索文本
mac-ocr 是一个基于苹果 Vision 框架的 macOS 命令行工具,用 Swift 编写,用于对图片和 PDF 做文字···
cosmo-edge
开源
一套 C++ 代码,跨 Sophon/RKNN/x86 跑通边缘视频 AI
cosmo-edge 是一个面向生产环境的 C++ 边缘 AI 推理引擎,专注视频分析与端侧视觉语言模型(VLM)部···
VLM-AutoYOLO
开源
VLM 自动画框,一键训出 YOLO 检测模型
VLM-AutoYOLO 是一个面向目标检测的端到端自动标注与 YOLO 训练平台。它想解决的问题是:做目标检测···
locate-anything
开源
一句话框出图中任意物体,本地GPU一键跑
locate-anything 是一个为 NVIDIA LocateAnything-3B 模型打造的轻量级 Web 界面,通过一条 docker···
desk-ocr
开源
框选屏幕任意区域,OCR 取字后直接搜索,省去手动录入。
desk-ocr 是一个基于 TypeScript 开发的桌面端 OCR 工具,核心功能是截取屏幕任意区域,调用 OCR 引···
ViGeo
开源
让视频几何估计更连贯,重建更稳定
ViGeo 是一个面向视频几何一致性估计的开源项目,旨在从视频序列中稳定地估计相机位姿和场景几何结···
mamma
开源
从视频直接捕捉多人3D动作,无需标记点,精度高。
MAMMA 是一个面向多人体运动捕捉的开源项目,主打无标记(markerless)且高精度的多人运动获取。它···
OmniShotCut
开源
自动找出视频里每个镜头切换点,省去手动标记
OmniShotCut 是一个专注于镜头边界检测(Shot Boundary Detection)的开源项目,用 Python 实现。它···
PhysInOne
开源
让视频生成懂物理规律,动态重建更真实
PhysInOne 是一个基于 Python 的物理感知视频生成与动态重建框架,相关论文被 CVPR 2026 接收。它旨···