RapidOCR
开源
多语言、多引擎的OCR工具集,一行代码搞定文字识别
RapidOCR 是一个基于 ONNX Runtime、OpenVINO、MNN、PaddlePaddle、TensorRT 和 PyTorch 等多种推理···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
RapidOCR
开源
多语言、多引擎的OCR工具集,一行代码搞定文字识别
RapidOCR 是一个基于 ONNX Runtime、OpenVINO、MNN、PaddlePaddle、TensorRT 和 PyTorch 等多种推理···
Text-Grab
开源
Windows 上按一下就能抓取屏幕任意文字,即取即用
Text-Grab 是一款专为 Windows 平台设计的轻量级 OCR 工具,核心目标是让用户在任何界面中快速抓取···
Deep-Exemplar-based-Video-Colorizati···
开源
给老视频一键上色,参考图决定风格
这是一个基于深度学习的视频上色工具,来自CVPR 2019论文。它利用参考图像(示例图)为灰度视频自动···
frigate-hass-integration
开源
把 Frigate AI 监控无缝接入 Home Assistant,实时看事件、玩自动化
Frigate Hass Integration 是 Home Assistant 的官方集成组件,用于将 Frigate NVR(网络视频录像机···
vit-pytorch
开源
用纯 Transformer 做图像分类,代码简洁易上手,快速复现 SOTA 效果。
vit-pytorch 是一个基于 PyTorch 实现的 Vision Transformer(ViT)模型库,由 Phil Wang(lucidra···
Noteify
开源
拍一下纸币,语音告诉你面额,助视障人士轻松交易
Noteify 是一个面向视障人士的印度纸币识别应用,通过手机摄像头拍摄纸币,利用 TensorFlow Lite 模···
viseron
开源
本地化智能监控,隐私安全,实时识别物体人脸车牌
Viseron 是一款自托管的本地 NVR 与 AI 计算机视觉软件,专注于隐私保护,所有视频处理均在本地完成···
annolid
开源
拖拽标注视频,自动追踪动物并分析行为
annolid 是一个基于实例分割的多目标跟踪与行为分析工具包,主要面向动物行为研究领域。它解决了研···
caer
开源
甩开样板代码,快速跑通视觉实验
caer 是一个面向计算机视觉研究的高性能 Python 库,旨在减少样板代码,让研究者专注于核心算法。它···
machinevision-toolbox-python
开源
像搭积木一样搞定相机标定、特征提取和图像分割,快速验证视觉算法。
Machine Vision Toolbox for Python 是 Peter Corke 机器视觉工具箱的 Python 版本,旨在为 Python···
pyxu
开源
模块化计算成像框架,轻松实现GPU加速与大规模数据处理
Pyxu是一个专注于计算成像的Python开源库,旨在提供模块化、可扩展的成像算法开发框架。它解决的是···
Open3D-ML
开源
开箱即用的3D点云模型训练与部署工具
Open3D-ML 是 Open3D 的扩展库,专注于 3D 机器学习任务,如点云语义分割、物体检测和实例分割。它···
photonvision
开源
FRC 机器人视觉开箱即用,调参即出目标位姿
PhotonVision 是面向 FIRST 机器人竞赛(FRC)的开源计算机视觉方案,用 Java 编写,基于 OpenCV 和···
bbox-visualizer
开源
几行代码画出专业边界框,可视化调试不再繁琐
bbox-visualizer 是一个轻量级的 Python 工具库,专门用于在图像上绘制和标注边界框(bounding box···
mlkit
开源
照着跑通 Google 官方 ML Kit 示例,快速集成视觉和 NLP 能力
mlkit 是 Google 官方维护的 ML Kit 示例应用集合,覆盖 Android 和 iOS 双平台。它通过完整可运行···
hms-ml-demo
开源
照着示例,快速集成华为AI能力到安卓App
HMS ML Demo 是华为机器学习套件(ML Kit)的官方示例项目,旨在帮助开发者快速集成华为的AI能力。···
yolov5
开源
用 PyTorch 快速训练和部署目标检测模型,开箱即用。
YOLOv5 是 Ultralytics 团队开发的基于 PyTorch 的目标检测框架,是目前计算机视觉领域最流行的开源···
PaddleOCR
开源
把图片和 PDF 变成 AI 能用的结构化文本数据
PaddleOCR 是百度开源的 OCR 工具库,旨在将任意 PDF 或图片文档转化为结构化数据,供 AI 系统使用···
polynomial_nets
开源
用多项式替代传统激活,以更少参数实现更强图像识别与生成
Π-nets(多项式神经网络)是CVPR'20论文的官方实现,并扩展至T-PAMI-21版本。该项目旨在用多项式函···
roboflow-python
开源
用 Python 管数据集和模型,视觉项目少折腾
roboflow-python 是 Roboflow 官方推出的 Python SDK,用于在代码中统一管理计算机视觉数据集、模型···
caption_ocr_tool
开源
把视频里烧死的字幕,一键抠成可编辑文字
caption_ocr_tool 是一个用 Java 编写的视频硬字幕提取工具,主要解决视频中烧录(硬字幕)无法直接···
torchxrayvision
开源
开箱即用的胸部 X 光 AI 模型库,快速训练和部署诊断模型
TorchXRayVision 是一个面向胸部 X 光影像的开源工具库,集成了多个公开数据集和预训练模型,覆盖分···
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCVTutorials 是一份 OpenCV-Python 4.1 的中文文档项目,旨在为中文开发者提供系统、易懂的 Op···
tessdoc
开源
Tesseract 官方文档一站查,装、调、训不再翻论坛
tessdoc 是 Tesseract OCR 引擎的官方文档项目,以 HTML 形式集中整理 Tesseract 的安装、编译、训···