计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

Awesome-CVPR2024-Low-Level-Vision 开源

按任务分类整理CVPR底层视觉论文和代码,找前沿成果快人一步

这是一个CVPR顶会论文合集项目,专门收集CVPR 2024/2023/2022中关于底层视觉(Low-Level Vision)方···

★ 658 评分 2022-03-11
kornia-rs 开源

用 Rust 写高性能视觉算子,还能被 Python 直接调用

kornia-rs 是用 Rust 编写的底层 3D 计算机视觉库,定位为 Kornia 生态的 Rust 实现。它解决的核心···

★ 710 评分 2022-03-05
Dual-task-Pose-Transformer-Network 开源

上传人物照片和姿态,一键生成自然摆姿的新图像

Dual-task-Pose-Transformer-Network 是一个用于姿态引导的人物图像生成模型,发表于 CVPR 2022。它···

★ 98 评分 2022-03-02
BEVT 开源

用图像预训练加速视频 Transformer,省数据省算力

BEVT 是 CVPR 2022 论文《BEVT: BERT Pretraining of Video Transformers》的官方 PyTorch 实现。它···

★ 161 评分 2022-03-02
scribeocr 开源

浏览器里对照原图改 OCR,扫描件变可编辑文档

ScribeOCR 是一个基于浏览器的 OCR 文字识别与校对工具,目标是把扫描图片、PDF 或已有 OCR 结果变···

★ 813 评分 2022-03-02
awesome-yolo-object-detection 开源

一份清单,快速找到你想要的 YOLO 模型和数据集。

awesome-yolo-object-detection 是一个精选 YOLO 目标检测系列开源项目和数据集的资源合集。它系统···

★ 1791 评分 2022-02-19
hcaptcha-challenger 开源

用大模型轻松过 hCaptcha,自动化不再被卡脖子

hcaptcha-challenger 是一个利用多模态大语言模型(如 GPT-4V、Gemini、CLIP)自动解决 hCaptcha 验···

★ 2511 评分 2022-02-15
paperless-ngx 开源

扫描即归档,自动识别分类,让纸质文件变可搜索数字库

paperless-ngx 是一个社区驱动的增强型文档管理系统,旨在帮助个人和小团队摆脱纸质文件堆积的困扰···

★ 46051 评分 2022-02-12
QMUPD 开源

无需配对数据,自动生成高质量人像线条画

QMUPD 是一个基于生成对抗网络(GAN)的开源项目,用于从非成对训练数据中生成高质量的人像线条画。···

★ 63 评分 2022-01-27
sparrow 开源

从文档和图片中一键提取结构化数据,驱动自动化流程。

sparrow 是一个专注于结构化数据提取、指令调用和智能体工作流的开源框架,结合了传统机器学习、大···

★ 5225 评分 2022-01-08
awesome-camouflaged-object-detection 开源

伪装目标检测论文、数据集与代码一站合集

这是一个聚焦伪装/隐蔽目标检测(Camouflaged Object Detection, COD)的精选资源合集,系统整理了···

★ 492 评分 2022-01-02
eSearch-OCR 开源

npm 装完就能在 JS 里跑 PaddleOCR 取字。

eSearch-OCR 是一个基于 PaddleOCR 的 JavaScript/TypeScript OCR 库,目标是在 Node.js 与浏览器环···

★ 131 评分 2021-12-18
deepdoctection 开源

一行代码搭建文档解析流水线,快速提取版面、表格与文本。

deepdoctection 是一个面向文档 AI 的 Python 工具库,旨在帮助开发者从 PDF、扫描件等非结构化文档···

★ 3258 评分 2021-12-09
NED 开源

一句话驱动视频人脸表情编辑,影视级效果轻松实现

NED是CVPR 2022提出的视频人脸表情编辑工具,基于PyTorch实现。它解决的是视频中演员面部情绪的精准···

★ 160 评分 2021-11-30
Thin-Plate-Spline-Motion-Model 开源

一张图+驱动视频,生成自然流畅的动态形象

Thin-Plate-Spline-Motion-Model 是一个基于 CVPR 2022 论文的图像动画开源项目,核心解决从单张静···

★ 3606 评分 2021-11-24
MapReader 开源

批量识别历史地图要素,自动定位到地理坐标

MapReader 是英国国家档案馆等机构合作开发的开源计算机视觉流水线,专为大规模地图图像的分析与探···

★ 149 评分 2021-11-22
IDEAS 开源

无需嵌入的隐写术,用解纠缠自编码器隐藏图像

IDEAS 是 CVPR 2022 论文《Image Disentanglement Autoencoder for Steganography without Embeddi···

★ 53 评分 2021-11-13
RGBT-Perception-Papers 开源

一页汇总RGB-T三大任务论文,快速入门多模态感知

RGBT-Perception-Papers 是一个面向 RGB-T(可见光-热红外)多模态感知领域的论文与资源汇总仓库,···

★ 161 评分 2021-11-12
ORSI-HRSI-SOD_Summary 开源

遥感图像显著目标检测论文清单,一页看懂研究脉络

这是一个面向光学遥感图像显著目标检测(ORSI-HRSI-SOD)的论文与资源汇总清单,系统整理了基于深度···

★ 124 评分 2021-11-12
isaac_ros_image_segmentation 开源

在 Jetson 上用 GPU 加速跑语义分割,实时又省心。

isaac_ros_image_segmentation 是 NVIDIA 推出的 ROS2 语义分割加速包,基于 TensorRT 和 GPU 推理···

★ 127 评分 2021-11-04
camera.ui 开源

本地跑 AI 监控,摄像头秒变智能 NVR

camera.ui 是一个面向专业视频监控场景的本地优先开源平台,用 TypeScript 编写。它把分散的 IP 摄···

★ 1116 评分 2021-10-27
ml-cvnets 开源

一套代码训练分类检测分割视觉模型

CVNets 是苹果开源的计算机视觉训练库,基于 PyTorch 构建,目标是把分类、检测、分割等任务的训练···

★ 1990 评分 2021-10-21
ScanNow 开源

打开即扫,秒出高清扫描件,隐私本地处理。

ScanNow 是一款面向 iOS 设备的快速文档扫描应用,旨在简化纸质文档的数字化流程。它利用 VisionKi···

★ 65 评分 2021-10-10
eSearch 开源

截屏即识别,离线翻译搜索一步到位

eSearch 是一款基于 Electron 和 TypeScript 开发的跨平台截屏与 OCR 工具,支持 Windows、Linux 和···

★ 7213 评分 2021-10-06