Awesome-CVPR2024-Low-Level-Vision
开源
按任务分类整理CVPR底层视觉论文和代码,找前沿成果快人一步
这是一个CVPR顶会论文合集项目,专门收集CVPR 2024/2023/2022中关于底层视觉(Low-Level Vision)方···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
Awesome-CVPR2024-Low-Level-Vision
开源
按任务分类整理CVPR底层视觉论文和代码,找前沿成果快人一步
这是一个CVPR顶会论文合集项目,专门收集CVPR 2024/2023/2022中关于底层视觉(Low-Level Vision)方···
kornia-rs
开源
用 Rust 写高性能视觉算子,还能被 Python 直接调用
kornia-rs 是用 Rust 编写的底层 3D 计算机视觉库,定位为 Kornia 生态的 Rust 实现。它解决的核心···
Dual-task-Pose-Transformer-Network
开源
上传人物照片和姿态,一键生成自然摆姿的新图像
Dual-task-Pose-Transformer-Network 是一个用于姿态引导的人物图像生成模型,发表于 CVPR 2022。它···
BEVT
开源
用图像预训练加速视频 Transformer,省数据省算力
BEVT 是 CVPR 2022 论文《BEVT: BERT Pretraining of Video Transformers》的官方 PyTorch 实现。它···
scribeocr
开源
浏览器里对照原图改 OCR,扫描件变可编辑文档
ScribeOCR 是一个基于浏览器的 OCR 文字识别与校对工具,目标是把扫描图片、PDF 或已有 OCR 结果变···
awesome-yolo-object-detection
开源
一份清单,快速找到你想要的 YOLO 模型和数据集。
awesome-yolo-object-detection 是一个精选 YOLO 目标检测系列开源项目和数据集的资源合集。它系统···
hcaptcha-challenger
开源
用大模型轻松过 hCaptcha,自动化不再被卡脖子
hcaptcha-challenger 是一个利用多模态大语言模型(如 GPT-4V、Gemini、CLIP)自动解决 hCaptcha 验···
paperless-ngx
开源
扫描即归档,自动识别分类,让纸质文件变可搜索数字库
paperless-ngx 是一个社区驱动的增强型文档管理系统,旨在帮助个人和小团队摆脱纸质文件堆积的困扰···
QMUPD
开源
无需配对数据,自动生成高质量人像线条画
QMUPD 是一个基于生成对抗网络(GAN)的开源项目,用于从非成对训练数据中生成高质量的人像线条画。···
sparrow
开源
从文档和图片中一键提取结构化数据,驱动自动化流程。
sparrow 是一个专注于结构化数据提取、指令调用和智能体工作流的开源框架,结合了传统机器学习、大···
awesome-camouflaged-object-detection
开源
伪装目标检测论文、数据集与代码一站合集
这是一个聚焦伪装/隐蔽目标检测(Camouflaged Object Detection, COD)的精选资源合集,系统整理了···
eSearch-OCR
开源
npm 装完就能在 JS 里跑 PaddleOCR 取字。
eSearch-OCR 是一个基于 PaddleOCR 的 JavaScript/TypeScript OCR 库,目标是在 Node.js 与浏览器环···
deepdoctection
开源
一行代码搭建文档解析流水线,快速提取版面、表格与文本。
deepdoctection 是一个面向文档 AI 的 Python 工具库,旨在帮助开发者从 PDF、扫描件等非结构化文档···
NED
开源
一句话驱动视频人脸表情编辑,影视级效果轻松实现
NED是CVPR 2022提出的视频人脸表情编辑工具,基于PyTorch实现。它解决的是视频中演员面部情绪的精准···
Thin-Plate-Spline-Motion-Model
开源
一张图+驱动视频,生成自然流畅的动态形象
Thin-Plate-Spline-Motion-Model 是一个基于 CVPR 2022 论文的图像动画开源项目,核心解决从单张静···
MapReader
开源
批量识别历史地图要素,自动定位到地理坐标
MapReader 是英国国家档案馆等机构合作开发的开源计算机视觉流水线,专为大规模地图图像的分析与探···
IDEAS
开源
无需嵌入的隐写术,用解纠缠自编码器隐藏图像
IDEAS 是 CVPR 2022 论文《Image Disentanglement Autoencoder for Steganography without Embeddi···
RGBT-Perception-Papers
开源
一页汇总RGB-T三大任务论文,快速入门多模态感知
RGBT-Perception-Papers 是一个面向 RGB-T(可见光-热红外)多模态感知领域的论文与资源汇总仓库,···
ORSI-HRSI-SOD_Summary
开源
遥感图像显著目标检测论文清单,一页看懂研究脉络
这是一个面向光学遥感图像显著目标检测(ORSI-HRSI-SOD)的论文与资源汇总清单,系统整理了基于深度···
isaac_ros_image_segmentation
开源
在 Jetson 上用 GPU 加速跑语义分割,实时又省心。
isaac_ros_image_segmentation 是 NVIDIA 推出的 ROS2 语义分割加速包,基于 TensorRT 和 GPU 推理···
camera.ui
开源
本地跑 AI 监控,摄像头秒变智能 NVR
camera.ui 是一个面向专业视频监控场景的本地优先开源平台,用 TypeScript 编写。它把分散的 IP 摄···
ml-cvnets
开源
一套代码训练分类检测分割视觉模型
CVNets 是苹果开源的计算机视觉训练库,基于 PyTorch 构建,目标是把分类、检测、分割等任务的训练···
ScanNow
开源
打开即扫,秒出高清扫描件,隐私本地处理。
ScanNow 是一款面向 iOS 设备的快速文档扫描应用,旨在简化纸质文档的数字化流程。它利用 VisionKi···
eSearch
开源
截屏即识别,离线翻译搜索一步到位
eSearch 是一款基于 Electron 和 TypeScript 开发的跨平台截屏与 OCR 工具,支持 Windows、Linux 和···