计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

ocr-vqgan 开源

让AI生成的论文图表文字清晰可读

OCR-VQGAN 是一个面向论文图表(figure images)的离散图像编码器,包含 tokenizer 和 detokenizer···

★ 86 评分 2022-11-07
OnnxTR 开源

用 ONNX 跑 docTR OCR,不装 PyTorch 也能识别文档文字

OnnxTR 是 docTR 文档文本识别库的 ONNX 推理管线封装,目标是在不依赖深度学习训练框架的前提下提···

★ 197 评分 2022-11-07
tapnet 开源

在视频里盯住任意一个点,遮挡变形也不丢

TapNet 是 DeepMind 开源的「追踪任意点」(Tracking Any Point, TAP)基准与算法实现,目标是在视···

★ 1991 评分 2022-11-03
ModelAssistant 开源

从训练到部署,让嵌入式设备跑上视觉 AI

ModelAssistant 是矽递科技(Seeed Studio)推出的开源嵌入式 AI 工具链,属于 SenseCraft 生态的一···

★ 444 评分 2022-10-18
CShade 开源

给 ReShade 装上 AI 引擎,实时提升游戏和视频画质

CShade 是一组专为 ReShade 设计的图像与视频处理着色器集合,使用 HLSL 编写,旨在为游戏和视频画···

★ 63 评分 2022-10-05
FrozenBiLM 开源

冻结语言模型,零样本看懂视频回答问题

FrozenBiLM 是一个用于零样本视频问答(VideoQA)的开源模型,来自 NeurIPS 2022 论文。它解决的是···

★ 159 评分 2022-09-25
FernRPExample 开源

在Unity里用Stable Diffusion生成贴图,直接驱动NPR/PBR渲染

FernRPExample 是 FernRP 包在 Unity 中的示例实现,专注于将 AI 图像生成(如 Stable Diffusion)···

★ 933 评分 2022-09-24
ultralytics 开源

几行代码搞定目标检测,训练部署一条龙

Ultralytics 是计算机视觉领域最流行的开源工具包,提供 YOLO 系列目标检测模型(包括 YOLOv8、YOL···

★ 62024 评分 2022-09-11
Pix2Text 开源

图片直接转 Markdown,公式表格全搞定,免费替代 Mathpix

Pix2Text 是一个开源的 Python3 工具,旨在将图片中的版面、表格、数学公式和文字识别并转换为 Mar···

★ 3255 评分 2022-09-07
semantic-segmentation-ml-pipeline 开源

用TFX+GCP一键搭建语义分割生产级流水线

这是一个基于TensorFlow Extended (TFX)和Google Cloud Platform (GCP)产品的语义分割机器学习流水···

★ 96 评分 2022-08-28
VideoPipe 开源

拖拽式搭建视频分析流水线,快速落地 CV+大模型应用

VideoPipe 是一个基于计算机视觉模型和多模态大语言模型(mLLM)的跨平台视频结构化分析框架。它解···

★ 2960 评分 2022-08-26
CV-CUDA 开源

GPU 批量跑图像预处理,云端视觉吞吐翻倍

CV-CUDA 是字节跳动与英伟达联合开源、面向云规模图像处理与计算机视觉的 GPU 加速库。它针对传统 ···

★ 2728 评分 2022-08-23
yolov7-object-tracking 开源

几行命令跑通 YOLOv7 检测加 SORT 跟踪,视频里目标自动带 ID

这是一个把 YOLOv7 目标检测与 SORT 跟踪算法结合起来的开源示例项目,使用 PyTorch 做模型推理、O···

★ 653 评分 2022-08-21
BiRefNet 开源

高分辨率图像一键精准抠图,细节不丢失

BiRefNet 是一个用于高分辨率二分图像分割(Dichotomous Image Segmentation, DIS)的深度学习模型···

★ 4228 评分 2022-08-17
particle-life 开源

拖拽调参,让粒子自己长成生命图案

particle-life 是一个用 HTML/JavaScript 实现的粒子生命模拟器,通过定义粒子之间的吸引/排斥力规···

★ 3350 评分 2022-08-10
Remote-Sensing-RVSA 开源

让通用ViT适配遥感图像,多方向多尺度目标识别更准

Remote-Sensing-RVSA 是遥感领域的基础模型开源项目,对应 TGRS'22 论文《Advancing Plain Vision ···

★ 469 评分 2022-08-02
fsdl-text-recognizer-2022-labs 开源

跟着课程撸一个能跑的文本识别全流程项目

这是一个完整的深度学习项目,源自 Full Stack Deep Learning 2022 课程的实验代码,用于构建文本识···

★ 531 评分 2022-07-13
Awesome-ECCV2022-Low-Level-Vision 开源

速查ECCV 2022低层视觉论文代码,跟上前沿。

这是一个汇集ECCV 2022会议中低层视觉方向论文与代码的精选列表,覆盖图像恢复、增强、去模糊、去噪···

★ 170 评分 2022-07-04
Wis3D 开源

浏览器里直接看3D点云和相机位姿,免装软件

Wis3D 是一个基于网页的 3D 可视化工具,面向 3D 计算机视觉研究与开发场景。它解决的核心问题是:···

★ 324 评分 2022-05-20
stitching 开源

多张照片一键拼成全景图,快且稳

stitching 是一个基于 Python 的图像拼接工具包,底层依赖 OpenCV,目标是让全景图生成变得又快又稳···

★ 2628 评分 2022-05-08
Savant 开源

用 YAML 搭视频 AI 流水线,少写代码多跑流

Savant 是一个基于 Python 的计算机视觉与视频分析框架,构建在 NVIDIA DeepStream 和 CUDA 之上,···

★ 855 评分 2022-05-07
BCI 开源

用 GAN 一键把 H&E 病理图转成 IHC 图,省时省钱

BCI 是一个基于 Pyramid Pix2pix 的乳腺癌免疫组化(IHC)图像生成工具,旨在通过生成对抗网络(GA···

★ 204 评分 2022-04-26
x-unet 开源

用最新注意力机制升级 U-Net,提升图像生成与分割效果

x-unet 是一个基于 PyTorch 的 U-Net 图像生成与分割实现,旨在整合高效的注意力机制和最新的研究成···

★ 294 评分 2022-03-23
GLAMR 开源

动态相机下,遮挡也能精准重建3D人体

GLAMR是CVPR 2022 Oral论文的官方PyTorch实现,专注于动态相机下的全局遮挡感知人体网格恢复。它解···

★ 390 评分 2022-03-23