ocr-vqgan
开源
让AI生成的论文图表文字清晰可读
OCR-VQGAN 是一个面向论文图表(figure images)的离散图像编码器,包含 tokenizer 和 detokenizer···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
ocr-vqgan
开源
让AI生成的论文图表文字清晰可读
OCR-VQGAN 是一个面向论文图表(figure images)的离散图像编码器,包含 tokenizer 和 detokenizer···
OnnxTR
开源
用 ONNX 跑 docTR OCR,不装 PyTorch 也能识别文档文字
OnnxTR 是 docTR 文档文本识别库的 ONNX 推理管线封装,目标是在不依赖深度学习训练框架的前提下提···
tapnet
开源
在视频里盯住任意一个点,遮挡变形也不丢
TapNet 是 DeepMind 开源的「追踪任意点」(Tracking Any Point, TAP)基准与算法实现,目标是在视···
ModelAssistant
开源
从训练到部署,让嵌入式设备跑上视觉 AI
ModelAssistant 是矽递科技(Seeed Studio)推出的开源嵌入式 AI 工具链,属于 SenseCraft 生态的一···
CShade
开源
给 ReShade 装上 AI 引擎,实时提升游戏和视频画质
CShade 是一组专为 ReShade 设计的图像与视频处理着色器集合,使用 HLSL 编写,旨在为游戏和视频画···
FrozenBiLM
开源
冻结语言模型,零样本看懂视频回答问题
FrozenBiLM 是一个用于零样本视频问答(VideoQA)的开源模型,来自 NeurIPS 2022 论文。它解决的是···
FernRPExample
开源
在Unity里用Stable Diffusion生成贴图,直接驱动NPR/PBR渲染
FernRPExample 是 FernRP 包在 Unity 中的示例实现,专注于将 AI 图像生成(如 Stable Diffusion)···
ultralytics
开源
几行代码搞定目标检测,训练部署一条龙
Ultralytics 是计算机视觉领域最流行的开源工具包,提供 YOLO 系列目标检测模型(包括 YOLOv8、YOL···
Pix2Text
开源
图片直接转 Markdown,公式表格全搞定,免费替代 Mathpix
Pix2Text 是一个开源的 Python3 工具,旨在将图片中的版面、表格、数学公式和文字识别并转换为 Mar···
semantic-segmentation-ml-pipeline
开源
用TFX+GCP一键搭建语义分割生产级流水线
这是一个基于TensorFlow Extended (TFX)和Google Cloud Platform (GCP)产品的语义分割机器学习流水···
VideoPipe
开源
拖拽式搭建视频分析流水线,快速落地 CV+大模型应用
VideoPipe 是一个基于计算机视觉模型和多模态大语言模型(mLLM)的跨平台视频结构化分析框架。它解···
CV-CUDA
开源
GPU 批量跑图像预处理,云端视觉吞吐翻倍
CV-CUDA 是字节跳动与英伟达联合开源、面向云规模图像处理与计算机视觉的 GPU 加速库。它针对传统 ···
几行命令跑通 YOLOv7 检测加 SORT 跟踪,视频里目标自动带 ID
这是一个把 YOLOv7 目标检测与 SORT 跟踪算法结合起来的开源示例项目,使用 PyTorch 做模型推理、O···
BiRefNet
开源
高分辨率图像一键精准抠图,细节不丢失
BiRefNet 是一个用于高分辨率二分图像分割(Dichotomous Image Segmentation, DIS)的深度学习模型···
particle-life
开源
拖拽调参,让粒子自己长成生命图案
particle-life 是一个用 HTML/JavaScript 实现的粒子生命模拟器,通过定义粒子之间的吸引/排斥力规···
Remote-Sensing-RVSA
开源
让通用ViT适配遥感图像,多方向多尺度目标识别更准
Remote-Sensing-RVSA 是遥感领域的基础模型开源项目,对应 TGRS'22 论文《Advancing Plain Vision ···
fsdl-text-recognizer-2022-labs
开源
跟着课程撸一个能跑的文本识别全流程项目
这是一个完整的深度学习项目,源自 Full Stack Deep Learning 2022 课程的实验代码,用于构建文本识···
Awesome-ECCV2022-Low-Level-Vision
开源
速查ECCV 2022低层视觉论文代码,跟上前沿。
这是一个汇集ECCV 2022会议中低层视觉方向论文与代码的精选列表,覆盖图像恢复、增强、去模糊、去噪···
Wis3D
开源
浏览器里直接看3D点云和相机位姿,免装软件
Wis3D 是一个基于网页的 3D 可视化工具,面向 3D 计算机视觉研究与开发场景。它解决的核心问题是:···
stitching
开源
多张照片一键拼成全景图,快且稳
stitching 是一个基于 Python 的图像拼接工具包,底层依赖 OpenCV,目标是让全景图生成变得又快又稳···
Savant
开源
用 YAML 搭视频 AI 流水线,少写代码多跑流
Savant 是一个基于 Python 的计算机视觉与视频分析框架,构建在 NVIDIA DeepStream 和 CUDA 之上,···
BCI
开源
用 GAN 一键把 H&E 病理图转成 IHC 图,省时省钱
BCI 是一个基于 Pyramid Pix2pix 的乳腺癌免疫组化(IHC)图像生成工具,旨在通过生成对抗网络(GA···
x-unet
开源
用最新注意力机制升级 U-Net,提升图像生成与分割效果
x-unet 是一个基于 PyTorch 的 U-Net 图像生成与分割实现,旨在整合高效的注意力机制和最新的研究成···
GLAMR
开源
动态相机下,遮挡也能精准重建3D人体
GLAMR是CVPR 2022 Oral论文的官方PyTorch实现,专注于动态相机下的全局遮挡感知人体网格恢复。它解···