计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

libreyolo 开源

MIT 许可的 YOLO 检测库,拿来就能商用

LibreYOLO 是一个采用 MIT 许可证的开源计算机视觉库,用 Python 编写,目标是为开发者提供自由、可···

★ 679 评分 2025-11-27
NAF 开源

零样本特征放大,无需训练,即插即用提升视觉模型分辨率

NAF(Neighborhood Attention Filtering)是一个用于零样本特征上采样的开源模型实现,由微软研究院···

★ 120 评分 2025-11-24
NI-Tex 开源

从平铺图一键生成贴合人体的3D服装纹理

NI-Tex 是一个面向数字人3D服装纹理生成的开源项目,来自CVPR 2026 Highlight论文。它解决的是非等···

★ 72 评分 2025-11-23
HunyuanOCR 开源

轻量 OCR 大模型,一张图直接出结构化文字

HunyuanOCR 是腾讯混元团队开源的轻量级 OCR 视觉语言模型系列,当前版本 HunyuanOCR-1.5 主打「更···

★ 2016 评分 2025-11-18
Anomagic 开源

用文字描述就能生成工业异常图像,零样本搞定缺陷数据增强

Anomagic 是一个面向工业异常检测的零样本异常图像生成框架,对应 AAAI 2026 论文的官方实现。它解···

★ 159 评分 2025-11-14
Robust-R1 开源

让视觉模型在模糊、低光等恶劣图像下也能准确推理

Robust-R1 是一个针对视觉语言模型在复杂退化场景下推理能力不足的问题而提出的开源项目,其论文被···

★ 511 评分 2025-11-09
VideoLucy 开源

让AI看懂长视频,靠“记忆回溯”抓住关键线索

VideoLucy 是一个面向长视频理解的开源项目,发表于 NeurIPS 2025,核心创新在于“深度记忆回溯”(···

★ 68 评分 2025-10-23
LabelAny3D 开源

一张普通照片,自动标出任意物体的3D框

LabelAny3D 是 NeurIPS 2025 收录的开源项目,面向野外场景下的三维目标标注任务。它解决的核心问题···

★ 134 评分 2025-10-23
MERGE 开源

一个模型搞定图像生成和深度估计,省时又省力

MERGE 是一个统一图像生成与深度估计的扩散模型框架,由 NeurIPS 2025 论文提出。它解决传统文本到···

★ 222 评分 2025-10-22
PaDT 开源

把图像切成 token,一个模型搞定分割、检测、姿态估计

PaDT 是一个面向多模态大语言模型(MLLM)的统一视觉任务框架,其核心思想是将图像分割为可解码的视···

★ 165 评分 2025-09-26
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

DEIMv2 是一个基于 DINOv3 的实时目标检测框架,旨在解决传统检测器在速度和精度之间难以平衡的问题···

★ 2046 评分 2025-09-19
yomihon 开源

看日漫直接 OCR 查词,边读边学不切应用

yomihon 是一款面向 Android 的开源漫画阅读器,主打免费、无广告的本地与在线漫画阅读体验,并集成···

★ 127 评分 2025-09-14
Churro 开源

让历史手稿和古籍轻松变成可搜索文本

Churro 是一个面向历史文献转录的 OCR 工具包,旨在以高精度和低成本让手写及印刷的历史资料变得可···

★ 79 评分 2025-09-10
CAST 开源

单张照片,重建可编辑的 3D 组件化场景

CAST 是 SIGGRAPH 2025 最佳论文提名论文的非官方简化实现,目标是从单张 RGB 图像重建组件对齐的 ···

★ 256 评分 2025-09-09
GC-VLN 开源

不训练模型,用图约束让机器人听懂指令找路

GC-VLN 是一个面向视觉-语言导航(VLN)任务的训练-free 方法,由 CoRL 2025 论文提出。它解决的是···

★ 84 评分 2025-08-27
FoundAD 开源

用基础视觉编码器,少样本即可精准检测异常

FoundAD 是 ICLR 2026 论文《Foundation Visual Encoders Are Secretly Few-Shot Anomaly Detector···

★ 85 评分 2025-08-15
ExtractPDF4J 开源

Java 库从文本/扫描 PDF 里抽结构化表格

ExtractPDF4J 是一个用 Java 编写的 PDF 表格提取与 OCR 库,主要解决从 PDF 中稳定抽取结构化表格···

★ 522 评分 2025-08-14
GSFixer 开源

用视频扩散先验修复3D重建,让渲染更真实

GSFixer 是一个基于参考图像引导的视频扩散先验来修复三维高斯泼溅(3D Gaussian Splatting)重建质···

★ 193 评分 2025-08-13
LiDARCrafter 开源

从 LiDAR 序列直接生成动态 4D 世界,让机器看懂时空变化

LiDARCrafter 是一个基于 LiDAR 序列的动态 4D 世界建模框架,由 AAAI 2026 Oral 论文提出。它解决···

★ 203 评分 2025-08-05
docstrange 开源

从任意文档秒提取结构化数据,一键转成 JSON/CSV

docstrange 是一个基于 Python 的文档数据提取与转换工具,旨在解决从多种文档格式(如 PDF、Word、···

★ 1570 评分 2025-07-31
oar-ocr 开源

Rust 原生 OCR,一份二进制搞定文字识别与版面理解

oar-ocr 是一个用 Rust 原生实现的 OCR 工具包,专注文字识别、文档版面分析和基于视觉语言模型的文···

★ 174 评分 2025-07-31
meikipop 开源

截图即查日语生词,阅读不中断

meikipop 是一款面向日语学习者的跨平台 OCR 弹窗词典工具,支持 Windows、Linux 和 macOS。它解决···

★ 668 评分 2025-07-28
makeacopy 开源

离线拍照扫文档,OCR 转文字,隐私不外泄

MakeACopy 是一款开源的 Android 文档扫描应用,目标是把纸质文件快速数字化。它支持拍照取景、自动···

★ 539 评分 2025-07-21
Franca 开源

用嵌套套娃聚类,让视觉模型学得更快更准

Franca 是一个用于可扩展视觉表示学习的开源项目,其核心创新在于提出嵌套套娃聚类(Nested Matryo···

★ 282 评分 2025-07-17