libreyolo
开源
MIT 许可的 YOLO 检测库,拿来就能商用
LibreYOLO 是一个采用 MIT 许可证的开源计算机视觉库,用 Python 编写,目标是为开发者提供自由、可···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
libreyolo
开源
MIT 许可的 YOLO 检测库,拿来就能商用
LibreYOLO 是一个采用 MIT 许可证的开源计算机视觉库,用 Python 编写,目标是为开发者提供自由、可···
NAF
开源
零样本特征放大,无需训练,即插即用提升视觉模型分辨率
NAF(Neighborhood Attention Filtering)是一个用于零样本特征上采样的开源模型实现,由微软研究院···
NI-Tex
开源
从平铺图一键生成贴合人体的3D服装纹理
NI-Tex 是一个面向数字人3D服装纹理生成的开源项目,来自CVPR 2026 Highlight论文。它解决的是非等···
HunyuanOCR
开源
轻量 OCR 大模型,一张图直接出结构化文字
HunyuanOCR 是腾讯混元团队开源的轻量级 OCR 视觉语言模型系列,当前版本 HunyuanOCR-1.5 主打「更···
Anomagic
开源
用文字描述就能生成工业异常图像,零样本搞定缺陷数据增强
Anomagic 是一个面向工业异常检测的零样本异常图像生成框架,对应 AAAI 2026 论文的官方实现。它解···
Robust-R1
开源
让视觉模型在模糊、低光等恶劣图像下也能准确推理
Robust-R1 是一个针对视觉语言模型在复杂退化场景下推理能力不足的问题而提出的开源项目,其论文被···
VideoLucy
开源
让AI看懂长视频,靠“记忆回溯”抓住关键线索
VideoLucy 是一个面向长视频理解的开源项目,发表于 NeurIPS 2025,核心创新在于“深度记忆回溯”(···
LabelAny3D
开源
一张普通照片,自动标出任意物体的3D框
LabelAny3D 是 NeurIPS 2025 收录的开源项目,面向野外场景下的三维目标标注任务。它解决的核心问题···
MERGE
开源
一个模型搞定图像生成和深度估计,省时又省力
MERGE 是一个统一图像生成与深度估计的扩散模型框架,由 NeurIPS 2025 论文提出。它解决传统文本到···
PaDT
开源
把图像切成 token,一个模型搞定分割、检测、姿态估计
PaDT 是一个面向多模态大语言模型(MLLM)的统一视觉任务框架,其核心思想是将图像分割为可解码的视···
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
DEIMv2 是一个基于 DINOv3 的实时目标检测框架,旨在解决传统检测器在速度和精度之间难以平衡的问题···
yomihon
开源
看日漫直接 OCR 查词,边读边学不切应用
yomihon 是一款面向 Android 的开源漫画阅读器,主打免费、无广告的本地与在线漫画阅读体验,并集成···
Churro
开源
让历史手稿和古籍轻松变成可搜索文本
Churro 是一个面向历史文献转录的 OCR 工具包,旨在以高精度和低成本让手写及印刷的历史资料变得可···
CAST
开源
单张照片,重建可编辑的 3D 组件化场景
CAST 是 SIGGRAPH 2025 最佳论文提名论文的非官方简化实现,目标是从单张 RGB 图像重建组件对齐的 ···
GC-VLN
开源
不训练模型,用图约束让机器人听懂指令找路
GC-VLN 是一个面向视觉-语言导航(VLN)任务的训练-free 方法,由 CoRL 2025 论文提出。它解决的是···
FoundAD
开源
用基础视觉编码器,少样本即可精准检测异常
FoundAD 是 ICLR 2026 论文《Foundation Visual Encoders Are Secretly Few-Shot Anomaly Detector···
ExtractPDF4J
开源
Java 库从文本/扫描 PDF 里抽结构化表格
ExtractPDF4J 是一个用 Java 编写的 PDF 表格提取与 OCR 库,主要解决从 PDF 中稳定抽取结构化表格···
GSFixer
开源
用视频扩散先验修复3D重建,让渲染更真实
GSFixer 是一个基于参考图像引导的视频扩散先验来修复三维高斯泼溅(3D Gaussian Splatting)重建质···
LiDARCrafter
开源
从 LiDAR 序列直接生成动态 4D 世界,让机器看懂时空变化
LiDARCrafter 是一个基于 LiDAR 序列的动态 4D 世界建模框架,由 AAAI 2026 Oral 论文提出。它解决···
docstrange
开源
从任意文档秒提取结构化数据,一键转成 JSON/CSV
docstrange 是一个基于 Python 的文档数据提取与转换工具,旨在解决从多种文档格式(如 PDF、Word、···
oar-ocr
开源
Rust 原生 OCR,一份二进制搞定文字识别与版面理解
oar-ocr 是一个用 Rust 原生实现的 OCR 工具包,专注文字识别、文档版面分析和基于视觉语言模型的文···
meikipop
开源
截图即查日语生词,阅读不中断
meikipop 是一款面向日语学习者的跨平台 OCR 弹窗词典工具,支持 Windows、Linux 和 macOS。它解决···
makeacopy
开源
离线拍照扫文档,OCR 转文字,隐私不外泄
MakeACopy 是一款开源的 Android 文档扫描应用,目标是把纸质文件快速数字化。它支持拍照取景、自动···
Franca
开源
用嵌套套娃聚类,让视觉模型学得更快更准
Franca 是一个用于可扩展视觉表示学习的开源项目,其核心创新在于提出嵌套套娃聚类(Nested Matryo···