计算机视觉

汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。

共收录 447 个开源项目

FluidNexus 开源

单视频重建3D流体,预测未来流动

FluidNexus 是一个基于物理信息神经网络的开源项目,旨在从单段视频中重建三维流体动态并预测其未来···

★ 82 评分 2025-03-06
UniGoal 开源

让机器人零训练看懂世界,直接找目标

UniGoal 是一个面向通用零样本目标导向导航的框架,发表于 CVPR 2025。它解决的是智能体在未知环境···

★ 367 评分 2025-02-27
snow-apps 开源

一站式搞定截图、录屏和OCR,替代系统自带工具

Snow Apps 是一个开源的桌面工具集合,主要包含两款应用:Snow Shot 和 Snow Image Viewer。Snow S···

★ 5049 评分 2025-02-26
SmartJavaAI 开源

Java 开发者福音:一行依赖,离线搞定人脸、OCR、语音等 AI 功能

SmartJavaAI 是一个基于 Java 的免费离线 AI 算法工具箱,旨在为 Java 开发者提供开箱即用的 AI 能···

★ 916 评分 2025-02-21
EarthDial 开源

把卫星影像变成能聊天的地球百科,问一句就能读懂地表变化。

EarthDial 是一个面向地球观测的多模态对话模型,由 CVPR 2025 论文提出。它旨在将卫星、航空等多传···

★ 146 评分 2025-02-20
Awesome-CV-MasterHub 开源

按图索骥,一篇列表搞定 CV 前沿论文追踪

Awesome-CV-MasterHub 是一个计算机视觉领域的论文精选列表,汇总了图像生成、分类、描述、去雾、去···

★ 977 评分 2025-02-14
pdf-craft 开源

把扫描版PDF变成可编辑文本,读书笔记一键搞定

pdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR ···

★ 6330 评分 2025-02-12
GeoPixel 开源

让多模态大模型精准定位遥感图像中的每个目标像素

GeoPixel 是一个面向高分辨率遥感影像分析的像素级定位多模态大模型。它解决的是遥感图像中多目标精···

★ 155 评分 2025-01-23
PaddleOCRApi 开源

一键部署离线OCR接口,多语言调用识别图片文字

PaddleOCRApi 是一个基于 PaddleOCR 的开源离线 OCR 服务封装项目,用 C# 编写,主要解决在 .NET 生···

★ 117 评分 2025-01-22
D-FINE-seg 开源

检测加分割一网打尽,训练到 TensorRT 部署全流程

D-FINE-seg 是基于 D-FINE 检测器扩展而来的目标检测与实例分割一体化框架,覆盖训练、导出、推理全···

★ 211 评分 2025-01-21
UniAct 开源

统一机器人动作表示,让具身模型跨场景即学即用

UniAct是CVPR 2025收录的官方实现,提出“通用动作”概念,旨在增强具身基础模型(如机器人操作模型···

★ 245 评分 2025-01-14
Awesome-MLLM-Segmentation 开源

一页看懂 MLLM 做图像视频分割的全部代表论文

Awesome-MLLM-Segmentation 是一个聚焦多模态大语言模型(MLLM)用于图像与视频分割的论文资源合集···

★ 236 评分 2025-01-09
depth_any_camera 开源

任意相机秒出深度图,零样本适配鱼眼全景

Depth Any Camera 是一个 CVPR 2025 的零样本度量深度估计模型,核心解决任意相机(包括鱼眼、全景···

★ 359 评分 2025-01-07
Sa2VA 开源

一句话指挥AI分割图像视频,精准定位目标

Sa2VA 是一个面向图像与视频分割任务的统一视觉语言模型代码库,由 Pixel-LLM 团队维护。它解决了传···

★ 1680 评分 2025-01-06
clearcam 开源

给普通摄像头装上 AI 大脑,自动识别、追踪并推送通知

ClearCam 是一个开源的智能安防摄像头增强工具,通过 AI 技术为普通 RTSP 摄像头添加物体检测、追踪···

★ 1629 评分 2025-01-04
diffusion-vas 开源

用扩散先验,让视频分割看穿遮挡,补全完整物体。

diffusion-vas 是 CVPR 2025 的官方代码实现,专注于视频无模态分割(Video Amodal Segmentation)···

★ 127 评分 2024-12-07
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

Olympus 是一个面向计算机视觉任务的通用任务路由器,由 CVPR 2025 Highlight 论文官方开源。它旨在···

★ 427 评分 2024-12-04
eomt 开源

仅编码器搞定图像分割,又快又准

EoMT(Encoder-only Mask Transformer)是一个CVPR 2025 Highlight项目,提供仅编码器的掩码Transf···

★ 626 评分 2024-12-02
blue-onyx 开源

把目标检测封装成服务,发图就返回检测框

blue-onyx 是一个用 Rust 编写的目标检测服务,将计算机视觉中的物体检测能力封装成可独立部署的后···

★ 150 评分 2024-11-27
EventGPT 开源

让大模型看懂事件相机数据,实现动态场景理解与问答

EventGPT 是一个面向事件流(event stream)理解的多模态大语言模型框架,源自 CVPR 2025 论文。它···

★ 115 评分 2024-11-25
GaussianPretrain 开源

用3D高斯做自监督预训练,让自动驾驶感知模型少标注也能涨点

GaussianPretrain 是面向自动驾驶视觉预训练的开源项目,核心思路是用 3D 高斯表示作为预训练目标,···

★ 113 评分 2024-11-20
vesselFM 开源

一个模型搞定各类三维血管分割,跨模态直接上手

vesselFM 是一个面向通用三维血管分割的基础模型,论文已被 CVPR 2025 接收。它旨在解决医学图像中···

★ 171 评分 2024-11-15
uniface 开源

一套 API 搞定检测到反欺诈全流程人脸分析

UniFace 是一个面向 Python 的统一人脸分析库,把检测、对齐、关键点、face-mesh、识别、解析、视线···

★ 1900 评分 2024-11-14
ZoomEye 开源

像人一样缩放看图,让多模态模型看清细节

ZoomEye 是一个增强多模态大语言模型(MLLMs)的视觉探索能力的开源项目,核心思路是模仿人类“缩放···

★ 95 评分 2024-10-31