FluidNexus
开源
单视频重建3D流体,预测未来流动
FluidNexus 是一个基于物理信息神经网络的开源项目,旨在从单段视频中重建三维流体动态并预测其未来···
汇聚全球AI计算机视觉项目,OCR识别、目标检测、图像分割、人脸识别工具大全。
共收录 447 个开源项目
FluidNexus
开源
单视频重建3D流体,预测未来流动
FluidNexus 是一个基于物理信息神经网络的开源项目,旨在从单段视频中重建三维流体动态并预测其未来···
UniGoal
开源
让机器人零训练看懂世界,直接找目标
UniGoal 是一个面向通用零样本目标导向导航的框架,发表于 CVPR 2025。它解决的是智能体在未知环境···
snow-apps
开源
一站式搞定截图、录屏和OCR,替代系统自带工具
Snow Apps 是一个开源的桌面工具集合,主要包含两款应用:Snow Shot 和 Snow Image Viewer。Snow S···
SmartJavaAI
开源
Java 开发者福音:一行依赖,离线搞定人脸、OCR、语音等 AI 功能
SmartJavaAI 是一个基于 Java 的免费离线 AI 算法工具箱,旨在为 Java 开发者提供开箱即用的 AI 能···
EarthDial
开源
把卫星影像变成能聊天的地球百科,问一句就能读懂地表变化。
EarthDial 是一个面向地球观测的多模态对话模型,由 CVPR 2025 论文提出。它旨在将卫星、航空等多传···
Awesome-CV-MasterHub
开源
按图索骥,一篇列表搞定 CV 前沿论文追踪
Awesome-CV-MasterHub 是一个计算机视觉领域的论文精选列表,汇总了图像生成、分类、描述、去雾、去···
pdf-craft
开源
把扫描版PDF变成可编辑文本,读书笔记一键搞定
pdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR ···
让多模态大模型精准定位遥感图像中的每个目标像素
GeoPixel 是一个面向高分辨率遥感影像分析的像素级定位多模态大模型。它解决的是遥感图像中多目标精···
PaddleOCRApi
开源
一键部署离线OCR接口,多语言调用识别图片文字
PaddleOCRApi 是一个基于 PaddleOCR 的开源离线 OCR 服务封装项目,用 C# 编写,主要解决在 .NET 生···
D-FINE-seg
开源
检测加分割一网打尽,训练到 TensorRT 部署全流程
D-FINE-seg 是基于 D-FINE 检测器扩展而来的目标检测与实例分割一体化框架,覆盖训练、导出、推理全···
UniAct
开源
统一机器人动作表示,让具身模型跨场景即学即用
UniAct是CVPR 2025收录的官方实现,提出“通用动作”概念,旨在增强具身基础模型(如机器人操作模型···
Awesome-MLLM-Segmentation
开源
一页看懂 MLLM 做图像视频分割的全部代表论文
Awesome-MLLM-Segmentation 是一个聚焦多模态大语言模型(MLLM)用于图像与视频分割的论文资源合集···
depth_any_camera
开源
任意相机秒出深度图,零样本适配鱼眼全景
Depth Any Camera 是一个 CVPR 2025 的零样本度量深度估计模型,核心解决任意相机(包括鱼眼、全景···
Sa2VA
开源
一句话指挥AI分割图像视频,精准定位目标
Sa2VA 是一个面向图像与视频分割任务的统一视觉语言模型代码库,由 Pixel-LLM 团队维护。它解决了传···
clearcam
开源
给普通摄像头装上 AI 大脑,自动识别、追踪并推送通知
ClearCam 是一个开源的智能安防摄像头增强工具,通过 AI 技术为普通 RTSP 摄像头添加物体检测、追踪···
diffusion-vas
开源
用扩散先验,让视频分割看穿遮挡,补全完整物体。
diffusion-vas 是 CVPR 2025 的官方代码实现,专注于视频无模态分割(Video Amodal Segmentation)···
Olympus
开源
一个路由搞定所有视觉任务,免去逐个微调
Olympus 是一个面向计算机视觉任务的通用任务路由器,由 CVPR 2025 Highlight 论文官方开源。它旨在···
eomt
开源
仅编码器搞定图像分割,又快又准
EoMT(Encoder-only Mask Transformer)是一个CVPR 2025 Highlight项目,提供仅编码器的掩码Transf···
blue-onyx
开源
把目标检测封装成服务,发图就返回检测框
blue-onyx 是一个用 Rust 编写的目标检测服务,将计算机视觉中的物体检测能力封装成可独立部署的后···
EventGPT
开源
让大模型看懂事件相机数据,实现动态场景理解与问答
EventGPT 是一个面向事件流(event stream)理解的多模态大语言模型框架,源自 CVPR 2025 论文。它···
GaussianPretrain
开源
用3D高斯做自监督预训练,让自动驾驶感知模型少标注也能涨点
GaussianPretrain 是面向自动驾驶视觉预训练的开源项目,核心思路是用 3D 高斯表示作为预训练目标,···
vesselFM
开源
一个模型搞定各类三维血管分割,跨模态直接上手
vesselFM 是一个面向通用三维血管分割的基础模型,论文已被 CVPR 2025 接收。它旨在解决医学图像中···
uniface
开源
一套 API 搞定检测到反欺诈全流程人脸分析
UniFace 是一个面向 Python 的统一人脸分析库,把检测、对齐、关键点、face-mesh、识别、解析、视线···
ZoomEye
开源
像人一样缩放看图,让多模态模型看清细节
ZoomEye 是一个增强多模态大语言模型(MLLMs)的视觉探索能力的开源项目,核心思路是模仿人类“缩放···