locate-anything

一句话框出图中任意物体,本地GPU一键跑

locate-anything 是一个为 NVIDIA LocateAnything-3B 模型打造的轻量级 Web 界面,通过一条 docker compose up 命令即可在本地 GPU 上启动开放词汇目标检测与视觉定位服务。它解决的核心问题是:开发者想用大模型做目标检测时,往往要自己写推理脚本、搭后端、调前端,门槛高且不便于演示。该项目把 FastAPI 后端、CUDA 推理和移动端友好的前端打包成 Docker 服务,用户只需输入文本描述(如“穿红衣服的人”),就能在图片中框出对应目标,无需训练专用检测器。技术上基于 TypeScript 前端与 Python 推理服务,依赖 NVIDIA GPU 和 CUDA,支持开放词汇,意味着可以检测训练集中未出现的类别。适合快速验证、原型演示和本地私有化部署。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 157
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队gammahazard
所属国家
官网地址
定价模式free
价格说明开源免费,需自备GPU部署
访问状态
是否开源
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型bounding-boxes,computer-vision,cuda,docker,fastapi,gpu,grounding,locate-anything,machine-learning,nvidia,object-detection,ocr,open-vocabulary-detection,react,self-hosted,tailwindcss,typescript,vision-language-model,web-ui
GitHub 星标★ 157
30天Star增速
HF 下载量
上线时间2026-05-27 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-20
浏览次数0

使用教程

核心亮点

  • 一条 docker compose up 即可启动完整服务,部署门槛极低
  • 前端移动端适配,手机浏览器也能流畅标注和查看检测框
  • 开放词汇检测,无需重新训练即可识别自定义文本描述的目标

不足之处

  • 强依赖 NVIDIA GPU 与 CUDA 环境,无 GPU 或非 N 卡用户无法使用
  • 项目处于早期,文档和社区生态尚不完善,遇到问题可参考的资料有限

适用场景

  • 电商或内容平台快速标注图片中的商品、人物、场景元素
  • 安防或工业质检场景中,用自然语言描述定位异常目标
  • 个人开发者本地搭建视觉 demo,向非技术用户展示开放词汇检测能力

替代项目

GroundingDINO、OWL-ViT、YOLO-World

项目介绍

locate-anything 是一个计算机视觉领域的开源项目,官方简介:Sleek, mobile-friendly web UI for NVIDIA LocateAnything-3B — open-vocabulary object detection & grounding on your own GPU, via one docker compose up.。项目使用 TypeScript 开发,在 GitHub 上获得 157 星标。

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14