
locate-anything
一句话框出图中任意物体,本地GPU一键跑
locate-anything 是一个为 NVIDIA LocateAnything-3B 模型打造的轻量级 Web 界面,通过一条 docker compose up 命令即可在本地 GPU 上启动开放词汇目标检测与视觉定位服务。它解决的核心问题是:开发者想用大模型做目标检测时,往往要自己写推理脚本、搭后端、调前端,门槛高且不便于演示。该项目把 FastAPI 后端、CUDA 推理和移动端友好的前端打包成 Docker 服务,用户只需输入文本描述(如“穿红衣服的人”),就能在图片中框出对应目标,无需训练专用检测器。技术上基于 TypeScript 前端与 Python 推理服务,依赖 NVIDIA GPU 和 CUDA,支持开放词汇,意味着可以检测训练集中未出现的类别。适合快速验证、原型演示和本地私有化部署。
开源
free
计算机视觉
GitHub 星标
★ 157
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队gammahazard
所属国家
定价模式free
价格说明开源免费,需自备GPU部署
访问状态
是否开源是
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型bounding-boxes,computer-vision,cuda,docker,fastapi,gpu,grounding,locate-anything,machine-learning,nvidia,object-detection,ocr,open-vocabulary-detection,react,self-hosted,tailwindcss,typescript,vision-language-model,web-ui
GitHub 星标★ 157
30天Star增速
HF 下载量
上线时间2026-05-27 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-20
浏览次数0
使用教程
核心亮点
- 一条 docker compose up 即可启动完整服务,部署门槛极低
- 前端移动端适配,手机浏览器也能流畅标注和查看检测框
- 开放词汇检测,无需重新训练即可识别自定义文本描述的目标
不足之处
- 强依赖 NVIDIA GPU 与 CUDA 环境,无 GPU 或非 N 卡用户无法使用
- 项目处于早期,文档和社区生态尚不完善,遇到问题可参考的资料有限
适用场景
- 电商或内容平台快速标注图片中的商品、人物、场景元素
- 安防或工业质检场景中,用自然语言描述定位异常目标
- 个人开发者本地搭建视觉 demo,向非技术用户展示开放词汇检测能力
替代项目
GroundingDINO、OWL-ViT、YOLO-World
项目介绍
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3