
VLM-AutoYOLO
VLM 自动画框,一键训出 YOLO 检测模型
VLM-AutoYOLO 是一个面向目标检测的端到端自动标注与 YOLO 训练平台。它想解决的问题是:做目标检测时,人工画框标注图片和视频极其耗时,且标注完还要单独写脚本训练模型,流程割裂。项目用视觉语言模型 NVIDIA LocateAnything-3B 自动生成候选框,支持人工微调修正,然后一键启动 YOLO 训练,还提供视频关键帧抽取和模型验证功能,图片和视频都能处理。核心能力包括:VLM 驱动的自动标注、标注结果人工精修、一键式 YOLO 训练流水线、视频关键帧提取、训练后模型验证。整体用 Python 编写,后端基于 FastAPI,把标注、训练、验证串成一条流水线,适合想快速搭建自有检测数据集并训练模型的开发者,能显著减少从原始素材到可用模型之间的手工操作。
开源
free
计算机视觉
GitHub 星标
★ 241
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队Somnusochi
所属国家
定价模式free
价格说明开源项目,免费使用,需自行部署
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型auto-labeling,computer-vision,data-annotation,deep-learning,fastapi,locate-anything,machine-learning,nvidia,object-detection,pytorch,react,ultralytics,video-annotation,vlm,yolo,yolo-training
GitHub 星标★ 241
30天Star增速
HF 下载量
上线时间2026-06-02 00:00:00
最近更新2026-09-19 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-20
浏览次数0
使用教程
核心亮点
- 用 NVIDIA LocateAnything-3B 做自动标注,减少人工画框工作量
- 标注、训练、验证串成一条流水线,不用在多个工具间来回切换
- 同时支持图片和视频,视频可抽关键帧再标注
不足之处
- 依赖 NVIDIA LocateAnything-3B,对显存和运行环境有要求
- 星标 241,属早期项目,文档和社区生态还在积累
适用场景
- 为自有业务快速构建目标检测数据集并训练模型
- 把已有视频素材抽帧后自动标注、训练检测模型
- 教学或原型验证中演示从标注到 YOLO 训练的完整流程
替代项目
Label Studio、autodistill、Ultralytics YOLO
项目介绍
上一篇:GaussianPretrain
下一篇:没有了!
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3