DEIMv2

用DINOv3做实时检测,又快又准,直接落地。

DEIMv2 是一个基于 DINOv3 的实时目标检测框架,旨在解决传统检测器在速度和精度之间难以平衡的问题。它利用 DETR 风格的 Transformer 架构,结合 DINOv3 强大的视觉特征提取能力,实现了高精度的实时检测。核心能力包括:高效的端到端检测流程(无需手工设计的后处理)、对多尺度目标的鲁棒检测、以及灵活的模型配置以适应不同算力场景。项目提供了完整的训练和推理代码,支持主流数据集,并针对部署进行了优化。通过引入先进的注意力机制和训练策略,DEIMv2 在保持实时速度的同时,显著提升了检测准确率,尤其适合需要快速响应的应用场景。

开源 unknown 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2046
维护状态 维护中
是否开源 是
定价模式 unknown

项目数据

分类计算机视觉
开发团队Intellindust-AI-Lab
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议NOASSERTION
主要语言Jupyter Notebook
技术栈/模型detection-transformer,dinov3,object-detection,real-time,real-time-detection
GitHub 星标★ 2046
30天Star增速
HF 下载量
上线时间2025-09-19 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-14
浏览次数12

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 7 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 支持 CUDA 的 NVIDIA GPU(README 示例使用 0,1,2,3 四张卡)
  • 已安装 PyTorch、可用 torchrun 的 Python 环境(README 未给出安装命令,需自行准备)
  • COCO2017 数据集(示例配置均为 coco 版本)
  • 本仓库完整代码,包含 configs/deimv2 目录

安装与启动步骤

  1. 1克隆项目代码

    从 GitHub 克隆 DEIMv2 源码并进入项目目录,后续所有命令都需在此目录下执行。

    git clone https://github.com/Intellindust-AI-Lab/DEIMv2.git
    cd DEIMv2
  2. 2准备运行环境

    README 的 2.1 Environment Setup 章节内容为空,没有给出任何安装命令,需自行按 PyTorch 与 torchrun 的要求准备环境。

  3. 3选择模型配置文件

    ViT 版本用 deimv2_dinov3_${model}_coco.yml,HGNetv2 版本用 deimv2_hgnetv2_${model}_coco.yml,把 ${model} 替换成实际尺寸(如 s)。

  4. 4启动模型训练

    用 torchrun 多卡训练,--nproc_per_node=4 表示 4 卡,--use-amp 开启混合精度,--seed=0 固定随机种子。

    CUDA_VISIBLE_DEVICES=0,1,2,3 torchrun --master_port=7777 --nproc_per_node=4 train.py -c configs/deimv2/deimv2_dinov3_s_coco.yml --use-amp --seed=0
  5. 5测试评估模型

    加 --test-only 只做评估,用 -r 指定要加载的权重文件 model.pth,换成你自己的权重路径。

    CUDA_VISIBLE_DEVICES=0,1,2,3 torchrun --master_port=7777 --nproc_per_node=4 train.py -c configs/deimv2/deimv2_dinov3_s_coco.yml --test-only -r model.pth
  6. 6微调已有权重

    用 -t 指定待微调的权重文件,其余参数与训练一致,适合在已有模型基础上继续训练。

    CUDA_VISIBLE_DEVICES=0,1,2,3 torchrun --master_port=7777 --nproc_per_node=4 train.py -c configs/deimv2/deimv2_dinov3_s_coco.yml --use-amp --seed=0 -t model.pth
  7. 7按需调整超参数

    改 batch size 需同步按线性缩放调整学习率、EMA decay 与 warmup;改输入尺寸要同步改 eval_spatial_size 和 Resize。

关键配置

配置项必填说明示例
train_dataloader.total_batch_size否训练总批大小,3.2 节示例从 32 改为 6464
optimizer.lr否主干学习率,批大小翻倍时按线性缩放律加倍0.0005
ema.decay否EMA 衰减率,批大小翻倍时按 1-(1-decay)*2 调整0.9998
lr_warmup_scheduler.warmup_duration否学习率预热步数,批大小翻倍时减半250
eval_spatial_size否评估输入尺寸,3.3 节示例改为 320x320[320, 320]
epoches否总训练轮数,3.4 节示例 20 轮训练加 EMA 共 3232

如何确认成功

命令无报错并持续输出训练日志;用 --test-only 跑完后能打印 COCO 上的精度结果。

常见问题

Q:README 里没有安装依赖的命令怎么办?

A:2.1 Environment Setup 章节是空的,官方未给安装命令。只能自行准备 PyTorch 环境和 COCO 数据集,再直接运行 train.py;不要照抄来路不明的安装命令。

Q:只有一张显卡能跑吗?

A:README 示例全部是 4 卡(--nproc_per_node=4)且 CUDA_VISIBLE_DEVICES=0,1,2,3。单卡需自行把这两处改成 1 和 0,但官方未给出单卡配置说明。

Q:配置文件里的 ${model} 填什么?

A:替换为模型尺寸代号,README 提到有 ultra-light、S、M、L、X 等多种尺寸,需与 configs/deimv2 目录下实际存在的文件名一致。

Q:改了 batch size 之后训练不稳定?

A:3.2 节强调批大小翻倍时学习率要按线性缩放律加倍,同时 EMA decay 和 warmup 步数也要同步调整,否则收敛会变差。

Q:改 epoch 时还要改哪些参数?

A:3.4 节要求 policy.epoch、mixup_epochs、stop_epoch、copyblend_epochs 与 epoches、flat_epoch、no_aug_epoch 保持一致,matcher_change_epoch 约取无增强阶段的 90%。

注意事项

  • README 未提供任何依赖安装命令,环境与数据集需自行准备,本教程相应步骤已留空。
  • 所有训练/测试命令都基于 torchrun,主端口固定为 7777,多任务并行时注意端口冲突。
  • 训练/评估都要先把 ${model} 替换成真实的模型尺寸,否则找不到配置文件。
  • weight_decay、betas、matcher 等参数调优请直接对照仓库 configs/deimv2 下的真实 yml 文件。

核心亮点

  • 基于DINOv3,特征提取能力强,检测精度高
  • 端到端Transformer架构,无需NMS后处理,流程简洁
  • 实时性优化,适合边缘设备部署

不足之处

  • 依赖DINOv3预训练模型,模型体积可能较大
  • 文档/社区待观察

适用场景

  • 自动驾驶中的实时障碍物检测
  • 工业质检中的缺陷定位
  • 视频监控中的目标跟踪与识别

替代项目

YOLOv8、RT-DETR、DETR

项目介绍

DEIMv2 是计算机视觉领域的开源项目,由 Intellindust-AI-Lab 开发,2025 年首次发布。

在全站 13,199 个收录项目中,它的 GitHub 星标数(2,046)位列前 30%,在计算机视觉分类中处于中上游。

近 44 天,它的 GitHub 星标从 1,980 增加到 2,046,净增 66。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:自动驾驶中的实时障碍物检测。同类可对比的替代方案包括 YOLOv8、RT-DETR、DETR。

上一篇:pdf-craft

下一篇:modlens

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4045 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90972 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1431 2026-08-20
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···

★ 427 2026-08-09