VLM-R1 是模型训练领域的开源项目,由 om-ai-lab 开发,2025 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(6,028)位列前 8%,在模型训练分类的 522 个项目里位列前 8%。
项目仍在小幅维护中,最近一次代码更新于 2026-09-21。Apache-2.0许可,可自由使用和部署,无收费计划。
它主要面向的使用场景是:目标检测与定位任务的模型微调。同类可对比的替代方案包括 LLaVA、Qwen2-VL、DeepSeek-R1。

用强化学习让视觉模型学会推理,少数据也能提升定位精度。
VLM-R1 是一个将强化学习(RL)应用于视觉语言模型(VLM)的开源项目,旨在提升模型在视觉理解任务中的推理能力。它基于 DeepSeek-R1 的 RL 训练范式,通过可验证的奖励(如目标检测的 IoU 和 Grounding 任务的准确率)来优化模型,而非依赖传统的 SFT 或人工反馈。项目解决了纯监督微调在视觉推理中泛化不足的问题,核心能力包括:支持多种 VLM 架构(如 Qwen2-VL)、提供完整的 RL 训练流程(数据、奖励函数、训练脚本)、以及针对目标定位(Grounding)等任务的显著性能提升。该项目为社区提供了将 RL 引入多模态推理的参考实现,并展示了在少量训练步数下即可超越 SFT 基线的效果。
1创建 conda 环境
用 Python 3.10 新建名为 vlm-r1 的独立环境,避免与系统 Python 冲突。
conda create -n vlm-r1 python=3.102激活环境
进入刚创建的环境后,后续所有安装与训练命令都在该环境中执行。
conda activate vlm-r13执行安装脚本
在项目根目录运行 setup.sh 完成依赖安装;需先克隆仓库并 cd 进入项目目录。
bash setup.sh4准备训练数据
按 README 使用 jsonl 格式数据文件,并准备对应图片文件夹;多个路径用冒号分隔。
5启动 GRPO 训练
参照 run_grpo_rec.sh 示例,用 torchrun 启动 grpo_jsonl.py;把模型、数据、图片路径替换成自己的实际值。
torchrun --nproc_per_node="8"
--nnodes="1"
--node_rank="0"
--master_addr="127.0.0.1"
--master_port="12345"
src/open_r1/grpo_jsonl.py
--output_dir output/$RUN_NAME
--model_name_or_path Qwen/Qwen2.5-VL-3B-Instruct
--deepspeed ${REPO_HOME}/src/open-r1-multimodal/local_scripts/zero3.json
--data_file_paths /path/to/your/data.jsonl
--image_folders /path/to/your/image/folder| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
model_name_or_path | 是 | 指定要训练的基础 VLM 模型 | Qwen/Qwen2.5-VL-3B-Instruct |
data_file_paths | 是 | 训练数据 jsonl 路径,多个用冒号分隔 | /path/to/your/data.jsonl |
image_folders | 是 | 图片所在目录,多个用冒号分隔 | /path/to/your/image/folder |
output_dir | 是 | 训练输出目录 | output/$RUN_NAME |
deepspeed | 是 | DeepSpeed 配置文件路径 | ${REPO_HOME}/src/open-r1-multimodal/local_scripts/zero3.json |
master_port | 否 | 分布式训练通信端口 | 12345 |
setup.sh 执行无报错;torchrun 启动后终端持续输出训练日志,且 output/$RUN_NAME 目录生成结果文件。
Q:没有多卡 GPU 能跑吗?
A:README 示例使用 8 卡(nproc_per_node=8),单卡需自行调整并行参数,官方未给出单卡示例。
Q:数据路径怎么写多个?
A:README 注明 data_file_paths 与 image_folders 均可传多个,用冒号 ":" 分隔。
Q:训练脚本入口在哪?
A:入口为 src/open_r1/grpo_jsonl.py,仓库中 run_grpo_rec.sh 是可直接参考的完整示例。
Q:不想自己训练怎么办?
A:可直接使用官方在 Hugging Face 与 ModelScope 上发布的 Checkpoints 与在线 Demo。
LLaVA、Qwen2-VL、DeepSeek-R1
VLM-R1 是模型训练领域的开源项目,由 om-ai-lab 开发,2025 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(6,028)位列前 8%,在模型训练分类的 522 个项目里位列前 8%。
项目仍在小幅维护中,最近一次代码更新于 2026-09-21。Apache-2.0许可,可自由使用和部署,无收费计划。
它主要面向的使用场景是:目标检测与定位任务的模型微调。同类可对比的替代方案包括 LLaVA、Qwen2-VL、DeepSeek-R1。
上一篇:whichllm
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···