EasyR1

多模态强化学习训练,高效扩展不卡壳

EasyR1 是一个基于 veRL 的高效、可扩展的多模态强化学习训练框架,专注于解决视觉-语言模型(VLM)在强化学习训练中的效率与扩展性问题。它支持大规模并行训练,集成多种多模态数据加载与处理能力,提供灵活的奖励函数接口和训练策略配置,帮助研究者和工程师快速实现从单模态到多模态的 RL 训练流程。框架针对 veRL 进行了深度优化,降低了多模态 RL 的工程门槛,适用于视觉问答、具身智能、多模态决策等场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5171
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队hiyouga
所属国家
官网地址
定价模式free
价格说明开源框架,基于Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型ai,deepseek,gpt,llm,nlp,qwen,reinforcement-learning,rl
GitHub 星标★ 5171
30天Star增速
HF 下载量
上线时间2025-02-22 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3 与 pip 环境(用于 pip install -e .)
  • Git(用于克隆 EasyR1 仓库)
  • 多机训练场景需安装 Ray,并保证节点间网络互通
  • 运行 Qwen2.5-VL 7B GRPO 训练脚本需具备相应算力/显存,70B+ 模型需多节点

安装与启动步骤

  1. 1克隆并进入项目

    从 GitHub 克隆 EasyR1 仓库并进入项目根目录,后续安装与运行都在此目录进行。

    git clone https://github.com/hiyouga/EasyR1.git
    cd EasyR1
  2. 2可编辑模式安装

    在项目根目录以可编辑模式安装依赖;README 未列出额外依赖,如需多模态训练请自行补齐环境。

    pip install -e .
  3. 3启动 Ray head 节点

    多机训练时在 head 机器上执行,指定 6379 端口并把 Dashboard 暴露到 0.0.0.0。

    ray start --head --port=6379 --dashboard-host=0.0.0.0
  4. 4启动 Ray worker 节点

    在 worker 机器执行,把 换成 head 节点真实 IP,端口保持与 head 一致。

    ray start --address=:6379
  5. 5检查 Ray 资源池

    确认各节点 GPU/CPU 资源已加入集群,再进行训练,避免资源识别不全导致失败。

    ray status
  6. 6运行 GRPO 训练脚本

    仅在 Ray head 节点执行该示例脚本,运行 Qwen2.5-VL 在 Geometry3K 上的 GRPO 训练。

    bash examples/qwen2_5_vl_7b_geo3k_grpo.sh

关键配置

配置项必填说明示例
--portRay head 节点监听端口6379
--dashboard-hostRay Dashboard 监听地址,0.0.0.0 表示对外可访问0.0.0.0
--addressworker 节点连接 head 节点的地址与端口192.168.1.10:6379

如何确认成功

执行 ray status 可看到 Ray 集群资源池;训练脚本能正常输出日志即为启动成功。

常见问题

Q:多机训练时 worker 连不上 head 怎么办?

A:把命令中的 替换为 head 节点真实可互通 IP,端口与 head 启动时一致(默认 6379),并检查防火墙与网络。

Q:训练脚本应该在哪些节点运行?

A:README 明确说明训练脚本只在 Ray head 节点上运行,worker 节点只负责提供算力资源。

Q:多机训练和 Ray 调试还有更多资料吗?

A:README 指引参见 veRL 官方文档中的多节点训练章节,链接为 https://verl.readthedocs.io/en/latest/start/multinode.html 。

Q:安装步骤报错怎么办?

A:README 仅给出 git clone、cd、pip install -e . 三步,未提供其它依赖安装说明,请先确认 Python/pip 可用及网络能访问 PyPI 与 GitHub。

注意事项

  • EasyR1 是 veRL 的干净分支,专门支持视觉语言模型(VLM)的强化学习训练。
  • 支持模型包括 Llama3/Qwen2/Qwen2.5/Qwen3 与 Qwen2-VL/Qwen2.5-VL/Qwen3-VL、DeepSeek-R1 distill 等。
  • 支持 GRPO、DAPO、Reinforce++、ReMax、RLOO、GSPO、CISPO 等算法。
  • README 未给出示例脚本内的超参数说明,具体配置请查看仓库 examples 目录下的脚本文件。

核心亮点

  • 基于 veRL 深度优化,训练吞吐和扩展性优于通用框架
  • 原生支持多模态数据流,简化 VLM 与 RL 的集成
  • 提供模块化奖励与策略接口,快速定制训练目标

不足之处

  • 依赖 veRL 生态,迁移到其他 RL 后端需额外适配
  • 文档/社区待观察

适用场景

  • 视觉语言模型的 RLHF 或 RLAIF 训练
  • 多模态智能体(如具身决策)的强化学习
  • 大规模并行 RL 训练实验与研究

替代项目

OpenRLHF、TRL、verl

项目介绍

EasyR1 是模型训练领域的开源项目,由 hiyouga 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(5,171)位列前 9%,在模型训练分类的 518 个项目里位列前 11%。

近 41 天,它的 GitHub 星标从 5,110 增加到 5,171,净增 61。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。基于Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:视觉语言模型的RLHF或RLAIF训练。同类可对比的替代方案包括 OpenRLHF、TRL、verl。

上一篇:xtuner

下一篇:reasoning-from-scratch

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13