Agent-R1

端到端强化学习,训练出能自主决策的 LLM Agent

Agent-R1 是一个专注于通过端到端强化学习训练强大 LLM Agent 的开源项目。它解决的核心问题是:传统 Agent 依赖提示工程或微调,难以在复杂环境中自主决策和适应。Agent-R1 将强化学习直接应用于 Agent 的完整行为序列,使模型从环境反馈中学习工具调用、规划和纠错策略。其核心能力包括:支持多种环境(如网页导航、代码执行)、提供可复现的训练流程、以及高效的采样和奖励设计机制。项目基于 Python,代码结构清晰,适合研究者快速上手。通过端到端训练,Agent-R1 显著提升了模型在未见任务上的泛化能力,为构建通用智能体提供了新范式。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1676
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队AgentR1
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,可免费使用和部署。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型agent,agentic-rl,llm
GitHub 星标★ 1676
30天Star增速
HF 下载量
上线时间2025-03-04 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 60 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(项目为 Python 项目)
  • 环境配置与 verl 一致,当前版本要求 verl==0.7.0
  • 已安装 git;使用 git lfs 方式时需 git-lfs
  • 下载数据需联网访问 ModelScope,或安装 modelscope 包
  • 训练需按 verl 官方文档准备对应运行环境(README 未列出具体依赖命令)

安装与启动步骤

  1. 1克隆仓库

    README 说明只需克隆本仓库,没有单独的 Agent-R1 安装步骤,克隆后即为项目根目录。

    git clone https://github.com/AgentR1/Agent-R1.git
  2. 2配置 verl 环境

    按 verl 官方安装文档完成环境配置,当前版本要求 verl==0.7.0;也可先看 Getting Started 页面。

  3. 3下载训练数据

    用 ModelScope CLI 下载官方处理好的数据,落到 data/agent-r1-data 目录,供各任务脚本读取。

    pip install modelscope
    modelscope download --dataset Melmaphother/Agent-R1-data --local_dir data/agent-r1-data
  4. 4或用 git 下载数据

    不想用 ModelScope CLI 时,可用 git lfs 直接克隆数据集到同一本地目录。

    git lfs install
    git clone https://www.modelscope.cn/datasets/Melmaphother/Agent-R1-data.git data/agent-r1-data
  5. 5放置数据路径

    按各 recipe 期望的路径放置数据文件,也可用软链接(symlink)指向上一步下载的目录。

  6. 6运行自检脚本

    用 GSM8K 的 steppo 脚本做环境连通性自检,确认数据与依赖都接好后,再进入 Agent 任务教程。

    bash examples/gsm8k/run_steppo.sh

如何确认成功

成功执行 examples/gsm8k/run_steppo.sh 且无环境或数据路径报错,即说明环境配置正确。

常见问题

Q:需要单独安装 Agent-R1 吗?

A:不需要。README 明确说明只要克隆本仓库即可,没有独立的 Agent-R1 安装步骤。

Q:数据下载用哪种方式?

A:两种皆可:ModelScope CLI(modelscope download)或 git lfs 克隆 ModelScope 数据集仓库,目标目录都建议为 data/agent-r1-data。

Q:环境依赖从哪看?

A:Agent-R1 与 verl 使用同一套环境配置,当前版本要求 verl==0.7.0,请参考 verl 官方安装文档。

Q:从哪里开始上手?

A:先读官方 Getting Started 页面,再跑 GSM8K 自检脚本,随后看 Agent Task Tutorial 的 GSM8K + Tool 最小示例。

注意事项

  • 当前版本依赖 verl==0.7.0,README 未给出 Agent-R1 自身的安装命令,请以 verl 官方文档为准。
  • 下载的数据需按各任务 recipe 期望的路径放置或建立软链接,不能只下载不放置。
  • 更多说明见官方文档站点 https://agentr1.github.io/Agent-R1/docs/ 与论文 https://arxiv.org/abs/2511.14460。

核心亮点

  • 端到端 RL 直接优化 Agent 行为序列,而非仅优化单步动作,策略更全局
  • 提供完整训练代码和配置,可复现性强,降低研究门槛
  • 支持多种环境适配,便于在网页导航、代码生成等场景迁移

不足之处

  • 训练资源消耗大,需要大量 GPU 和采样数据,小团队难以复现
  • 文档和社区生态尚在早期,除论文外教程和案例较少

适用场景

  • 学术研究:探索 RL 在 Agent 训练中的新方法
  • 复杂任务自动化:需要多步决策的网页操作或代码修复
  • 智能体产品开发:为对话系统或 RPA 工具注入自主规划能力

替代项目

Voyager、AgentBench、SWE-agent

项目介绍

Agent-R1 是模型训练领域的开源项目,由 AgentR1 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,676)位列前 30%,在模型训练分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,607 增加到 1,676,净增 69。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。MIT许可证,可免费使用和部署。

它主要面向的使用场景是:学术研究:探索RL在Agent训练中的新方法。同类可对比的替代方案包括 Voyager、AgentBench、SWE-agent。

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13