ART

让AI智能体在实际任务中边干边学,用GRPO强化训练,快速提升多步决策能力。

ART(Agent Reinforcement Trainer)是一个面向真实世界多步骤任务的开源强化学习训练框架,专注于使用GRPO算法对智能体进行在线训练。它解决了传统强化学习在复杂、动态、真实场景中难以应用的问题,让开发者能够直接对Qwen3.6、GPT-OSS、Llama等主流大模型进行强化学习微调,支持LoRA等高效参数更新方式。ART的核心能力包括:提供简洁的API接口,支持自定义奖励函数与任务环境;内置GRPO实现,优化多步骤决策的样本效率与稳定性;与Hugging Face生态无缝集成,支持分布式训练与模型部署。通过ART,开发者可以像训练人类员工一样,让AI智能体在实际任务中不断试错、学习并优化策略,从而显著提升其在客服、编程、自动化操作等场景下的表现。该项目在GitHub上已获得超过1万星标,是当前大模型强化学习领域的热门工具。

开源 unknown 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10766
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类模型训练
开发团队OpenPipe
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agent,agentic-ai,grpo,llms,lora,qwen,qwen3,reinforcement-learning,rl
GitHub 星标★ 10766
30天Star增速
HF 下载量
上线时间2025-03-10 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 3 步

环境要求

  • 客户端机器需可运行 Python(README 说明 ART 可从任何运行 Python 的客户端机器训练)
  • 已安装 pip,用于安装 openpipe-art 包
  • 使用 W&B Training(Serverless RL)时需准备 W&B API key

安装与启动步骤

  1. 1确认 Python 环境

    README 说明可在任意运行 Python 的客户端机器上训练智能体,先确认本机 Python 可用。

    python --version
  2. 2安装 ART 包

    README 给出的安装方式:在已有项目中执行 pip 安装 openpipe-art。

    pip install openpipe-art
  3. 3验证安装结果

    查看包信息,确认 openpipe-art 已成功安装到当前 Python 环境。

    pip show openpipe-art

关键配置

配置项必填说明示例
api_key是使用 W&B Serverless RL 后端时的鉴权 keyyour_wandb_api_key
base_model否待强化学习微调的基座模型名Qwen/Qwen3.6-27B
project否TrainableModel 所属项目名voice-agent
name否TrainableModel 的模型名agent-001
run_name否本次训练运行的名称agent-001

如何确认成功

执行 pip show openpipe-art 能显示包名与版本信息,即安装成功;无需本地 GPU 也可使用。

常见问题

Q:必须本地有 GPU 吗?

A:README 指出 ART 可从任何运行 Python 的客户端机器训练;使用 W&B Training(Serverless RL)时训练与推理基础设施由服务方托管,可避免本地 CUDA 显存不足问题。

Q:安装需要哪些前置条件?

A:只需客户端机器能运行 Python 并可用 pip;如需 Serverless RL,还需准备 W&B API key 并传入 ServerlessBackend。

Q:支持哪些基座模型?

A:README 示例使用 Qwen/Qwen3.6-27B,项目简介还提到 Qwen3.6、GPT-OSS、Llama 等主流大模型。

Q:如何接入 Serverless RL?

A:按 README 示例使用 art.serverless.backend.ServerlessBackend,传入 api_key,并通过 model.register(backend) 注册 TrainableModel。

注意事项

  • README 的安装说明非常简短,只有一条 pip install openpipe-art,更多用法请参考官网 https://art.openpipe.ai 与 W&B Training 文档。
  • ServerlessBackend 的 api_key 属于敏感信息,请勿提交到代码仓库。
  • README 示例中 api_key 占位为 your_wandb_api_key,实际使用时替换为真实 W&B API key。

核心亮点

  • 直接支持Qwen、Llama等主流开源模型,无需繁琐适配即可开始强化学习训练
  • 内置GRPO算法,针对多步骤任务优化,训练稳定性和样本效率优于传统PPO
  • 与Hugging Face生态深度集成,支持LoRA微调,降低显存和计算成本

不足之处

  • 文档和社区资源相对较少,高级用法需自行探索
  • 对训练环境要求较高,需要较大显存和算力支持

适用场景

  • 训练客服智能体在真实对话中优化回复策略
  • 为编程助手提供代码生成任务的强化学习微调
  • 在自动化操作场景(如网页操作、工具调用)中提升智能体的决策能力

替代项目

TRL (Transformer Reinforcement Learning)、OpenRL、verl

项目介绍

ART 是模型训练领域的开源项目,由 OpenPipe 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(10,766)位列前 5%,在模型训练分类的 518 个项目里位列前 5%。

近 44 天,它的 GitHub 星标从 10,576 增加到 10,766,净增 190。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:训练客服智能体在真实对话中优化回复策略。同类可对比的替代方案包括 TRL (Transformer Reinforcement Learning)、OpenRL、verl。

上一篇:can-i-finetune-this

下一篇:transformerlab-app

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13