
SkyRL
把 LLM 强化学习全流程拆成乐高,多轮工具任务也能直接训
SkyRL 是一个面向大语言模型的模块化全栈强化学习库,目标是把 RL 训练 LLM 所需的各个环节——环境交互、轨迹生成、奖励计算、策略优化与分布式训练——整合成可组合的组件,而不是让研究者自己拼凑一堆脚本。它解决的核心问题是:现有 RLHF/RLVR 工具往往只覆盖训练器或只覆盖环境,难以同时支持多轮交互、工具调用、长序列生成和自定义奖励等复杂场景。SkyRL 提供可插拔的环境接口、生成后端与训练后端,支持从单机到多机的扩展,并针对长上下文与多轮对话做了显存和吞吐优化。用户可以用它复现 PPO、GRPO 等算法,也能快速接入自己的任务环境与奖励函数,适合做 agentic RL、推理增强和偏好对齐等方向的研究与工程落地。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- Git(用于克隆仓库)
- Python 环境(README 未给出具体版本要求)
- 可访问官方文档 https://docs.skyrl.ai/docs/
- 训练所需硬件资源(README 未给出具体配置要求)
安装与启动步骤
-
1克隆 SkyRL 仓库
从 GitHub 拉取源码仓库,本地得到包含 skyrl、skyrl-gym 等子目录的完整代码。
git clone https://github.com/NovaSky-AI/SkyRL.git -
2进入仓库目录
切换到仓库根目录,查看 skyrl、skyrl-train、skyrl-tx、skyrl-agent、skyrl-gym 等组件。
cd SkyRL ls -
3选择使用入口
README 指明:训练选 skyrl;建环境选 skyrl-gym;agent 流水线选 skyrl-agent。
-
4阅读官方安装文档
README 未给出安装命令,需按 Development Guide 与 quickstart 文档完成环境搭建。
-
5复现 SkyRL-v0
如需精确复现 SkyRL-v0 结果,先切换到 README 指定的 commit,再按 skyrl-agent 说明操作。
git checkout a0d50c482436af7fac8caffa4533616a78431d66 -
6确认支持的模型
按 Supported Models 文档核对你的模型是否在支持列表内,再开始训练任务。
如何确认成功
README 未提供启动验证方法;请以 skyrl 的 quickstart 文档中的运行结果为准来判断是否正常。
常见问题
Q:怎么安装 SkyRL 的依赖?
A:README 节选未给出任何安装命令,只指向官方文档。请以 Development Guide(docs.skyrl.ai/docs/getting-started/development)与 skyrl quickstart 文档为准。
Q:该用哪个子目录做模型训练?
A:README 说明模型训练请查看 ./skyrl 目录,它已整合原有的 skyrl-train 训练框架与 skyrl-tx(Tinker API 后端)。
Q:如何自定义任务环境?
A:使用 ./skyrl-gym,它按 Gymnasium API 提供了数学、编程、搜索、SQL 等工具调用环境,可按同一接口接入自己的任务。
Q:想复现 SkyRL-v0 的结果怎么做?
A:先切到 README 指定的 commit a0d50c482436af7fac8caffa4533616a78431d66,再按 ./skyrl-agent 的说明运行多轮工具调用流水线。
Q:支持哪些模型?
A:README 未列出模型清单,请查阅官方 Supported Models 文档:https://docs.skyrl.ai/docs/getting-started/supported_models。
注意事项
- README 节选只包含项目结构与文档指引,未提供 pip/docker 等安装命令,本教程步骤仅限于仓库获取与文档入口,未覆盖的安装细节请查官方文档。
- SkyRL 是面向 LLM 强化学习的全栈库,组件较多,建议按 skyrl / skyrl-gym / skyrl-agent 分别阅读对应的子目录说明。
- 复现 SkyRL-v0 必须使用指定 commit,直接使用最新主干代码结果可能不一致。
核心亮点
- 模块化拆分环境、生成、奖励与训练器,替换组件不用改整体代码
- 原生支持多轮交互与工具调用场景,适合 agentic RL 而非只做单轮偏好对齐
- 全栈覆盖从 rollout 到策略更新的链路,减少自研胶水代码
不足之处
- 项目处于成长期,API 与文档可能随版本快速变动
- 生态与预置环境数量相比成熟 RLHF 框架仍有限
适用场景
- 训练模型调用搜索/代码执行等工具完成多步任务
- 用自定义奖励函数做数学推理或代码生成的 RLVR 训练
- 在多机集群上复现并调优 PPO/GRPO 等 RL 算法
替代项目
OpenRLHF、verl、TRL
项目介绍
上一篇:create-llm
下一篇:FATE-LLM
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···