SkyRL

把 LLM 强化学习全流程拆成乐高,多轮工具任务也能直接训

SkyRL 是一个面向大语言模型的模块化全栈强化学习库,目标是把 RL 训练 LLM 所需的各个环节——环境交互、轨迹生成、奖励计算、策略优化与分布式训练——整合成可组合的组件,而不是让研究者自己拼凑一堆脚本。它解决的核心问题是:现有 RLHF/RLVR 工具往往只覆盖训练器或只覆盖环境,难以同时支持多轮交互、工具调用、长序列生成和自定义奖励等复杂场景。SkyRL 提供可插拔的环境接口、生成后端与训练后端,支持从单机到多机的扩展,并针对长上下文与多轮对话做了显存和吞吐优化。用户可以用它复现 PPO、GRPO 等算法,也能快速接入自己的任务环境与奖励函数,适合做 agentic RL、推理增强和偏好对齐等方向的研究与工程落地。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2322
维护状态 活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队NovaSky-AI
所属国家
定价模式free
价格说明开源免费,文档站提供使用说明
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 2322
30天Star增速
HF 下载量
上线时间2025-04-22 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Git(用于克隆仓库)
  • Python 环境(README 未给出具体版本要求)
  • 可访问官方文档 https://docs.skyrl.ai/docs/
  • 训练所需硬件资源(README 未给出具体配置要求)

安装与启动步骤

  1. 1克隆 SkyRL 仓库

    从 GitHub 拉取源码仓库,本地得到包含 skyrl、skyrl-gym 等子目录的完整代码。

    git clone https://github.com/NovaSky-AI/SkyRL.git
  2. 2进入仓库目录

    切换到仓库根目录,查看 skyrl、skyrl-train、skyrl-tx、skyrl-agent、skyrl-gym 等组件。

    cd SkyRL
    ls
  3. 3选择使用入口

    README 指明:训练选 skyrl;建环境选 skyrl-gym;agent 流水线选 skyrl-agent。

  4. 4阅读官方安装文档

    README 未给出安装命令,需按 Development Guide 与 quickstart 文档完成环境搭建。

  5. 5复现 SkyRL-v0

    如需精确复现 SkyRL-v0 结果,先切换到 README 指定的 commit,再按 skyrl-agent 说明操作。

    git checkout a0d50c482436af7fac8caffa4533616a78431d66
  6. 6确认支持的模型

    按 Supported Models 文档核对你的模型是否在支持列表内,再开始训练任务。

如何确认成功

README 未提供启动验证方法;请以 skyrl 的 quickstart 文档中的运行结果为准来判断是否正常。

常见问题

Q:怎么安装 SkyRL 的依赖?

A:README 节选未给出任何安装命令,只指向官方文档。请以 Development Guide(docs.skyrl.ai/docs/getting-started/development)与 skyrl quickstart 文档为准。

Q:该用哪个子目录做模型训练?

A:README 说明模型训练请查看 ./skyrl 目录,它已整合原有的 skyrl-train 训练框架与 skyrl-tx(Tinker API 后端)。

Q:如何自定义任务环境?

A:使用 ./skyrl-gym,它按 Gymnasium API 提供了数学、编程、搜索、SQL 等工具调用环境,可按同一接口接入自己的任务。

Q:想复现 SkyRL-v0 的结果怎么做?

A:先切到 README 指定的 commit a0d50c482436af7fac8caffa4533616a78431d66,再按 ./skyrl-agent 的说明运行多轮工具调用流水线。

Q:支持哪些模型?

A:README 未列出模型清单,请查阅官方 Supported Models 文档:https://docs.skyrl.ai/docs/getting-started/supported_models。

注意事项

  • README 节选只包含项目结构与文档指引,未提供 pip/docker 等安装命令,本教程步骤仅限于仓库获取与文档入口,未覆盖的安装细节请查官方文档。
  • SkyRL 是面向 LLM 强化学习的全栈库,组件较多,建议按 skyrl / skyrl-gym / skyrl-agent 分别阅读对应的子目录说明。
  • 复现 SkyRL-v0 必须使用指定 commit,直接使用最新主干代码结果可能不一致。

核心亮点

  • 模块化拆分环境、生成、奖励与训练器,替换组件不用改整体代码
  • 原生支持多轮交互与工具调用场景,适合 agentic RL 而非只做单轮偏好对齐
  • 全栈覆盖从 rollout 到策略更新的链路,减少自研胶水代码

不足之处

  • 项目处于成长期,API 与文档可能随版本快速变动
  • 生态与预置环境数量相比成熟 RLHF 框架仍有限

适用场景

  • 训练模型调用搜索/代码执行等工具完成多步任务
  • 用自定义奖励函数做数学推理或代码生成的 RLVR 训练
  • 在多机集群上复现并调优 PPO/GRPO 等 RL 算法

替代项目

OpenRLHF、verl、TRL

项目介绍

SkyRL 是一个模型训练领域的开源项目,官方简介:SkyRL: A Modular Full-stack RL Library for LLMs。项目使用 Python 开发,在 GitHub 上获得 2306 星标。

上一篇:create-llm

下一篇:FATE-LLM

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61327 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1279 2026-08-13