RLP

把强化学习塞进预训练,让模型天生会决策

RLP 是一个将强化学习作为预训练目标的开源模型项目,由 ICLR 2026 论文官方实现,基于 PyTorch。它旨在解决传统预训练模型仅关注监督学习或自监督学习,缺乏对交互式决策任务适应性的问题。RLP 的核心能力是在预训练阶段引入强化学习目标,使模型在初始阶段就学习到策略优化的信号,从而在下游强化学习任务中更快收敛、表现更好。该项目提供了完整的训练代码、配置和实验脚本,支持自定义环境与任务,适合研究强化学习预训练范式的学者和开发者。通过将 RL 目标与现有预训练流程结合,RLP 探索了通用智能体更高效的训练路径。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 254
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队NVlabs
所属国家
官网地址
定价模式free
价格说明开源项目,无在线服务,需自行部署,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言
技术栈/模型grpo,language-modeling,large-language-models,policy-gradient,pretraining,reasoning,reinforcement-learning
GitHub 星标★ 254
30天Star增速
HF 下载量
上线时间2025-09-26 00:00:00
最近更新2026-09-05 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 创新性地将强化学习目标融入预训练阶段,突破传统监督/自监督预训练局限
  • 官方 ICLR 2026 论文实现,代码质量有保障,实验配置完整
  • 基于 PyTorch,易于扩展和复现,适合学术研究

不足之处

  • 早期项目,文档和社区支持待观察
  • 目前仅提供基础实现,可能缺乏大规模预训练的实际验证

适用场景

  • 学术研究:探索强化学习预训练的新范式
  • 智能体训练:为下游强化学习任务提供更好的初始化
  • 多任务决策:预训练模型可适应多种交互式环境

替代项目

Decision Transformer、Gato (DeepMind)、RLHF (基于人类反馈的强化学习)

项目介绍

RLP 是模型训练领域的开源项目,由 NVlabs 开发,2025 年首次发布。

它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 254。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-05。无在线服务,需自行部署,完全免费。

它主要面向的使用场景是:学术研究:探索强化学习预训练的新范式。同类可对比的替代方案包括 Decision Transformer、Gato (DeepMind)、RLHF (基于人类反馈的强化学习)。

上一篇:dLLM-RL

下一篇:reevo

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13