RLP 是模型训练领域的开源项目,由 NVlabs 开发,2025 年首次发布。
它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 254。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-05。无在线服务,需自行部署,完全免费。
它主要面向的使用场景是:学术研究:探索强化学习预训练的新范式。同类可对比的替代方案包括 Decision Transformer、Gato (DeepMind)、RLHF (基于人类反馈的强化学习)。

把强化学习塞进预训练,让模型天生会决策
RLP 是一个将强化学习作为预训练目标的开源模型项目,由 ICLR 2026 论文官方实现,基于 PyTorch。它旨在解决传统预训练模型仅关注监督学习或自监督学习,缺乏对交互式决策任务适应性的问题。RLP 的核心能力是在预训练阶段引入强化学习目标,使模型在初始阶段就学习到策略优化的信号,从而在下游强化学习任务中更快收敛、表现更好。该项目提供了完整的训练代码、配置和实验脚本,支持自定义环境与任务,适合研究强化学习预训练范式的学者和开发者。通过将 RL 目标与现有预训练流程结合,RLP 探索了通用智能体更高效的训练路径。
Decision Transformer、Gato (DeepMind)、RLHF (基于人类反馈的强化学习)
RLP 是模型训练领域的开源项目,由 NVlabs 开发,2025 年首次发布。
它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 254。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-05。无在线服务,需自行部署,完全免费。
它主要面向的使用场景是:学术研究:探索强化学习预训练的新范式。同类可对比的替代方案包括 Decision Transformer、Gato (DeepMind)、RLHF (基于人类反馈的强化学习)。
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···