Composition-RL 是模型训练领域的开源项目,由 XinXU-USTC 开发,是 2026 年新上线的项目。
它收录于模型训练分类,该分类目前共有 535 个项目,GitHub 星标数为 138。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-27。开源免费,论文配套代码。
它主要面向的使用场景是:为大模型RLVR训练做数据增强。同类可对比的替代方案包括 verl、OpenRLHF。

把可验证提示词自动组合,低成本扩充 RL 训练数据
Composition-RL 是 NeurIPS 2026 论文的官方开源实现,聚焦大语言模型的可验证提示词强化学习。它解决的核心问题是:现有 RLVR(可验证奖励强化学习)依赖大量人工标注或单一来源的提示词,数据成本高且多样性不足。项目提出「组合式提示词」思路,把已有的可验证提示词通过组合、改写、拼接等方式自动扩展成新的训练样本,从而在无需额外人工标注的情况下扩大训练数据规模、提升提示多样性。核心能力包括:可验证提示词的自动组合与生成管线、配套的强化学习训练脚本、以及对生成样本可验证性的校验机制。代码以 Python 实现,结构轻量,适合研究者在自有模型和数据集上复现论文实验,或作为 RLVR 数据增强的基线工具。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
verl、OpenRLHF
Composition-RL 是模型训练领域的开源项目,由 XinXU-USTC 开发,是 2026 年新上线的项目。
它收录于模型训练分类,该分类目前共有 535 个项目,GitHub 星标数为 138。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-27。开源免费,论文配套代码。
它主要面向的使用场景是:为大模型RLVR训练做数据增强。同类可对比的替代方案包括 verl、OpenRLHF。
上一篇:Repo2RLEnv
下一篇:没有了!
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···