labs-molt 是模型训练领域的开源项目,由 NVIDIA-NeMo 开发,是 2026 年新上线的项目。
在全站 13,635 个收录项目中,它的 GitHub 星标数(1,165)位列前 30%,在模型训练分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。开源免费,无在线服务。
它主要面向的使用场景是:研究智能体多轮对话的强化学习算法。同类可对比的替代方案包括 OpenRLHF、verl、TRL。

用HuggingFace生态跑智能体强化学习,省心扩展
labs-molt 是一个面向研究场景的可扩展强化学习框架,专为智能体(agentic)训练设计,并与 HuggingFace 生态原生集成。它解决的是当前 RLHF/RLVR 框架在复杂多轮智能体任务上扩展性差、与主流模型库割裂的问题。核心能力包括:支持张量并行、专家并行、上下文并行和 FSDP 等分布式训练策略,能高效训练大规模语言模型;原生兼容 HuggingFace 模型与数据集,降低迁移成本;代码量约 9000 行,结构紧凑,便于研究者阅读和二次开发。它强调 agentic-first 设计,适合需要与环境交互、多步决策的强化学习实验,例如工具调用、多轮对话和复杂推理任务,帮助研究者在有限算力下快速验证新算法。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
1克隆仓库
launch 脚本、agents 和 recipes 都放在这个 checkout 里,容器也会挂载该目录,必须先在本地克隆。
git clone https://github.com/NVIDIA-NeMo/labs-molt.git2进入目录
后续安装与运行命令都需在本仓库根目录下执行。
cd labs-molt3本地安装
editable 安装会拉取仓库验证过的 git 锁定版 AutoModel,R3 路由回放与 Muon 可直接使用。
pip install -e ".[vllm]"4确认驱动版本
环境需 CUDA 13;主机驱动低于 580 时请改用容器,容器自带 CUDA 前向兼容层并自动启用。此步无命令。
5运行 RL 冒烟测试
在 2 个交互节点上提交 RL 冒烟训练,首次运行会自动准备 geo3k 数据集,需 Slurm 环境。
sbatch examples/scripts/slurm/rl_qwen3_6_35b.sh6选择训练入口
SFT 用 molt.cli.train_sft,RL 用 molt.cli.train_rl_ray(基于 vLLM 的在线 RL),具体提交方式按仓库脚本为准。
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--fsdp.ep_size | 否 | 设置专家并行规模,MoE 大模型训练用 | --fsdp.ep_size 256 |
--fsdp.offload | 否 | 将优化器状态卸载到 CPU,供最大规模 actor 使用 | --fsdp.offload optimizer |
sbatch 作业成功提交并进入运行;首次运行会自动准备 geo3k 数据集,说明 RL 流程已正常启动。
Q:可以直接 pip install molt-rl 从 PyPI 安装吗?
A:不可以。PyPI 上的 molt-rl 无法携带 git 锁定版 AutoModel,落后于该 pin,目前不是受支持的安装方式,请用容器或本地安装。
Q:CUDA 12 环境能跑吗?
A:不能。本地安装要求 CUDA 13(torch==2.13.0+cu130),CUDA 12 环境无法工作。
Q:主机驱动低于 580 怎么办?
A:改用官方容器,容器内置 CUDA 前向兼容层并会自动启用,无需手动配置。
Q:HuggingFace transformers 回退路径支持并行吗?
A:不支持。该非首选回退路径只支持 text + flash_attention_2 + packing,没有 CP / EP / TP;需要这些并行能力须走 NVIDIA AutoModel。
OpenRLHF、verl、TRL
labs-molt 是模型训练领域的开源项目,由 NVIDIA-NeMo 开发,是 2026 年新上线的项目。
在全站 13,635 个收录项目中,它的 GitHub 星标数(1,165)位列前 30%,在模型训练分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。开源免费,无在线服务。
它主要面向的使用场景是:研究智能体多轮对话的强化学习算法。同类可对比的替代方案包括 OpenRLHF、verl、TRL。
上一篇:SMILE-factory
下一篇:Repo2RLEnv
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···