labs-molt

用HuggingFace生态跑智能体强化学习,省心扩展

labs-molt 是一个面向研究场景的可扩展强化学习框架,专为智能体(agentic)训练设计,并与 HuggingFace 生态原生集成。它解决的是当前 RLHF/RLVR 框架在复杂多轮智能体任务上扩展性差、与主流模型库割裂的问题。核心能力包括:支持张量并行、专家并行、上下文并行和 FSDP 等分布式训练策略,能高效训练大规模语言模型;原生兼容 HuggingFace 模型与数据集,降低迁移成本;代码量约 9000 行,结构紧凑,便于研究者阅读和二次开发。它强调 agentic-first 设计,适合需要与环境交互、多步决策的强化学习实验,例如工具调用、多轮对话和复杂推理任务,帮助研究者在有限算力下快速验证新算法。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1165
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队NVIDIA-NeMo
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic-rl,context-parallelism,expert-parallelism,fsdp,huggingface,llm,rl-framework,rlhf,rlvr,tensor-parallelism
GitHub 星标★ 1165
30天Star增速
HF 下载量
上线时间2026-06-23 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-04
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • CUDA 13 环境(torch==2.13.0+cu130),CUDA 12 环境不可用
  • NVIDIA GPU 与主机驱动;驱动版本低于 580 时需改用官方容器
  • Python + pip(用于本地 editable 安装)
  • 多节点 RL 冒烟测试需要 Slurm 集群(示例脚本用 sbatch 提交)

安装与启动步骤

  1. 1克隆仓库

    launch 脚本、agents 和 recipes 都放在这个 checkout 里,容器也会挂载该目录,必须先在本地克隆。

    git clone https://github.com/NVIDIA-NeMo/labs-molt.git
  2. 2进入目录

    后续安装与运行命令都需在本仓库根目录下执行。

    cd labs-molt
  3. 3本地安装

    editable 安装会拉取仓库验证过的 git 锁定版 AutoModel,R3 路由回放与 Muon 可直接使用。

    pip install -e ".[vllm]"
  4. 4确认驱动版本

    环境需 CUDA 13;主机驱动低于 580 时请改用容器,容器自带 CUDA 前向兼容层并自动启用。此步无命令。

  5. 5运行 RL 冒烟测试

    在 2 个交互节点上提交 RL 冒烟训练,首次运行会自动准备 geo3k 数据集,需 Slurm 环境。

    sbatch examples/scripts/slurm/rl_qwen3_6_35b.sh
  6. 6选择训练入口

    SFT 用 molt.cli.train_sft,RL 用 molt.cli.train_rl_ray(基于 vLLM 的在线 RL),具体提交方式按仓库脚本为准。

关键配置

配置项必填说明示例
--fsdp.ep_size否设置专家并行规模,MoE 大模型训练用--fsdp.ep_size 256
--fsdp.offload否将优化器状态卸载到 CPU,供最大规模 actor 使用--fsdp.offload optimizer

如何确认成功

sbatch 作业成功提交并进入运行;首次运行会自动准备 geo3k 数据集,说明 RL 流程已正常启动。

常见问题

Q:可以直接 pip install molt-rl 从 PyPI 安装吗?

A:不可以。PyPI 上的 molt-rl 无法携带 git 锁定版 AutoModel,落后于该 pin,目前不是受支持的安装方式,请用容器或本地安装。

Q:CUDA 12 环境能跑吗?

A:不能。本地安装要求 CUDA 13(torch==2.13.0+cu130),CUDA 12 环境无法工作。

Q:主机驱动低于 580 怎么办?

A:改用官方容器,容器内置 CUDA 前向兼容层并会自动启用,无需手动配置。

Q:HuggingFace transformers 回退路径支持并行吗?

A:不支持。该非首选回退路径只支持 text + flash_attention_2 + packing,没有 CP / EP / TP;需要这些并行能力须走 NVIDIA AutoModel。

注意事项

  • 容器会挂载本仓库 checkout,launch 脚本、agents 与 recipes 都在仓库内。
  • NVIDIA AutoModel 是主路径,原生支持 CP / EP / TP;HF transformers 只是非首选回退。
  • 优化器默认 adam,muon 为实验性,目前未稳定优于 adam,不建议默认使用。

核心亮点

  • 原生集成HuggingFace,模型和数据集直接复用,迁移成本低
  • 支持张量/专家/上下文并行与FSDP,可扩展至大规模训练
  • 代码仅约9k行,结构紧凑,便于研究者阅读和修改

不足之处

  • 项目较新,社区生态和文档完善度有待观察
  • 仅1165星,生产环境验证案例较少

适用场景

  • 研究智能体多轮对话的强化学习算法
  • 在有限GPU上验证RLVR/RLHF新思路
  • 基于HuggingFace模型做工具调用策略训练

替代项目

OpenRLHF、verl、TRL

项目介绍

labs-molt 是模型训练领域的开源项目,由 NVIDIA-NeMo 开发,是 2026 年新上线的项目。

在全站 13,635 个收录项目中,它的 GitHub 星标数(1,165)位列前 30%,在模型训练分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。开源免费,无在线服务。

它主要面向的使用场景是:研究智能体多轮对话的强化学习算法。同类可对比的替代方案包括 OpenRLHF、verl、TRL。

上一篇:SMILE-factory

下一篇:Repo2RLEnv

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63128 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1306 2026-08-13