dLLM-RL

给扩散大模型装上强化学习引擎,训练出 SOTA 的 TraDo 系列

dLLM-RL 是 ICLR 2026 论文 TraceRL 的官方代码库,专注于扩散大语言模型(Diffusion LLMs)的后训练强化学习。扩散模型在生成任务中展现出潜力,但传统自回归模型的后训练方法(如 RLHF)无法直接适用。该项目提出 TraceRL 方法,通过轨迹级别的奖励建模和策略优化,解决扩散模型生成过程中的稀疏奖励和长程信用分配问题,并在此基础上推出了 TraDo 系列模型,在多项文本生成基准上达到 SOTA 水平。核心能力包括:支持扩散模型的强化学习训练流程、轨迹级奖励设计、以及高效的采样与优化策略。项目代码基于 Python,提供训练和推理脚本,便于研究者复现和扩展。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 523
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Gen-Verse
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型code-generation,diffusion-language-models,large-language-models,llm-reasoning,mathmatical-reasoning,reinforcement-learning-algorithms,rlhf
GitHub 星标★ 523
30天Star增速
HF 下载量
上线时间2025-08-26 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 首个系统解决扩散 LLM 后训练强化学习问题的开源方案,方法创新性强
  • 代码结构清晰,包含完整训练和推理流程,便于复现论文结果
  • 基于 ICLR 论文,技术路线有理论支撑,非简单调参

不足之处

  • 早期项目,文档和社区支持尚不完善,上手门槛较高
  • 依赖特定扩散模型架构,迁移到其他模型需额外适配

适用场景

  • 研究扩散语言模型的后训练算法,如 RLHF 变体
  • 需要生成质量高且可控的文本生成任务,如长文写作、对话
  • 探索非自回归生成模型在 NLP 中的应用

替代项目

TRL (Hugging Face)、OpenRLHF、verl

项目介绍

dLLM-RL 是模型训练领域的开源项目,由 Gen-Verse 开发,2025 年首次发布。

它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 523。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:研究扩散语言模型的后训练算法,如RLHF变体。同类可对比的替代方案包括 TRL (Hugging Face)、OpenRLHF、verl。

上一篇:DART

下一篇:RLP

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13