DrMAS 是模型训练领域的开源项目,由 langfengQ 开发,2025 年首次发布。
它收录于模型训练分类,该分类目前共有 543 个项目,GitHub 星标数为 167。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-26。开源免费,无在线服务。
它主要面向的使用场景是:研究多智能体协作策略的强化学习实验。同类可对比的替代方案包括 OpenRLHF、verl。

把多智能体协作变成可训练环境,让多个 LLM 一起进化
DrMAS 是一个面向多智能体大语言模型系统的端到端强化学习训练框架。它要解决的核心问题是:以往多智能体 LLM 系统大多靠提示词工程手工编排,各智能体能力固定、无法随任务反馈持续进化。DrMAS 把多智能体协作过程建模为可训练的强化学习环境,让多个(可以是异构的、不同基座或不同规模的)LLM 智能体在同一套奖励信号下联合训练、协同优化。框架覆盖环境交互、轨迹采样、奖励计算、策略更新等完整链路,支持异构模型共训,意味着不同角色可以使用不同模型并各自更新参数。对研究者而言,它提供了可复现的多智能体 RL 实验底座;对工程团队而言,它把多智能体系统的调优从改提示词升级为训练策略,有望在复杂协作任务上获得比静态提示更好的效果。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
OpenRLHF、verl
DrMAS 是模型训练领域的开源项目,由 langfengQ 开发,2025 年首次发布。
它收录于模型训练分类,该分类目前共有 543 个项目,GitHub 星标数为 167。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-26。开源免费,无在线服务。
它主要面向的使用场景是:研究多智能体协作策略的强化学习实验。同类可对比的替代方案包括 OpenRLHF、verl。
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···