DrMAS

把多智能体协作变成可训练环境,让多个 LLM 一起进化

DrMAS 是一个面向多智能体大语言模型系统的端到端强化学习训练框架。它要解决的核心问题是:以往多智能体 LLM 系统大多靠提示词工程手工编排,各智能体能力固定、无法随任务反馈持续进化。DrMAS 把多智能体协作过程建模为可训练的强化学习环境,让多个(可以是异构的、不同基座或不同规模的)LLM 智能体在同一套奖励信号下联合训练、协同优化。框架覆盖环境交互、轨迹采样、奖励计算、策略更新等完整链路,支持异构模型共训,意味着不同角色可以使用不同模型并各自更新参数。对研究者而言,它提供了可复现的多智能体 RL 实验底座;对工程团队而言,它把多智能体系统的调优从改提示词升级为训练策略,有望在复杂协作任务上获得比静态提示更好的效果。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 167
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队langfengQ
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 167
30天Star增速
HF 下载量
上线时间2025-06-14 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 支持异构 LLM 联合训练,不同角色可用不同模型并各自更新
  • 端到端覆盖采样、奖励、策略更新,多智能体 RL 流程完整
  • Python 实现,便于研究者二次开发和接入自有环境

不足之处

  • 项目处于早期,星标仅 167,生态与文档成熟度有限
  • 多智能体 RL 训练算力与工程门槛较高,普通团队上手成本大

适用场景

  • 研究多智能体协作策略的强化学习实验
  • 训练角色分工明确的 LLM 智能体团队(如规划+执行+评审)
  • 在复杂任务上替代手工提示词编排,用训练提升协作效果

替代项目

OpenRLHF、verl

项目介绍

DrMAS 是模型训练领域的开源项目,由 langfengQ 开发,2025 年首次发布。

它收录于模型训练分类,该分类目前共有 543 个项目,GitHub 星标数为 167。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-26。开源免费,无在线服务。

它主要面向的使用场景是:研究多智能体协作策略的强化学习实验。同类可对比的替代方案包括 OpenRLHF、verl。

上一篇:NexRL

下一篇:LoongSage

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63243 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1308 2026-08-13