makeMoE

手写稀疏混合专家模型,彻底搞懂 MoE 原理

makeMoE 是一个从零开始实现稀疏混合专家(MoE)语言模型的教学项目,灵感来源于 Andrej Karpathy 的 makemore。它通过 Jupyter Notebook 形式,逐步拆解 MoE 模型的构建过程,包括专家网络、门控机制、负载均衡损失等核心组件。项目旨在帮助深度学习开发者深入理解 MoE 的内部工作原理,而非提供生产级模型。它解决了现有教程中 MoE 实现复杂、难以入门的问题,用清晰的代码和注释展示每个细节。核心能力包括:稀疏门控的前向传播、专家选择与路由、以及简单的训练循环。适合作为学习 MoE 架构的起点,尤其适合已有基础神经网络知识、想进阶到混合专家模型的开发者。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 816
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队AviSoori1x
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型deep-learning,large-language-models,llm,mixture-of-experts,neural-networks,pytorch,pytorch-implementation
GitHub 星标★ 816
30天Star增速
HF 下载量
上线时间2024-01-22 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 从零手写,无黑盒依赖,代码透明易读
  • 聚焦 MoE 核心机制,门控和负载均衡讲解清晰
  • Notebook 形式,可交互运行,适合边学边练

不足之处

  • 仅教学用途,不适用于实际生产任务
  • 文档和社区支持有限,扩展内容较少

适用场景

  • 学习 MoE 架构原理,动手实现加深理解
  • 作为课程或工作坊的实战教材
  • 研究稀疏模型时快速验证想法

替代项目

makemore、Mixtral-8x7B、Switch Transformer

项目介绍

makeMoE 是模型训练领域的开源项目,由 AviSoori1x 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(816)位列前 30%,在模型训练分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:学习MoE架构原理,动手实现加深理解。同类可对比的替代方案包括 makemore、Mixtral-8x7B、Switch Transformer。

上一篇:llm-mcts

下一篇:ETO

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13