MoBA

把长文本切成块,只盯重点,让大模型轻松读百万字。

MoBA 是一种面向长上下文大语言模型的新型注意力机制,核心思想是将输入序列划分为多个块,并采用混合专家(MoE)的思路,让每个查询只关注最相关的少数块,从而将标准注意力机制的二次方计算复杂度降低到接近线性。它解决了长文本处理中计算和内存开销过大的问题,使模型能够高效处理百万级 token 的上下文。MoBA 的核心能力包括:动态块选择、稀疏注意力计算、与现有 Transformer 架构无缝集成,以及支持预训练和微调。通过实验验证,MoBA 在保持模型性能的同时,显著提升了长上下文场景下的训练和推理速度,为长文本应用提供了更经济的解决方案。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2192
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队MoonshotAI
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型flash-attention,llm,llm-serving,llm-training,moe,pytorch,transformer
GitHub 星标★ 2192
30天Star增速
HF 下载量
上线时间2025-02-17 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:高级 约 30 分钟 部署方式:库/依赖 3 步

环境要求

  • Python 3.10(README 使用 conda 创建 python=3.10 环境)
  • torch >= 2.1.0
  • flash-attn==2.6.3(当前 kernel 实现依赖该版本)
  • conda 环境管理工具
  • 可访问的 Llama-3.1-8B 模型权重(需自行准备)

安装与启动步骤

  1. 1创建并激活环境

    使用 conda 创建 Python 3.10 的独立环境,避免与现有依赖冲突,随后激活该环境。

    conda create -n moba python=3.10
    conda activate moba
  2. 2安装 MoBA

    在项目根目录执行 pip install . 完成安装,注意 README 要求 torch>=2.1.0 与 flash-attn==2.6.3。

    pip install .
  3. 3运行示例脚本

    使用 examples/llama.py 跑通快速开始,通过 --attn 选择 moba 或 moba_naive 注意力后端。

    python3 examples/llama.py --model meta-llama/Llama-3.1-8B --attn moba

关键配置

配置项必填说明示例
--model是指定要加载的模型名称或路径meta-llama/Llama-3.1-8B
--attn否选择注意力后端:moba 或 moba_naivemoba

如何确认成功

示例脚本 examples/llama.py 能正常加载模型并完成前向运行,没有报注意力后端或依赖版本错误。

常见问题

Q:MoBA 能直接用在预训练模型上加速吗?

A:不能。README 明确指出 MoBA 需要继续训练现有模型才能获得加速收益,并非即插即用的稀疏注意力方案。

Q:--attn 可选哪些后端?

A:可在 moba 与 moba_naive 之间选择,分别对应优化的 MoBA 实现和朴素实现。

Q:安装时对版本有什么要求?

A:当前 kernel 实现依赖 flash-attn==2.6.3 和 torch>=2.1.0,版本不符可能导致安装或运行失败。

注意事项

  • MoBA 需要继续训练已有模型才能体现加速效果,不是直接替换全注意力即可生效的方案。
  • 安装前请确认 torch 与 flash-attn 版本符合 README 要求,避免编译或运行报错。
  • 示例中的 meta-llama/Llama-3.1-8B 需要本地已具备访问权限或已下载的权重。

核心亮点

  • 计算复杂度从二次方降到近线性,长文本处理速度大幅提升
  • 采用 MoE 思路动态选择关键块,注意力聚焦更精准
  • 与现有 Transformer 架构兼容,可直接替换标准注意力模块

不足之处

  • 块选择机制可能引入额外开销,对短文本优势不明显
  • 文档/社区待观察

适用场景

  • 长文档问答与摘要
  • 代码库级上下文理解
  • 多轮长对话记忆增强

替代项目

Longformer、BigBird、Sparse Transformer

项目介绍

MoBA 是开源模型领域的开源项目,由 MoonshotAI 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,192)位列前 30%,在开源模型分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,162 增加到 2,192,净增 30。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:长文档问答与摘要。同类可对比的替代方案包括 Longformer、BigBird、Sparse Transformer。

上一篇:Bonsai-demo

下一篇:magicoder

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10