Megatron-LM

NVIDIA 出品,高效训练千亿级大模型

Megatron-LM 是 NVIDIA 主导的深度学习研究项目,专注于大规模 Transformer 模型的训练。它解决了在大规模分布式环境下训练千亿乃至万亿参数模型时的显存瓶颈、计算效率和通信开销问题。核心能力包括:基于张量并行、序列并行和数据并行的高效 3D 并行策略,支持模型分片和流水线调度;提供融合的 kernel 优化,显著提升训练吞吐;支持 GPT、BERT、T5 等主流架构,并集成混合精度训练和梯度裁剪。项目为研究社区提供了可复现的基准和工具,是学术界和工业界训练超大模型的重要参考实现。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 17979
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队NVIDIA
所属国家
定价模式free
价格说明完全开源,免费使用,需自行部署
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型large-language-models,model-para,transformers
GitHub 星标★ 17979
30天Star增速
HF 下载量
上线时间2019-03-21 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数8

使用教程

难度:高级 约 15 分钟 部署方式:库/依赖 6 步

环境要求

  • Python 环境,并已安装 uv 包管理工具(README 全程使用 uv pip)
  • 源码编译需要较大内存,可配合 MAX_JOBS 限制并行编译数
  • 建议具备 NVIDIA GPU 环境(README 定位为 GPU 优化的大规模 Transformer 训练库)
  • 需要能访问 GitHub 与 PyPI 的网络(克隆仓库/安装包)

安装与启动步骤

  1. 1从 PyPI 安装

    只想使用 Megatron Core 库时,直接用 uv 从 PyPI 安装,无需克隆仓库。

    uv pip install megatron-core
  2. 2克隆仓库

    需要预置训练脚本和参考示例(Megatron-LM)时,克隆官方仓库到本地。

    git clone https://github.com/NVIDIA/Megatron-LM.git
  3. 3进入项目目录

    克隆完成后切换到仓库根目录,后续安装命令都在此目录执行。

    cd Megatron-LM
  4. 4源码可编辑安装

    以可编辑模式安装仓库源码,适合需要修改代码或使用参考训练脚本的场景。

    uv pip install -e .
  5. 5限制编译内存

    若源码构建内存不足导致失败,用 MAX_JOBS 限制并行编译任务数后重新安装。

    MAX_JOBS=4 uv pip install -e .
  6. 6查阅官方文档

    README 未给出训练命令,NGC 容器安装与首次训练需到官方文档按指引操作。

关键配置

配置项必填说明示例
MAX_JOBS否限制源码编译的并行任务数,避免构建时内存耗尽MAX_JOBS=4

如何确认成功

README 未给出验证命令;安装过程无报错即视为完成,可再按官方 Quickstart 跑通首次训练确认。

常见问题

Q:源码安装时报内存不足怎么办?

A:用 MAX_JOBS 限制并行编译任务数,例如执行 MAX_JOBS=4 uv pip install -e . 重新安装。

Q:只想当依赖库用,不想克隆仓库?

A:直接执行 uv pip install megatron-core 即可,无需克隆源码。

Q:想用 NGC 容器或其它安装方式?

A:README 指向官方 Installation Guide:docs.nvidia.com/megatron-core/developer-guide/latest/get-started/install.html。

Q:安装好了怎么开始训练?

A:参考官方 Your First Training Run 文档,其中包含端到端训练示例与数据准备步骤。

注意事项

  • README 未提供任何训练/推理命令,训练流程需查阅官方文档
  • Megatron-LM 是参考示例(含预置训练脚本),Megatron Core 是可组合库
  • 源码编译内存占用高,README 建议用 MAX_JOBS 限制并行编译
  • README 提到 Megatron Bridge 可做 Hugging Face ↔ Megatron 检查点双向转换

核心亮点

  • 3D 并行策略成熟,显存和通信优化到位
  • 融合 kernel 和混合精度支持,训练吞吐高
  • 被 GPT-3 等知名模型采用,验证充分

不足之处

  • 文档偏研究风格,上手门槛较高
  • 对硬件和分布式环境要求苛刻

适用场景

  • 训练千亿参数级 GPT/BERT 类模型
  • 研究并行训练算法和系统优化
  • 企业级大规模模型预训练

替代项目

DeepSpeed、Fairseq、Colossal-AI

项目介绍

Megatron-LM 是模型训练领域的开源项目,由 NVIDIA 开发,2019 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(17,979)位列前 3%,在模型训练分类的 522 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 17,404 增加到 17,979,净增 575。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。完全开源,免费使用,需自行部署。

它主要面向的使用场景是:训练千亿参数级GPT/BERT类模型。同类可对比的替代方案包括 DeepSpeed、Fairseq、Colossal-AI。

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13