maxtext

用 JAX 快速训练和扩展超大规模语言模型

MaxText 是一个基于 JAX 构建的高性能、可扩展的大型语言模型(LLM)训练与推理框架,由 Google 开源。它旨在解决训练超大规模模型时面临的复杂性和性能瓶颈问题,通过简洁的代码实现出色的吞吐量和可扩展性。MaxText 支持从数百万到数千亿参数的模型训练,集成了多种并行策略(如数据并行、张量并行、序列并行等),并针对 TPU 和 GPU 进行了优化。其核心能力包括:高效的注意力机制实现、支持多种模型架构(如 Transformer)、以及与 Hugging Face 生态的兼容性。MaxText 强调代码的可读性和可维护性,同时提供强大的性能调优能力,适合研究者和工程师用于训练和部署前沿 LLM。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2429
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队AI-Hypercomputer
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型deepseek,fine-tuning,gemma2,gemma3,gpt,jax,large-language-models,llama2,llama3,llama4,llm,mistral,mixtral,sft
GitHub 星标★ 2429
30天Star增速
HF 下载量
上线时间2023-02-28 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 3.12(官方主要支持版本,其他版本可能出现兼容性问题)
  • 建议使用最新的 PyPI 发布版,而非 main 分支代码
  • 目标硬件为 Google Cloud TPU 或 GPU(README 说明 MaxText 面向这两类加速器训练)
  • 能访问 PyPI 与 GitHub(用于拉取安装包和查阅文档)

安装与启动步骤

  1. 1准备 Python 3.12

    README 明确推荐使用 Python 3.12,这是官方主要支持的版本;其他 Python 版本可能遇到兼容性问题,建议先确认本机版本。

    python --version
  2. 2从 PyPI 安装 MaxText

    README 推荐使用 PyPI 上的最新发布版(note 中给出的 pypi.org/project/maxtext/),而不是 main 分支源码。

    pip install maxtext
  3. 3查阅官方安装指南

    README 的 Installation 一节指向官方安装文档,里面有完整步骤与更多安装方式(如预构建容器镜像),安装前后建议对照。

  4. 4确认安装结果

    查看已安装的 maxtext 包信息与版本号,确认安装成功。

    pip show maxtext

如何确认成功

执行 pip show maxtext,能输出 Name: maxtext 与版本号即表示安装成功。

常见问题

Q:应该用 main 分支还是 PyPI 版本?

A:README 明确建议使用最新的 PyPI 发布版或对应的预构建容器镜像,并说明 main 分支不保证达到生产可用状态。

Q:用哪个 Python 版本最稳妥?

A:推荐 Python 3.12,这是 MaxText 的主要支持版本;使用其他 Python 版本可能会遇到兼容性问题。

Q:可以用 Docker 容器运行吗?

A:README 提到 MaxText 提供预构建的 Docker 镜像,具体参见官方教程 build_maxtext.md 中的 pre-built MaxText Docker images 一节。

Q:支持哪些硬件平台?

A:MaxText 面向 Google Cloud TPU 和 GPU 进行训练,纯 Python/JAX 实现,未提及 CPU 训练支持。

注意事项

  • README 强调 main 分支不预期达到生产可用,请优先使用 PyPI 发布版或预构建容器镜像。
  • 安装教程里未给出的具体参数、端口、路径请以官方文档 maxtext.readthedocs.io 为准,不要凭猜测填写。
  • MaxText 是面向 TPU/GPU 的训练与推理框架,本地无加速器时只能做代码阅读或依赖安装验证。

核心亮点

  • 基于 JAX 的纯函数式设计,代码简洁且易于理解和修改
  • 内置多种并行策略,可无缝扩展到数千亿参数模型
  • 针对 TPU 深度优化,训练吞吐量在同类框架中领先

不足之处

  • JAX 生态相对 PyTorch 较小,学习曲线较陡
  • 文档和社区支持仍在完善中,部分功能需自行探索

适用场景

  • 在 TPU 集群上训练超大规模自定义 LLM
  • 研究并行训练策略和模型架构优化
  • 快速原型验证新的注意力机制或模型结构

替代项目

GPT-NeoX、Megatron-LM、DeepSpeed

项目介绍

maxtext 是模型训练领域的开源项目,由 AI-Hypercomputer 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,429)位列前 30%,在模型训练分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,387 增加到 2,429,净增 42。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:在TPU集群上训练超大规模自定义LLM。同类可对比的替代方案包括 GPT-NeoX、Megatron-LM、DeepSpeed。

上一篇:xTuring

下一篇:how-to-train-your-gpt

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13