paxml 是模型训练领域的开源项目,由 google 开发,2022 年首次发布。
它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 561。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-18。Apache-2.0 许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:大规模语言模型预训练。同类可对比的替代方案包括 PyTorch + FSDP、DeepSpeed、Megatron-LM。

用JAX训练超大模型,榨干GPU算力,配置灵活不掉队。
Pax是一个基于JAX的机器学习框架,专为训练大规模模型而设计。它解决了在大规模分布式训练中,模型并行、数据并行和流水线并行配置复杂、难以灵活组合的问题。Pax的核心能力在于提供高度可配置的实验环境和自动化的并行化策略,允许研究者通过模块化组件自由搭建模型架构,并利用JAX的即时编译和自动微分能力实现高效训练。Pax在多个基准上展示了业界领先的模型算力利用率(MFU),意味着它能在相同硬件资源下训练更大或更快的模型。它由Google开发,与JAX生态深度集成,适合需要极致性能和大规模扩展的深度学习研究团队。
PyTorch + FSDP、DeepSpeed、Megatron-LM
paxml 是模型训练领域的开源项目,由 google 开发,2022 年首次发布。
它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 561。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-18。Apache-2.0 许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:大规模语言模型预训练。同类可对比的替代方案包括 PyTorch + FSDP、DeepSpeed、Megatron-LM。
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···