Fast-LLM 是模型训练领域的开源项目,由 ServiceNow 开发,2024 年首次发布。
它收录于模型训练分类,该分类目前共有 523 个项目,GitHub 星标数为 335。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。开源免费,基于Apache 2.0许可证。
它主要面向的使用场景是:在多卡集群上做LLM预训练并追求更高吞吐。同类可对比的替代方案包括 Megatron-LM、DeepSpeed、Nanotron。

让 LLM 训练跑满 GPU,少等快出结果
Fast-LLM 是 ServiceNow Research 开源的 LLM 训练加速框架,目标是把大模型预训练与微调推到接近硬件极限的速度。它围绕训练全流程做优化:提供高效的分布式并行策略(数据、张量、流水线等组合)、融合算子与通信重叠,减少 GPU 空转;内置对混合精度、梯度累积、激活重计算的支持,降低显存占用以支撑更大模型或更长序列;同时给出可复用的训练配置与启动脚本,让研究者不必从零搭建并行与性能调优代码。项目用 Python 编写,定位偏研究友好,适合在自有集群上快速跑通并加速 LLM 训练任务,尤其适合关注吞吐与扩展效率的团队。当前星标约 335,属于早期但方向明确的基础设施型项目。
Megatron-LM、DeepSpeed、Nanotron
Fast-LLM 是模型训练领域的开源项目,由 ServiceNow 开发,2024 年首次发布。
它收录于模型训练分类,该分类目前共有 523 个项目,GitHub 星标数为 335。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。开源免费,基于Apache 2.0许可证。
它主要面向的使用场景是:在多卡集群上做LLM预训练并追求更高吞吐。同类可对比的替代方案包括 Megatron-LM、DeepSpeed、Nanotron。
上一篇:mcore-bridge
下一篇:没有了!
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···