Fast-LLM

让 LLM 训练跑满 GPU,少等快出结果

Fast-LLM 是 ServiceNow Research 开源的 LLM 训练加速框架,目标是把大模型预训练与微调推到接近硬件极限的速度。它围绕训练全流程做优化:提供高效的分布式并行策略(数据、张量、流水线等组合)、融合算子与通信重叠,减少 GPU 空转;内置对混合精度、梯度累积、激活重计算的支持,降低显存占用以支撑更大模型或更长序列;同时给出可复用的训练配置与启动脚本,让研究者不必从零搭建并行与性能调优代码。项目用 Python 编写,定位偏研究友好,适合在自有集群上快速跑通并加速 LLM 训练任务,尤其适合关注吞吐与扩展效率的团队。当前星标约 335,属于早期但方向明确的基础设施型项目。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 335
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类模型训练
开发团队ServiceNow
所属国家
定价模式free
价格说明开源免费,基于Apache 2.0许可证
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型
GitHub 星标★ 335
30天Star增速
HF 下载量
上线时间2024-10-11 00:00:00
最近更新2026-09-24 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-26
浏览次数0

使用教程

核心亮点

  • 提供多种并行策略组合,便于按集群规模扩展训练吞吐
  • 针对通信与计算重叠做优化,减少多卡训练中的 GPU 空转
  • 支持混合精度、梯度累积与激活重计算,降低显存门槛

不足之处

  • 项目处于早期,生态与第三方集成相对有限
  • 文档和示例主要面向研究场景,生产级运维支持待观察

适用场景

  • 在多卡集群上做 LLM 预训练并追求更高吞吐
  • 显存受限时用激活重计算与并行策略训练更大模型
  • 研究团队快速复现和对比不同并行配置的训练效率

替代项目

Megatron-LM、DeepSpeed、Nanotron

项目介绍

Fast-LLM 是模型训练领域的开源项目,由 ServiceNow 开发,2024 年首次发布。

它收录于模型训练分类,该分类目前共有 523 个项目,GitHub 星标数为 335。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。开源免费,基于Apache 2.0许可证。

它主要面向的使用场景是:在多卡集群上做LLM预训练并追求更高吞吐。同类可对比的替代方案包括 Megatron-LM、DeepSpeed、Nanotron。

上一篇:mcore-bridge

下一篇:没有了!

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13