llm-foundry

开箱即用的生产级 LLM 训练框架,快速搞定预训练与微调

llm-foundry 是 Databricks 开源的 LLM 训练框架,旨在为大规模基础模型训练提供生产级代码库。它解决了从数据准备到模型部署全流程的工程化问题,核心能力包括:支持灵活的模型架构(如 MPT、Llama 等)、高性能的数据流处理(基于 StreamingDataset)、分布式训练(集成 Composer 和 FSDP)、以及模型评估与微调工具。项目提供标准化脚本和配置,帮助开发者快速启动预训练、持续预训练、指令微调与 RLHF 流程,并兼容 Hugging Face 生态,便于模型导出和部署。其设计强调可复现性和可扩展性,适合需要深度定制训练流程的团队。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4449
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队mosaicml
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型deep-learning,llm,neural-networks,nlp,pytorch
GitHub 星标★ 4449
30天Star增速
HF 下载量
上线时间2023-04-28 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 15 分钟 部署方式:Docker 6 步

环境要求

  • 已安装 PyTorch、CMake 和 packaging,否则需先执行 pip install cmake packaging torch
  • 推荐在 mosaicml/llm-foundry Docker 镜像内运行(如 2.7.0_cu128-latest)
  • 有 NVIDIA GPU 时使用 pip install -e ".[gpu]",无 GPU 用 pip install -e .
  • 不使用 Docker 时建议先创建并激活虚拟环境
  • 官方 Docker 镜像基于 Python 3.12、Torch 2.7.0、CUDA 12.8

安装与启动步骤

  1. 1克隆代码仓库

    从 GitHub 克隆 llm-foundry 仓库到本地,为后续安装和运行脚本做准备。

    git clone https://github.com/mosaicml/llm-foundry.git
  2. 2进入项目目录

    切换到克隆下来的 llm-foundry 目录,后续安装命令都在此目录执行。

    cd llm-foundry
  3. 3安装基础依赖

    README 假设已装 PyTorch、CMake、packaging;若没有,用此命令安装。

    pip install cmake packaging torch
  4. 4安装 GPU 版本

    有 NVIDIA GPU 时安装带 gpu 可选依赖的 llm-foundry 包,使用可编辑模式。

    pip install -e ".[gpu]"
  5. 5安装 CPU 版本

    若无 NVIDIA GPU,改用不带 gpu 可选依赖的可编辑安装。

    pip install -e .
  6. 6进入脚本目录

    Quickstart 从 scripts 目录开始,可继续跑数据准备、训练与推理脚本。

    cd scripts

如何确认成功

按 Quickstart 跑通 C4 数据准备、MPT-125M 训练、HuggingFace 导出和评估即成功。

常见问题

Q:Docker 镜像里已经装好 llm-foundry 了吗?

A:没有。mosaicml/llm-foundry 镜像只预装依赖,仍需用 pip install llm-foundry 或从源码 pip install -e 安装。

Q:没有 NVIDIA GPU 怎么安装?

A:使用 pip install -e . 安装,不要加 [gpu] 可选依赖即可。

Q:安装后依赖冲突怎么办?

A:README 提示可能需要升降级部分包,例如将 numpy 降到 1.23.5,再重试。

Q:Quickstart 只训练 10 个 batch 效果好吗?

A:只是演示工具流程,要获得好的模型质量需训练远超 10 个 batch。

注意事项

  • 官方强烈推荐在 Docker 容器中使用 llm-foundry。
  • Docker 镜像不包含 llm-foundry 包,只包含依赖。
  • 不用 Docker 时建议创建虚拟环境;ROCm 用户还需安装 ROCm 版 flash attention。
  • README 的 10 batch 训练仅用于演示,不要期望模型质量。

核心亮点

  • 集成 Composer 和 FSDP,支持大规模分布式训练,性能优化成熟
  • 内置 StreamingDataset,可高效处理 TB 级数据流,减少 I/O 瓶颈
  • 提供从数据准备到评估的完整脚本,降低入门门槛,支持快速复现实验

不足之处

  • 文档偏技术化,新手上手成本较高
  • 对非 Databricks 环境的兼容性依赖较多,社区支持待观察

适用场景

  • 企业级 LLM 预训练和持续预训练
  • 指令微调与 RLHF 流程的快速落地
  • 基于 Hugging Face 模型的自定义训练与评估

替代项目

NVIDIA NeMo、Hugging Face Transformers + Trainer、EleutherAI 的 GPT-NeoX

项目介绍

llm-foundry 是模型训练领域的开源项目,由 mosaicml 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(4,449)位列前 10%,在模型训练分类的 522 个项目里位列前 12%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:企业级LLM预训练和持续预训练。同类可对比的替代方案包括 NVIDIA NeMo、Hugging Face Transformers + Trainer、EleutherAI 的 GPT-NeoX。

上一篇:reasoning-from-scratch

下一篇:SwanLab

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13