torchtitan

用纯 PyTorch 原生组件,快速搭起可扩展的大模型预训练流程

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5797
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队pytorch
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议BSD-3-Clause
主要语言Python
技术栈/模型
GitHub 星标★ 5797
30天Star增速
HF 下载量
上线时间2023-12-13 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-12
浏览次数0

项目介绍

TorchTitan 是 PyTorch 官方推出的原生大模型训练平台,目标是用纯 PyTorch 技术栈完成生成式 AI 模型(尤其是 Llama 类 Transformer)的分布式预训练。它把张量并行、流水线并行、数据并行、FSDP2、激活检查点、混合精度、分布式检查点等训练大模型必需的并行与显存优化能力,做成可组合、可复用的组件,避免研究者反复手写并行逻辑。项目提供清晰的训练配方与配置系统,支持从单机多卡到多机多卡扩展,并强调与 PyTorch 生态(torch.compile、DTensor 等)深度集成,方便验证新特性、复现实验和作为内部训练框架的起点。它解决的是大模型训练代码碎片化、并行策略难以维护、性能调优门槛高的问题,让团队用更少胶水代码获得可扩展、可维护的预训练流程。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3.11 及以上版本
  • 已安装 PyTorch nightly(需匹配的 CUDA 或 ROCm 构建,如 cu132/rocm10.0)
  • NVIDIA/AMD GPU 环境,真实模型训练按 README 使用 8 卡
  • 下载 Llama 权重/tokenizer 需有 Hugging Face 对应仓库访问权限

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 torchtitan 源码并进入项目目录,后续命令都在该目录执行。

    git clone https://github.com/pytorch/torchtitan && cd torchtitan
  2. 2安装 PyTorch nightly

    安装最新 PyTorch 预览版,把 cu132 换成与你机器匹配的 CUDA 或 ROCm 构建。

    pip install --pre torch --index-url https://download.pytorch.org/whl/nightly/cu132
  3. 3安装项目依赖

    在仓库根目录安装 requirements.txt 中的依赖,确保训练脚本可运行。

    pip install -r requirements.txt
  4. 4跑通调试模型

    用单卡跑 Llama 3 debug 模型共 10 步,使用测试内置 tokenizer,无需下载任何资产。

    NGPU=1 ./run_train.sh
  5. 5下载 tokenizer

    训练真实模型前先下载 tokenizer;Llama 权重需在 Hugging Face 申请访问权限并填入真实 token。

    python scripts/download_hf_assets.py --repo_id meta-llama/Llama-3.1-8B --assets tokenizer --hf_token=...
  6. 6训练真实模型

    通过 MODULE 与 CONFIG 选择配方运行 Llama 3 8B,README 示例使用 8 张 GPU。

    MODULE=torchtitan_recipes.models.llama3 CONFIG=llama3_8b ./run_train.sh

关键配置

配置项必填说明示例
NGPU否指定参与训练的 GPU 数量,调试模型填 11
MODULE否指定训练配方所在的 Python 模块路径torchtitan_recipes.models.llama3
CONFIG否指定配方中的配置函数名,决定模型规模与训练参数llama3_8b
--repo_id否要下载资产的 Hugging Face 仓库 IDmeta-llama/Llama-3.1-8B
--assets否指定下载的资产类型,如 tokenizertokenizer
--hf_token否访问受限仓库所需的 Hugging Face 访问令牌hf_xxxxxxxx

如何确认成功

执行 ./run_train.sh 后终端正常输出训练日志并完成配置的步数(调试模型 10 步),即表示启动成功。

常见问题

Q:没有 GPU 或只有单卡能训练吗?

A:README 只给出 NGPU=1 的调试模型示例和 8 卡的 Llama 3 8B 示例,并要求安装 CUDA/ROCm 构建的 PyTorch nightly,未说明 CPU 训练支持。

Q:如何换 CUDA 或 ROCm 版本?

A:把安装命令里的 cu132 替换成其他 CUDA 版本或 ROCm 构建,例如 rocm10.0。

Q:下载 Llama tokenizer 或权重报权限错误怎么办?

A:先在 Hugging Face 上申请 meta-llama/Llama-3.1-8B 的访问权限,再用 --hf_token 传入真实令牌。

Q:想用最新特性该装什么版本?

A:torchtitan 处于活跃开发中,README 建议使用较新的 PyTorch nightly,也可通过 nightly 源安装 torchtitan。

注意事项

  • torchtitan 处于活跃开发阶段,使用最新功能请搭配近期的 PyTorch nightly。
  • 调试模型使用测试中自带的 tokenizer,无需下载任何资产即可跑通。
  • 真实模型训练前需准备 Hugging Face 访问权限,README 示例使用 8 张 GPU。
  • 也可用 nightly 或稳定版方式安装:pip install --pre torchtitan --index-url https://download.pytorch.org/whl/nightly/cu132 或 pip install torchtitan。

核心亮点

  • PyTorch 官方维护,与 torch.compile、DTensor、FSDP2 等新特性同步演进,技术路线权威
  • 并行策略模块化可组合,支持张量/流水线/数据并行与分布式检查点,扩展多机多卡较方便
  • 提供 Llama 等模型的完整训练配方与配置系统,便于复现实验和二次开发

不足之处

  • 项目仍处早期,API 与配置格式可能随版本变动,生产使用需锁定版本
  • 文档和社区案例相对有限,遇到问题主要依赖源码与官方 issue

适用场景

  • 团队从零搭建大模型预训练框架时作为起点
  • 验证 PyTorch 新并行/编译特性在真实训练中的表现
  • 在自有集群上做 Llama 类模型的分布式预训练与调优

替代项目

Megatron-LM、DeepSpeed、Nanotron

上一篇:ai-toolkit

下一篇:opacus

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63550 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1314 2026-08-13