项目预览
项目数据
项目介绍
Star 增长趋势
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
技术标签
使用教程
—
环境要求
- Python 3.11 及以上版本
- 已安装 PyTorch nightly(需匹配的 CUDA 或 ROCm 构建,如 cu132/rocm10.0)
- NVIDIA/AMD GPU 环境,真实模型训练按 README 使用 8 卡
- 下载 Llama 权重/tokenizer 需有 Hugging Face 对应仓库访问权限
安装与启动步骤
-
1克隆仓库
从 GitHub 拉取 torchtitan 源码并进入项目目录,后续命令都在该目录执行。
git clone https://github.com/pytorch/torchtitan && cd torchtitan -
2安装 PyTorch nightly
安装最新 PyTorch 预览版,把 cu132 换成与你机器匹配的 CUDA 或 ROCm 构建。
pip install --pre torch --index-url https://download.pytorch.org/whl/nightly/cu132 -
3安装项目依赖
在仓库根目录安装 requirements.txt 中的依赖,确保训练脚本可运行。
pip install -r requirements.txt -
4跑通调试模型
用单卡跑 Llama 3 debug 模型共 10 步,使用测试内置 tokenizer,无需下载任何资产。
NGPU=1 ./run_train.sh -
5下载 tokenizer
训练真实模型前先下载 tokenizer;Llama 权重需在 Hugging Face 申请访问权限并填入真实 token。
python scripts/download_hf_assets.py --repo_id meta-llama/Llama-3.1-8B --assets tokenizer --hf_token=... -
6训练真实模型
通过 MODULE 与 CONFIG 选择配方运行 Llama 3 8B,README 示例使用 8 张 GPU。
MODULE=torchtitan_recipes.models.llama3 CONFIG=llama3_8b ./run_train.sh
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
NGPU | 否 | 指定参与训练的 GPU 数量,调试模型填 1 | 1 |
MODULE | 否 | 指定训练配方所在的 Python 模块路径 | torchtitan_recipes.models.llama3 |
CONFIG | 否 | 指定配方中的配置函数名,决定模型规模与训练参数 | llama3_8b |
--repo_id | 否 | 要下载资产的 Hugging Face 仓库 ID | meta-llama/Llama-3.1-8B |
--assets | 否 | 指定下载的资产类型,如 tokenizer | tokenizer |
--hf_token | 否 | 访问受限仓库所需的 Hugging Face 访问令牌 | hf_xxxxxxxx |
如何确认成功
执行 ./run_train.sh 后终端正常输出训练日志并完成配置的步数(调试模型 10 步),即表示启动成功。
常见问题
Q:没有 GPU 或只有单卡能训练吗?
A:README 只给出 NGPU=1 的调试模型示例和 8 卡的 Llama 3 8B 示例,并要求安装 CUDA/ROCm 构建的 PyTorch nightly,未说明 CPU 训练支持。
Q:如何换 CUDA 或 ROCm 版本?
A:把安装命令里的 cu132 替换成其他 CUDA 版本或 ROCm 构建,例如 rocm10.0。
Q:下载 Llama tokenizer 或权重报权限错误怎么办?
A:先在 Hugging Face 上申请 meta-llama/Llama-3.1-8B 的访问权限,再用 --hf_token 传入真实令牌。
Q:想用最新特性该装什么版本?
A:torchtitan 处于活跃开发中,README 建议使用较新的 PyTorch nightly,也可通过 nightly 源安装 torchtitan。
注意事项
- torchtitan 处于活跃开发阶段,使用最新功能请搭配近期的 PyTorch nightly。
- 调试模型使用测试中自带的 tokenizer,无需下载任何资产即可跑通。
- 真实模型训练前需准备 Hugging Face 访问权限,README 示例使用 8 张 GPU。
- 也可用 nightly 或稳定版方式安装:pip install --pre torchtitan --index-url https://download.pytorch.org/whl/nightly/cu132 或 pip install torchtitan。
核心亮点
- PyTorch 官方维护,与 torch.compile、DTensor、FSDP2 等新特性同步演进,技术路线权威
- 并行策略模块化可组合,支持张量/流水线/数据并行与分布式检查点,扩展多机多卡较方便
- 提供 Llama 等模型的完整训练配方与配置系统,便于复现实验和二次开发
不足之处
- 项目仍处早期,API 与配置格式可能随版本变动,生产使用需锁定版本
- 文档和社区案例相对有限,遇到问题主要依赖源码与官方 issue
适用场景
- 团队从零搭建大模型预训练框架时作为起点
- 验证 PyTorch 新并行/编译特性在真实训练中的表现
- 在自有集群上做 Llama 类模型的分布式预训练与调优
替代项目
Megatron-LM、DeepSpeed、Nanotron
上一篇:ai-toolkit
下一篇:opacus
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···
