nanotron 是模型训练领域的开源项目,由 huggingface 开发,2023 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(2,827)位列前 30%,在模型训练分类的 522 个项目里位列前 15%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源免费,需自行部署。
它主要面向的使用场景是:多机多卡集群上预训练百亿参数级大语言模型。同类可对比的替代方案包括 Megatron-LM、DeepSpeed。

极简代码跑通千亿模型3D并行训练
nanotron 是 Hugging Face 开源的大语言模型训练框架,核心目标是用极简代码实现 3D 并行训练(数据并行、张量并行、流水线并行),让研究者和工程团队能在多机多卡集群上高效训练百亿到千亿参数级模型。它把分布式训练中繁琐的通信、切分、调度逻辑封装成清晰模块,同时集成 FlashAttention、ZeRO 优化、混合精度、梯度检查点等常用加速手段,并支持从 Hugging Face 生态加载数据集与模型权重。相比 Megatron-LM 等重型方案,nanotron 代码量小、可读性高,便于二次开发和实验验证,适合作为大模型预训练与微调的轻量级基座。
1创建虚拟环境
用 uv 创建名为 nanotron 的 Python 3.11 虚拟环境并激活,同时升级 pip。HF 集群用户建议设置 UV_LINK_MODE=copy。
uv venv nanotron --python 3.11 && source nanotron/bin/activate && uv pip install --upgrade pip2安装 PyTorch
从 PyTorch 官方 cu124 索引安装 PyTorch,默认适配 CUDA 12.4 环境。
uv pip install torch --index-url https://download.pytorch.org/whl/cu1243安装核心依赖
在项目根目录以可编辑模式安装 nanotron 本体及核心依赖。
uv pip install -e .4安装示例依赖
要运行示例脚本,再安装数据集、模型加载、日志等可选依赖。
uv pip install datasets transformers datatrove[io] numba wandb5运行文本生成
用 torchrun 从已有 checkpoint 启动生成脚本;1 张卡时 tp、pp 都设为 1。
torchrun --nproc_per_node=1 run_generate.py --ckpt-path checkpoints/{checkpoint_number}/ --tp 1 --pp 1| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--ckpt-path | 是 | 指定要加载的 checkpoint 目录路径 | checkpoints/{checkpoint_number}/ |
--tp | 否 | 张量并行度,增大可用多卡加速生成 | 1 |
--pp | 否 | 流水线并行度,超大模型可设更大值 | 1 |
--nproc_per_node | 否 | torchrun 使用的单机进程(GPU)数量 | 1 |
torchrun 命令正常退出且无报错,并输出模型生成的文本结果。
Q:安装 torch 时下载很慢或失败怎么办?
A:README 指定从 https://download.pytorch.org/whl/cu124 索引安装,请保留 --index-url 参数并确认网络可访问该地址。
Q:生成速度慢,怎么加速?
A:README 说明可增大 --tp(张量并行)值,用多张 GPU 加速生成。
Q:模型特别大,显存不够怎么办?
A:README 建议对非常大的模型使用更大的 --pp(流水线并行)值。
Q:运行时提示缺少 datasets、transformers 等模块?
A:说明只装了核心依赖,需补装示例依赖:uv pip install datasets transformers datatrove[io] numba wandb。
Q:uv 出现缓存警告怎么处理?
A:Hugging Face 集群用户可在 .bashrc 中加入 export UV_LINK_MODE=copy 以抑制 uv 的缓存警告。
Megatron-LM、DeepSpeed
nanotron 是模型训练领域的开源项目,由 huggingface 开发,2023 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(2,827)位列前 30%,在模型训练分类的 522 个项目里位列前 15%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源免费,需自行部署。
它主要面向的使用场景是:多机多卡集群上预训练百亿参数级大语言模型。同类可对比的替代方案包括 Megatron-LM、DeepSpeed。
上一篇:halo
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···