
PaddleFormers
在飞桨上跑通大模型微调与训练,开箱即用
PaddleFormers 是百度飞桨(PaddlePaddle)生态下的大模型训练与工具库,定位为易用的大语言模型预训练模型仓库。它把主流开源大模型(如 Llama、Qwen、DeepSeek 等系列)的权重、训练脚本和推理流程统一到 PaddlePaddle 框架中,解决国内开发者在国产深度学习框架上做模型微调、继续预训练和部署时缺少现成工具链的问题。核心能力包括:一键加载预训练权重、支持全量微调与 LoRA 等高效微调、分布式训练(数据并行/张量并行/流水并行)、训练与推理精度对齐,以及配套的数据处理和评估脚本。项目提供中文文档和示例,适合希望脱离 PyTorch 生态、在飞桨上完成大模型训练闭环的团队使用。
项目数据
使用教程
环境要求
- Python ≥ 3.12(安装章节实际支持 python 3.10~3.13)
- CUDA ≥ 13.0(官方镜像同时提供 cuda12.6 / cuda12.9 / cuda13.0 版本)
- PaddleFleet ≥ 0.3(仅 GPU 训练功能需要)
- 操作系统:Linux 或 Windows
- 使用容器方式时需要 Docker 与 NVIDIA 显卡驱动(--gpus all)
安装与启动步骤
-
1Docker 方式(推荐)
用官方预置镜像起容器,镜像内已克隆 PaddleFormers 仓库并完成安装,避免本地环境冲突。按显卡选择 cuda12.6/12.9/13.0 镜像标签。
docker run --gpus all --name paddleformers-work -v $(pwd):/work -w=/work --shm-size=512G --network=host -it ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddle:3.3.0-gpu-cuda12.6-cudnn9.5 /bin/bash -
2创建虚拟环境
不使用 Docker 时,推荐先用 conda / venv / uv 隔离 Python 环境,再安装依赖。以下以 conda 为例。
conda create -n paddleformers-work python=3.10 conda activate paddleformers-work -
3源码安装
克隆仓库后以可编辑模式安装,并附带 paddlefleet 依赖;按实际 CUDA 版本替换命令中的 cu126 索引地址。
git clone https://github.com/PaddlePaddle/PaddleFormers.git cd PaddleFormers python -m pip install -e '.[paddlefleet]' --extra-index-url https://www.paddlepaddle.org.cn/packages/nightly/cu126/ --extra-index-url https://www.paddlepaddle.org.cn/packages/stable/cu126/ -
4pip 直接安装
不想拉取源码时,可直接从 pip 安装 PaddleFormers 与 PaddleFleet,同样需按 CUDA 版本选择索引地址。
python -m pip install "paddleformers[paddlefleet]" --extra-index-url https://www.paddlepaddle.org.cn/packages/stable/cu126/ -
5轻量安装 tokenizer
如果只使用 tokenizer 或 processor,可只装基础包,不安装训练相关依赖,安装速度更快。
python -m pip install paddleformers
如何确认成功
安装或 docker run 命令无报错,进入容器/虚拟环境后执行 python -c "import paddleformers" 能正常导入即成功。
常见问题
Q:环境依赖写 Python ≥ 3.12,但示例用 python=3.10,到底用哪个?
A:安装章节说明支持 python 3.10~3.13,示例给出的就是 3.10。建议在该区间内选择,若追求与依赖说明一致可用 3.12 及以上版本。
Q:不同 CUDA 版本怎么安装?
A:替换命令中的索引地址与镜像标签即可:cuda12.6 用 cu126,cuda12.9 用 cu129,cuda13.0 用 cu130,三个版本 README 均已给出。
Q:只用 tokenizer 也要装 PaddleFleet 吗?
A:不需要。PaddleFleet 仅为 GPU 训练功能依赖,直接执行 python -m pip install paddleformers 即可,不会安装训练相关依赖。
Q:昆仑芯、天数智芯、沐曦、摩尔线程等其他硬件怎么装?
A:README 提供了独立的安装说明文档,分别在 docs/zh/XPU_installation_guide.md、ILUVATAR-GPU_installation_guide.md、Metax-GPU_installation_guide.md、MUSA-GPU_installation_guide.md。
注意事项
- Docker 方式被 README 标注为推荐,容器已拉取仓库并完成安装,可直接进入 /work 目录开始工作。
- docker run 使用 --shm-size=512G 与 --network=host,训练大模型时不要随意改小共享内存。
- 官方镜像标签为 paddle:3.3.0-gpu-cuda12.6-cudnn9.5,另有 cuda12.9-cudnn9.9 与 cuda13.0-cudnn9.13 可选。
- 命令示例中统一以 cuda12.6(cu126)为例,其他版本请按注释替换为 cu129 或 cu130。
核心亮点
- 深度绑定 PaddlePaddle,国产框架用户无需自行移植 PyTorch 训练代码
- 覆盖 Llama、Qwen、DeepSeek 等主流模型,权重与脚本开箱可用
- 支持 LoRA、全量微调及多种并行策略,兼顾单卡与大规模分布式训练
不足之处
- 生态与社区规模远小于 Hugging Face Transformers,第三方扩展和教程较少
- 强依赖 PaddlePaddle,非飞桨用户迁移成本高,跨框架复用性弱
适用场景
- 国内团队在国产算力与飞桨栈上微调开源大模型
- 企业基于 PaddlePaddle 做领域大模型的继续预训练
- 教学或科研中用统一脚本对比不同开源模型的训练效果
替代项目
Hugging Face Transformers、LLaMA-Factory、Megatron-LM
项目介绍
下一篇:Skills
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···