PaddleNLP

一站式搞定NLP大模型与小模型,从训练到部署全流程提速

PaddleNLP 是百度飞桨生态下的自然语言处理库,定位为易用且强大的大模型与小模型库,内置丰富的模型动物园。它解决从文本分类、序列标注到大规模预训练模型微调与部署的全流程问题,提供统一API、高性能分布式训练和推理优化。核心能力包括:支持LLaMA、ChatGLM等主流大模型的加载、微调(LoRA/ Prefix Tuning)、动态图推理;内置ERNIE系列中文预训练模型;提供数据增强、模型压缩(量化/剪枝)和端侧部署工具。其设计兼顾学术研究与工业落地,降低NLP开发门槛。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 12977
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队PaddlePaddle
所属国家
官网地址
定价模式free
价格说明开源库,Apache-2.0许可,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型bert,compression,distributed-training,document-intelligence,embedding,ernie,information-extraction,llama,llm,neural-search,nlp,paddlenlp,pretrained-models,question-answering,search-engine,semantic-analysis,sentiment-analysis,transformers,uie
GitHub 星标★ 12977
30天Star增速
HF 下载量
上线时间2021-02-05 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3.7 及以上
  • 支持 Linux / Windows / macOS 操作系统
  • 已安装可用的 pip 包管理工具
  • (运行大模型预训练示例时)需要具备对应模型的训练环境与数据

安装与启动步骤

  1. 1安装PaddleNLP

    README 给出的正式安装方式,安装 3.0.0b4 版本;建议在独立虚拟环境中执行,避免依赖冲突。

    pip install --upgrade paddlenlp==3.0.0b4
  2. 2安装开发版

    如需要最新 develop 分支代码,改用此命令,通过飞桨官方 wheel 源安装预发布版本。

    pip install --pre --upgrade paddlenlp -f https://www.paddlepaddle.org.cn/whl/paddlenlp.html
  3. 3确认Python版本

    README 要求 Python 3.7+,执行前先确认当前解释器版本满足要求,不满足需先升级环境。

    python --version
  4. 4运行预训练示例

    README 快速开始给出的预训练启动命令,需在包含 run_pretrain.py 与 config 目录的工程目录下执行。

    python -u run_pretrain.py ./config/qwen/pretrain_argument_0p5b.json
  5. 5安装融合算子

    仅当配置中开启 use_fused_rms_norm=true 时才需要,按 README 指引到该目录安装 fused_ln 外部算子。

如何确认成功

执行 pip 安装无报错,且 python 环境中能正常导入 paddlenlp 模块即安装成功。

常见问题

Q:应该装哪个版本?

A:官方 pip 安装为 paddlenlp==3.0.0b4;需要最新开发代码时用 --pre 配合飞桨 wheel 源安装 develop 分支。

Q:需要另外安装 PaddlePaddle 吗?

A:README 未给出 PaddlePaddle 的具体安装命令,仅指向官方文档 docs/zh/get_started/installation.rst,请按该文档安装。

Q:开启 use_fused_rms_norm=true 报错怎么办?

A:README 说明该选项依赖融合算子,需先前往 slm/model_zoo/gpt-3/external_ops 目录安装 fused_ln。

注意事项

  • README 未提供 git clone 命令,运行预训练示例前需自行准备 PaddleNLP 源码工程目录。
  • 预训练配置文件路径 ./config/qwen/pretrain_argument_0p5b.json 为 README 原样示例,实际路径以仓库目录结构为准。
  • 若需安装 PaddlePaddle 本体,请查阅 README 中指向的 Installation 文档。

核心亮点

  • 内置丰富中文预训练模型(如ERNIE),中文任务开箱即用
  • 大模型微调支持LoRA等高效方法,显存占用低
  • 与飞桨深度整合,分布式训练和推理性能优化好

不足之处

  • 生态相比HuggingFace Transformers较小,社区资源待丰富
  • 部分新模型适配滞后,需自行转换权重

适用场景

  • 中文NLP任务快速原型开发与生产部署
  • 大模型领域微调与私有化部署
  • 科研实验中的模型对比与压缩

替代项目

Hugging Face Transformers、ModelScope、OpenPrompt

项目介绍

PaddleNLP 是开发框架领域的开源项目,由 PaddlePaddle 开发,2021 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(12,977)位列前 4%,在开发框架分类的 795 个项目里位列前 5%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。开源库,Apache-2.0许可,完全免费,可自行部署使用。

它主要面向的使用场景是:中文NLP任务快速原型开发与生产部署。同类可对比的替代方案包括 Hugging Face Transformers、ModelScope、OpenPrompt。

上一篇:awesome-ai-apps

下一篇:FlagEmbedding

同类项目推荐

langchain 开源

组装 AI 应用的乐高积木,从想法到上线不换工具

The agent engineering platform.

★ 146874 2026-08-09
transformers 开源

全球最大的模型仓库全家桶,想用的模型一把抓

Transformers: the model-definition framework for state-of-the-art machine learning m···

★ 166529 2026-08-09
pi 开源

一套 TypeScript 工具包,快速搭出能写代码的 AI agent

AI agent toolkit: unified LLM API, agent loop, TUI, coding agent CLI

★ 108504 2026-09-12