FastDeploy

用飞桨生态,一键部署大模型到生产环境

FastDeploy 是百度飞桨(PaddlePaddle)生态下的高性能推理与部署工具包,专注于大语言模型(LLM)和多模态模型(VLM)的快速部署。它解决了从模型训练到生产环境部署之间的最后一公里问题,提供了统一的推理引擎和部署方案,支持多种主流模型架构(如GPT、LLaMA、ChatGLM等)的量化、剪枝和优化,并能在CPU、GPU、NPU等异构硬件上高效运行。核心能力包括:一键式模型转换与部署、高性能推理内核(集成TensorRT、OpenVINO等)、丰富的预置模型库、以及灵活的Python和C++ API,使得开发者可以快速将模型集成到实际业务中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3719
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队PaddlePaddle
所属国家
定价模式free
价格说明开源项目,基于Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ernie,ernie-45,ernie-45-vl,inference,llm,llm-serving,openai,serving,vllm
GitHub 星标★ 3719
30天Star增速
HF 下载量
上线时间2022-06-27 00:00:00
最近更新2026-09-21 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 操作系统:Linux(README 徽章标注 os-linux)
  • Python 版本:3.10(README 徽章标注 python-3.10)
  • 支持的推理硬件之一:英伟达 GPU、昆仑芯 XPU、天数 GPU、燧原 GCU、海光 DCU、沐曦 GPU、英特尔 Gaudi
  • 能够访问 GitHub 与 FastDeploy 官方文档站点以下载源码和安装说明

安装与启动步骤

  1. 1确认硬件是否支持

    先看 README 安装章节的支持列表,确认自己的加速卡在其中,再选对应文档。

  2. 2准备软硬件环境

    README 徽章标明需 Linux 系统与 Python 3.10,请提前装好对应环境。

  3. 3获取项目源码

    从官方仓库克隆代码到本地,后续按文档在源码目录中执行安装。

    git clone https://github.com/PaddlePaddle/FastDeploy.git
    cd FastDeploy
  4. 4打开对应安装文档

    按硬件打开 docs/zh/get_started/installation 下的安装文档,不要混用其他硬件步骤。

  5. 5按文档完成安装

    严格照所选硬件文档给出的安装命令执行,README 未给出可直接复制的命令。

如何确认成功

按所选硬件安装文档执行其中的示例推理流程,能正常输出结果即说明安装成功。

常见问题

Q:FastDeploy 支持哪些硬件部署?

A:README 安装章节列出:英伟达 GPU、昆仑芯 XPU、天数 CoreX、燧原 S60、海光 DCU、沐曦 GPU、英特尔 Gaudi。

Q:为什么 README 里没有安装命令?

A:README 只给出各硬件的安装文档链接,具体安装命令需到 docs/zh/get_started/installation 对应文档或官网查看。

Q:对 Python 和系统有什么要求?

A:README 上方的徽章显示 Python 3.10、操作系统为 Linux,建议按此准备环境。

Q:安装文档在哪里看?

A:仓库内 docs/zh/get_started/installation 目录,或官网安装指导页 https://paddlepaddle.github.io/FastDeploy/zh/get_started/installation/nvidia_gpu/ 。

注意事项

  • 本教程基于 README 节选编写,README 未提供可直接执行的安装命令,务必以官方各硬件安装文档为准。
  • 不同加速卡的安装流程互不通用,请只选择与自己硬件匹配的那一份文档。
  • 项目涉及 CUDA、驱动等底层依赖,安装前建议先确认显卡驱动与加速卡软件栈版本。

核心亮点

  • 深度整合PaddlePaddle,对飞桨模型支持极佳,转换部署无缝衔接
  • 内置TensorRT、OpenVINO等多后端加速,推理性能优化显著
  • 提供Python和C++双API,覆盖研究和工程化场景

不足之处

  • 文档偏重飞桨生态,对非Paddle用户有一定学习成本
  • 社区规模相比vLLM等较小,第三方贡献和问题解答待观察

适用场景

  • 基于飞桨训练的模型快速上线服务
  • 在国产芯片(如昇腾、寒武纪)上部署大模型
  • 需要高吞吐、低延迟的LLM推理服务

替代项目

vLLM、Triton Inference Server、ONNX Runtime

项目介绍

FastDeploy 是基础设施领域的开源项目,由 PaddlePaddle 开发,2022 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,719)位列前 30%,在基础设施分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。基于Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:基于飞桨训练的模型快速上线服务。同类可对比的替代方案包括 vLLM、Triton Inference Server、ONNX Runtime。

上一篇:gigatoken

下一篇:basic-memory

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09