serve

一键部署 PyTorch 模型,自动扩缩容,生产级推理服务

Serve 是一个用于在生产环境中部署、优化和扩展 PyTorch 模型的开源基础设施项目。它解决了将训练好的 PyTorch 模型高效、稳定地服务化的问题,提供了模型加载、推理请求处理、自动扩缩容等核心能力。尽管项目简介强调 PyTorch,但其技术栈为 Java,可能通过集成或封装方式支持 PyTorch 模型。Serve 旨在简化模型上线流程,提升推理性能,并支持动态调整资源以应对不同负载。其核心能力包括模型版本管理、多模型部署、请求路由、监控与日志等,适合需要大规模模型服务的场景。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4344
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队pytorch
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可自由使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Java
技术栈/模型cpu,deep-learning,docker,gpu,kubernetes,machine-learning,metrics,mlops,optimization,pytorch,serving
GitHub 星标★ 4344
30天Star增速
HF 下载量
上线时间2019-10-03 00:00:00
最近更新2026-09-06 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 7 步

环境要求

  • Python >= 3.8
  • 已安装 pip 或 conda
  • 如需 GPU 加速:CUDA(如 cu121)或 ROCm(如 rocm61)环境
  • 部署 LLM 需要 Hugging Face 账号并登录,且机器具备 GPU(Docker 方式需 --gpus all)

安装与启动步骤

  1. 1获取项目源码

    README 中的安装脚本位于仓库内,需先克隆代码并在仓库根目录执行后续命令。

    git clone https://github.com/pytorch/serve.git
    cd serve
  2. 2安装基础依赖

    在仓库根目录运行自带的依赖安装脚本,Python 版本需不低于 3.8。

    python ./ts_scripts/install_dependencies.py
  3. 3安装加速器依赖

    需要 GPU 支持时,按硬件选择对应标志安装;NVIDIA 用 cuda,AMD 用 rocm,二选一。

    python ./ts_scripts/install_dependencies.py --cuda=cu121
  4. 4安装 TorchServe

    通过 pip 安装最新 release 的三个核心包;nightly 版本可改用 torchserve-nightly 系列包。

    pip install torchserve torch-model-archiver torch-workflow-archiver
  5. 5登录 Hugging Face

    部署 LLM 前必须先登录,否则无法拉取 meta-llama 等受限模型权重。

    huggingface-cli login
  6. 6启动 LLM 服务

    用 ts.llm_launcher 启动本地 LLM 推理服务,示例使用 Llama-3.2-3B-Instruct。

    python -m ts.llm_launcher --model_id meta-llama/Llama-3.2-3B-Instruct --disable_token_auth
  7. 7Docker 方式部署

    先构建 vLLM 镜像,再挂载 data 卷并以 GPU 启动;token 通过环境变量传入。

    export token=hf_xxxxxxxx
    docker build --pull . -f docker/Dockerfile.vllm -t ts/vllm
    docker run --rm -ti --shm-size 10g --gpus all -e HUGGING_FACE_HUB_TOKEN=$token -p 8080:8080 -v data:/data ts/vllm --model_id meta-llama/Meta-Llama-3-8B-Instruct --disable_token_auth

关键配置

配置项必填说明示例
--model_id是指定要部署的 Hugging Face 模型 ID。meta-llama/Llama-3.2-3B-Instruct
--disable_token_auth否关闭默认开启的 token 授权,便于本地调试。--disable_token_auth
--engine否指定推理引擎,如 TensorRT-LLM。trt_llm
HUGGING_FACE_HUB_TOKEN否Docker 运行时传入的 Hugging Face 访问令牌。hf_xxxxxxxx
-p 8080:8080否Docker 端口映射,服务监听 8080 端口。-p 8080:8080

如何确认成功

服务监听 8080 端口后,执行 curl http://127.0.0.1:8080/predictions/bert -T input.txt,能返回推理结果即部署成功。

常见问题

Q:启动时提示需要 token 授权怎么办?

A:TorchServe 现已默认开启 token 授权,本地调试可在启动命令后加 --disable_token_auth;生产环境请参考官方 token authorization 文档配置令牌。

Q:如何启用 GPU 加速?

A:安装依赖时加 --cuda=cu121(NVIDIA)或 --rocm=rocm61(AMD);Docker 方式则在 docker run 中加入 --gpus all。

Q:下载 Hugging Face 模型失败?

A:先执行 huggingface-cli login 完成登录;Docker 方式需通过 -e HUGGING_FACE_HUB_TOKEN=$token 传入有效令牌,并确认账号已获得模型访问权限。

Q:项目还在维护吗?

A:README 明确说明该项目已不再积极维护,现有 release 仍可用,但没有计划内的更新、bug 修复、新功能或安全补丁,漏洞可能不会被处理。

注意事项

  • README 顶部公告:项目已停止积极维护,使用前请自行评估安全风险。
  • 安全默认值已变更:token 授权默认开启、Model API control 默认关闭,生产部署需按官方文档调整。
  • README 节选中 Docker、conda 章节内容为空或截断,nightly 安装命令也不完整,具体细节请查阅官网 https://pytorch.org/serve 与 GitHub 文档。
  • LLM 部署示例依赖 Hugging Face 登录与 GPU,且需自行准备 input.txt 等测试输入。

核心亮点

  • 专注于 PyTorch 模型的生产级部署,针对性强
  • 提供自动扩缩容能力,适应动态负载
  • 集成监控与日志,便于运维管理

不足之处

  • 技术栈为 Java,与 PyTorch 生态的 Python 环境集成可能复杂
  • 文档/社区待观察

适用场景

  • 大规模 PyTorch 模型在线推理服务
  • 需要动态资源调整的模型服务场景
  • 多模型统一管理与路由

替代项目

TorchServe、Ray Serve、MLflow Models

项目介绍

serve 是基础设施领域的开源项目,由 pytorch 开发,2019 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,344)位列前 10%,在基础设施分类的 1,130 个项目里位列前 15%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-06。Apache-2.0许可证,可自由使用,无付费版本。

它主要面向的使用场景是:大规模PyTorch模型在线推理服务。同类可对比的替代方案包括 TorchServe、Ray Serve、MLflow Models。

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09