worker-vllm

在 Runpod 上一键部署 vLLM 推理端点,按需用 GPU

worker-vllm 是 Runpod 官方提供的 Serverless Worker 模板,用于在 Runpod 平台上部署基于 vLLM 的大语言模型推理端点。它把 vLLM 的高吞吐推理能力与 Runpod 的按需 GPU 调度结合起来,用户只需构建镜像并配置模型名称、张量并行度等环境变量,即可获得兼容 OpenAI 接口的推理服务。项目解决了自建 LLM 服务时环境配置繁琐、GPU 资源闲置、扩缩容困难等问题,核心能力包括:支持 HuggingFace 模型自动下载与缓存、支持张量并行和多卡推理、内置 OpenAI 兼容 API、可对接 Runpod 的队列与自动伸缩机制,并允许通过环境变量调整显存占用、最大上下文长度等参数。适合需要快速上线模型推理、又不想长期维护 GPU 集群的团队。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 466
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队runpod-workers
所属国家
官网地址
定价模式free
价格说明开源免费,部署于Runpod平台
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型language-model,llm,runpod,vllm
GitHub 星标★ 466
30天Star增速
HF 下载量
上线时间2023-07-03 00:00:00
最近更新2026-09-11 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 与 Runpod Serverless 深度集成,支持自动扩缩容和按请求计费,空闲时不占用 GPU
  • 内置 OpenAI 兼容接口,现有客户端无需改造即可迁移
  • 通过环境变量即可配置模型、张量并行、显存比例等,部署流程标准化

不足之处

  • 强绑定 Runpod 平台,无法直接迁移到其他云或本地环境
  • 项目定位为模板,功能相对基础,缺少高级路由、鉴权、监控等生产级能力

适用场景

  • 在 Runpod 上快速搭建 LLM 推理 API 供内部应用调用
  • 为突发流量场景提供按需伸缩的模型推理服务
  • 低成本试验不同开源大模型的推理效果

替代项目

vLLM、TGI、Ollama

项目介绍

worker-vllm 是一个基础设施领域的开源项目,官方简介:The Runpod worker template for serving our large language model endpoints. Powered by vLLM.。项目使用 Python 开发,在 GitHub 上获得 466 星标。

上一篇:FlagGems

下一篇:LiteRT-LM

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09