vllm

同一个模型跑出几倍速度,机器成本省一半

面向 LLM 的高吞吐、内存高效的推理与 serving 引擎,支持 PagedAttention 等核心技术,是大规模模型部署与在线服务的事实标准之一。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 92444
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队vllm-project
所属国家
官网地址https://vllm.ai
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型amd,blackwell,cuda,deepseek,deepseek-v3,gpt,gpt-oss,inference,kimi,llama,llm,llm-serving,model-serving,moe,openai,pytorch,qwen,qwen3,tpu,transformer
GitHub 星标★ 92444
30天Star增速
HF 下载量
上线时间2023-02-09 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数18

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(README 未指定具体版本,详见官方 Installation 文档)
  • 已安装 uv(README 推荐)或 pip 包管理器
  • 满足 LLM 推理的硬件/驱动环境(具体要求见官方安装文档)

安装与启动步骤

  1. 1准备环境

    确认本机已有 Python 及包管理器。README 推荐使用 uv 安装,uv 的获取方式见其官方文档;没有 uv 也可直接用 pip。

  2. 2用 uv 安装 vLLM

    README 推荐方式。在目标 Python 环境中执行,安装完成后即可在代码中调用 vLLM 库。

    uv pip install vllm
  3. 3用 pip 安装 vLLM

    与 uv 方式二选一即可,README 明确说明两者都能完成安装。请勿重复混装同一环境。

    pip install vllm
  4. 4源码构建(可选)

    仅开发或定制需要。README 未给出具体构建命令,只提供了官方 build from source 文档链接,请按其说明操作。

  5. 5按 Quickstart 上手

    README 指向官方快速上手文档,按其步骤加载模型并发起推理请求,即可开始使用。

如何确认成功

安装命令无报错完成后,按官方 Quickstart 文档加载模型并成功发出一次推理请求,即表示环境可用。

常见问题

Q:应该用 uv 还是 pip 安装?

A:README 推荐 uv(uv pip install vllm),同时说明也可以用 pip 安装,两者选一种即可,效果等价。

Q:想从源码构建怎么办?

A:README 只给出官方 Installation 文档中 build from source 的链接,需按该文档在对应 GPU 环境下的步骤构建 wheel。

Q:支持哪些模型?

A:README 提供了官方 Supported Models 文档链接,具体支持的模型列表请以该文档为准。

Q:安装后怎么开始用?

A:README 提供 Quickstart 与 Installation 文档链接,按其步骤完成环境准备与首次推理调用。

注意事项

  • 本次 README 节选只包含安装方式,未给出启动服务命令、端口、参数或 Docker 用法,请以官方文档 docs.vllm.ai 为准。
  • 官方推荐使用 uv 安装;使用 pip 安装时注意不要与 uv 混用导致依赖冲突。
  • 项目官网为 https://vllm.ai,完整文档为 https://docs.vllm.ai,遇到问题可查阅这两处。

核心亮点

  • 吞吐量极高,通过PagedAttention和连续批处理等优化,显著提升LLM推理效率
  • 内存效率出色,支持KV Cache量化、张量并行等技术,降低显存占用
  • 兼容性广泛,支持多种主流模型(如Llama、DeepSeek、GPT-OSS等)和硬件(CUDA、AMD、Blackwell)

不足之处

  • 文档/社区待观察
  • 对非NVIDIA硬件(如AMD)的支持可能不如CUDA成熟,部分特性受限

适用场景

  • 大规模LLM在线服务,如聊天机器人、API后端
  • 高并发推理场景,如批量生成、实时响应
  • 研究实验中的高效模型评估与部署

替代项目

TensorRT-LLM、TGI (Text Generation Inference)、llama.cpp

项目介绍

vllm 是基础设施领域的开源项目,由 vllm-project 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(92,444)位列前 1%,在基础设施分类的 1,130 个项目里位列前 1%。

近 44 天,它的 GitHub 星标从 88,597 增加到 92,444,净增 3,847。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:大规模LLM在线服务,如聊天机器人、API后端。同类可对比的替代方案包括 TensorRT-LLM、TGI (Text Generation Inference)、llama.cpp。

上一篇:ollama

下一篇:headroom

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09