vllm-ascend

让 vLLM 在昇腾 NPU 上跑起来,无缝用上大模型推理

vllm-ascend 是 vLLM 在华为昇腾(Ascend)硬件上的社区维护插件,旨在让 vLLM 这一主流大模型推理框架能够无缝运行在昇腾 NPU 上。它解决了昇腾用户无法直接使用 vLLM 生态的问题,通过适配层将 vLLM 的算子、内存管理和调度逻辑映射到昇腾 CANN 平台,从而支持高性能的大模型推理。核心能力包括:提供与 vLLM 一致的 API 接口,支持主流大模型(如 Llama、Qwen 等)在昇腾设备上的推理,并利用昇腾的硬件特性进行优化。该项目由华为和社区共同维护,是昇腾 AI 生态中重要的开源组件,帮助开发者降低在昇腾平台上部署大模型的门槛,同时保持与上游 vLLM 的同步更新。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2882
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队vllm-project
所属国家
定价模式free
价格说明开源项目,基于Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ascend,inference,llm,llm-serving,llmops,mlops,model-serving,transformer,vllm
GitHub 星标★ 2882
30天Star增速
HF 下载量
上线时间2025-01-29 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 华为昇腾(Ascend)NPU 硬件环境
  • 已安装与所选版本匹配的昇腾 CANN 驱动与工具包
  • 可访问官方文档站点(docs.vllm.ai/projects/ascend)以获取版本对应的安装命令
  • Python 运行环境(vLLM 及其依赖,具体版本要求见官方 Installation 文档)

安装与启动步骤

  1. 1确认版本对应关系

    先看 Support Matrix,确认自家昇腾硬件、CANN 版本与插件版本的对应关系,再决定装哪个版本。

  2. 2选择发行版本

    v0.23.0 为最新稳定版,v0.26.0rc1 为候选版本;生产环境建议使用稳定版 v0.23.0。

  3. 3按官方文档安装

    打开所选版本对应的 Installation 文档页,按其给出的步骤和命令完成安装,不要混用不同版本的文档。

  4. 4可选:克隆仓库

    如需查看源码、示例或自行构建,可克隆仓库;具体构建参数以官方文档为准。

    git clone https://github.com/vllm-project/vllm-ascend.git
  5. 5运行快速开始

    按所选版本对应的 QuickStart 文档启动服务并发起推理请求,验证插件在昇腾设备上可用。

如何确认成功

按官方 QuickStart 运行示例推理请求,若能正常返回生成结果,说明 vLLM Ascend 插件已成功运行在昇腾 NPU 上。

常见问题

Q:README 里为什么没有具体的安装命令?

A:本项目把安装细节放在官方文档中,README 只给出获取方式。请按所选版本打开对应版本的 Installation 与 QuickStart 页面,照着执行。

Q:应该安装哪个版本?

A:v0.23.0 是当前最新稳定版本,建议优先使用;v0.26.0rc1 为候选版本,适合尝鲜和验证,不建议直接用于生产。

Q:没有昇腾 NPU 设备能安装吗?

A:本项目是 vLLM 在昇腾硬件上的插件,README 未说明可在无昇腾设备的环境使用,请先准备昇腾 NPU 及匹配的 CANN 环境。

Q:安装或使用中遇到问题去哪里问?

A:可加入 Slack 频道 #SIG-Ascend,或在 vLLM 用户论坛的 vLLM Ascend Support 版块提问,也可参加每周例会。

注意事项

  • README 未提供任何具体安装命令、端口或路径,实际安装步骤必须以官方文档对应版本页面为准,不要照抄其他版本的操作。
  • 插件版本、vLLM 版本与 CANN 版本需要匹配,安装前务必查看支持矩阵(Support Matrix)。
  • 不同发行版本(v0.23.0 与 v0.26.0rc1)对应不同的文档地址,请确保文档版本与实际安装版本一致。

核心亮点

  • 直接复用 vLLM 生态,API 兼容,迁移成本低
  • 针对昇腾硬件深度优化,发挥 NPU 算力
  • 社区活跃,与上游 vLLM 同步更新

不足之处

  • 依赖特定昇腾硬件和 CANN 版本,环境配置复杂
  • 部分高级特性(如某些量化、投机采样)可能滞后于上游

适用场景

  • 在华为昇腾服务器上部署大模型推理服务
  • 企业私有化部署,利用现有昇腾算力
  • 开发基于昇腾的 LLM 应用,需要 vLLM 兼容接口

替代项目

vllm-cpu、vllm-rocm、TensorRT-LLM

项目介绍

vllm-ascend 是基础设施领域的开源项目,由 vllm-project 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,882)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,612 增加到 2,882,净增 270。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。基于Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:在华为昇腾服务器上部署大模型推理服务。同类可对比的替代方案包括 vllm-cpu、vllm-rocm、TensorRT-LLM。

上一篇:evadb

下一篇:yek

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09