
vLLM-Kunlun
让昆仑芯 XPU 直接跑起 vLLM 大模型推理服务
vLLM-Kunlun 是一个社区维护的 vLLM 硬件插件,目标是让 vLLM 推理引擎无缝运行在昆仑 XPU 上。vLLM 本身是当前最流行的大模型推理服务框架,凭借 PagedAttention 和连续批处理实现高吞吐、低延迟的 LLM 服务,但它默认只支持 NVIDIA GPU 等少数后端。本项目通过实现 vLLM 的硬件插件接口,把昆仑芯 XPU 接入 vLLM 的执行链路,使国产 AI 加速卡也能直接跑起 vLLM 的推理服务。核心能力包括:对接 vLLM 的模型加载与算子执行、适配昆仑 XPU 的显存管理与计算后端、支持主流开源大模型的推理部署。对于使用昆仑芯硬件、又希望复用 vLLM 生态(OpenAI 兼容 API、量化、多卡并行等)的团队,这个插件省去了从零适配推理框架的工作,是国产算力落地大模型服务的一条现成路径。
项目数据
使用教程
核心亮点
- 复用 vLLM 生态,昆仑 XPU 上可直接获得 PagedAttention、连续批处理等推理优化
- 作为插件形式接入,不改动 vLLM 主干代码,便于跟随上游版本迭代
- 面向国产 AI 加速卡,为使用昆仑芯的团队提供开箱即用的 LLM 部署方案
不足之处
- 项目处于早期,星标和贡献者规模有限,功能完整度与稳定性待验证
- 文档和社区支持相对薄弱,遇到硬件相关问题排查成本可能较高
适用场景
- 在昆仑芯 XPU 服务器上部署开源大模型推理 API 服务
- 国产算力集群中替代 GPU 跑 vLLM 推理,降低对英伟达依赖
- 需要 OpenAI 兼容接口、又必须用昆仑芯硬件的企业私有化部署
替代项目
vLLM、SGLang
项目介绍
上一篇:llm-scaler
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···