
vLLM-metax
让 vLLM 跑在沐曦 GPU 上,国产卡也能高吞吐推理
vLLM-metax 是社区维护的 vLLM 硬件插件,让 vLLM 推理引擎能够在沐曦(MetaX)GPU 上运行。vLLM 是目前主流的高吞吐大模型推理框架,原生主要支持 NVIDIA GPU,而本项目通过实现 vLLM 的硬件插件接口,把沐曦 GPU 接入其调度、KV Cache 管理和 PagedAttention 等核心机制中,解决国产 GPU 用户无法直接使用 vLLM 的问题。核心能力包括:适配沐曦 GPU 的算子与显存管理、支持主流大模型的高效推理、复用 vLLM 的连续批处理和分页注意力等优化。项目由社区维护,属于早期阶段,适合需要在沐曦硬件上部署大模型推理、又希望沿用 vLLM 生态的开发者评估使用。
开源
free
基础设施
GitHub 星标
★ 174
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类基础设施
开发团队MetaX-MACA
所属国家
定价模式free
价格说明开源免费,遵循Apache 2.0许可证
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 174
30天Star增速
HF 下载量
上线时间2025-06-19 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 复用 vLLM 的 PagedAttention 与连续批处理,沐曦 GPU 上可获得接近原生的高吞吐推理能力
- 以插件形式接入,不 fork 主仓库,能跟随 vLLM 上游版本迭代
- 面向国产 GPU 生态,为沐曦硬件用户提供了一条低成本迁移现有 vLLM 工作流的路径
不足之处
- 星标仅 173,社区规模小,问题响应和长期维护存在不确定性
- 仅支持沐曦单一硬件平台,通用性和文档完善度待观察
适用场景
- 在沐曦 GPU 服务器上部署大模型推理服务
- 将已有基于 vLLM 的推理代码迁移到国产算力平台
- 对国产 GPU 推理吞吐和显存效率做基准测试与调优
替代项目
vLLM、SGLang
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···