
vLLM-Moet
消费级 Blackwell 上跑 2-bit MoE,画质对齐官方 FP4
vLLM-Moet 是一个面向消费级 Blackwell 显卡(SM120)的 vLLM 补丁项目,核心目标是在显存有限的硬件上高效运行大规模 MoE 模型。它通过手写 SM120 SASS 内核实现 2-bit MoE 专家权重的低比特推理,并额外引入一个 FP4 的“delta”缓存来补偿量化损失,从而在消费级显卡上达到与官方 NVFP4 检查点相当的质量。项目解决的是 MoE 模型在消费级硬件上显存占用过高、难以部署的问题,让用户无需数据中心级 GPU 也能跑动大参数 MoE 模型。技术栈以 Sass 汇编为主,说明其优化深入到指令级,属于偏底层、偏硬核的推理加速方案。当前星标约 541,属于早期项目,适合关注低比特推理、MoE 部署和 Blackwell 架构优化的开发者参考和试验。
项目数据
使用教程
核心亮点
- 手写 SM120 SASS 内核,针对消费级 Blackwell 做指令级优化,而非通用 CUDA 实现
- 用 FP4 delta 缓存补偿 2-bit 量化误差,官方称质量可对齐 NVFP4 检查点
- 以 vLLM 补丁形式提供,可直接接入现有 vLLM 推理流程,迁移成本较低
不足之处
- 仅面向 SM120 消费级 Blackwell,硬件覆盖面窄,其他架构无法直接受益
- 项目早期、星标少,内核维护和后续兼容性依赖作者持续投入
适用场景
- 在 RTX 50 系消费卡上本地部署大 MoE 模型做推理
- 研究低比特量化与 SASS 内核优化的工程实践
- 为 vLLM 生态补充消费级 Blackwell 的 MoE 加速方案
替代项目
llama.cpp、TensorRT-LLM、SGLang
项目介绍
上一篇:vLLM-metax
下一篇:ClawManager
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···