vLLM-Moet

消费级 Blackwell 上跑 2-bit MoE,画质对齐官方 FP4

vLLM-Moet 是一个面向消费级 Blackwell 显卡(SM120)的 vLLM 补丁项目,核心目标是在显存有限的硬件上高效运行大规模 MoE 模型。它通过手写 SM120 SASS 内核实现 2-bit MoE 专家权重的低比特推理,并额外引入一个 FP4 的“delta”缓存来补偿量化损失,从而在消费级显卡上达到与官方 NVFP4 检查点相当的质量。项目解决的是 MoE 模型在消费级硬件上显存占用过高、难以部署的问题,让用户无需数据中心级 GPU 也能跑动大参数 MoE 模型。技术栈以 Sass 汇编为主,说明其优化深入到指令级,属于偏底层、偏硬核的推理加速方案。当前星标约 541,属于早期项目,适合关注低比特推理、MoE 部署和 Blackwell 架构优化的开发者参考和试验。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 540
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队kacper-daftcode
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议Apache-2.0
主要语言Sass
技术栈/模型
GitHub 星标★ 540
30天Star增速
HF 下载量
上线时间2026-06-15 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 手写 SM120 SASS 内核,针对消费级 Blackwell 做指令级优化,而非通用 CUDA 实现
  • 用 FP4 delta 缓存补偿 2-bit 量化误差,官方称质量可对齐 NVFP4 检查点
  • 以 vLLM 补丁形式提供,可直接接入现有 vLLM 推理流程,迁移成本较低

不足之处

  • 仅面向 SM120 消费级 Blackwell,硬件覆盖面窄,其他架构无法直接受益
  • 项目早期、星标少,内核维护和后续兼容性依赖作者持续投入

适用场景

  • 在 RTX 50 系消费卡上本地部署大 MoE 模型做推理
  • 研究低比特量化与 SASS 内核优化的工程实践
  • 为 vLLM 生态补充消费级 Blackwell 的 MoE 加速方案

替代项目

llama.cpp、TensorRT-LLM、SGLang

项目介绍

vLLM-Moet 是一个基础设施领域的开源项目,官方简介:A vLLM patch + hand‑written SM120 SASS kernels: 2‑bit MoE experts + an FP4 "delta" cache that recovers precision — matching the official (NV)FP4 checkpoint's quality on consumer Blackwell cards。项目使用 Sass 开发,在 GitHub 上获得 541 星标。

上一篇:vLLM-metax

下一篇:ClawManager

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09