MoE-Infinity 是基础设施领域的开源项目,由 EfficientMoE 开发,2024 年首次发布。
它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 363。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源库,Apache-2.0许可证,完全免费,无付费版本。
它主要面向的使用场景是:在单张消费级GPU上部署Mixtral等MoE模型。同类可对比的替代方案包括 vLLM、DeepSpeed-MoE、SGLang。

把 MoE 大模型塞进小显存,推理快还省钱
MoE-Infinity 是一个基于 PyTorch 的开源库,旨在高效、低成本地服务混合专家(MoE)大语言模型。它解决了 MoE 模型因参数量巨大、推理时显存占用高、部署成本昂贵的问题,通过稀疏专家卸载和异步预取技术,在有限 GPU 显存下实现快速推理。核心能力包括:将不活跃的专家参数卸载到 CPU/SSD,按需动态加载;支持多 GPU 并行和流水线调度;提供简单易用的 API,兼容 HuggingFace 模型。适用于单卡或多卡环境,显著降低 MoE 模型的部署门槛,适合资源受限的研究和产品场景。
vLLM、DeepSpeed-MoE、SGLang
MoE-Infinity 是基础设施领域的开源项目,由 EfficientMoE 开发,2024 年首次发布。
它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 363。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源库,Apache-2.0许可证,完全免费,无付费版本。
它主要面向的使用场景是:在单张消费级GPU上部署Mixtral等MoE模型。同类可对比的替代方案包括 vLLM、DeepSpeed-MoE、SGLang。
上一篇:xgrammar
下一篇:ai-optimizer
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···