BigMoeOnEdge

12GB 手机纯 CPU 跑超内存 MoE 大模型,无损不降智

BigMoeOnEdge 是一个让 MoE(混合专家)大模型跑在内存不足设备上的推理方案,核心思路是流式加载专家权重:模型的总参数量可以远超设备 RAM,但每次前向只把当前 token 命中的少数专家从磁盘读入内存,其余权重留在存储里。项目基于原生 llama.cpp 实现,不修改量化格式,因此输出与全量加载时一致,属于无损推理。官方演示在仅 12 GB 内存的安卓手机上,纯 CPU 运行前沿规模的 MoE 模型(如 Gemma、Qwen、GPT-OSS 系列 GGUF),无需 GPU、无需云端。它解决的是边缘设备内存墙问题:传统做法要么裁剪模型、要么降精度,而它靠 IO 换内存,让手机也能体验大 MoE 的能力。适合想在本机跑大模型、又受限于内存的开发者与极客。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 580
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队Helldez
所属国家
官网地址
定价模式free
价格说明开源免费,基于llama.cpp,需自行部署
访问状态
是否开源
开源协议Apache-2.0
主要语言C++
技术栈/模型android,cpp,edge-ai,gemma,gguf,gpt-oss,inference,llama-cpp,llm,mixture-of-experts,moe,on-device-ai,qwen
GitHub 星标★ 580
30天Star增速
HF 下载量
上线时间2026-07-10 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 基于原生 llama.cpp,不改 GGUF 格式,输出与全量加载无损一致
  • 12GB 内存安卓手机纯 CPU 即可运行前沿规模 MoE,无需 GPU 与云端
  • 按 token 命中专家流式加载,用磁盘 IO 换内存,突破 RAM 上限

不足之处

  • 依赖存储读取速度,专家频繁换入换出时推理速度会明显下降
  • 目前偏工程验证与演示,缺少成熟的上层应用与易用封装

适用场景

  • 在内存有限的安卓手机上本地体验大 MoE 模型对话
  • 无 GPU 的边缘设备或嵌入式盒子部署本地大模型
  • 隐私敏感场景下完全离线、不联网的端侧推理

替代项目

llama.cpp、PowerInfer、ktransformers

项目介绍

BigMoeOnEdge 是一个基础设施领域的开源项目,官方简介:Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp。项目使用 C++ 开发,在 GitHub 上获得 568 星标。

上一篇:rkllama

下一篇:bc250

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09