
BigMoeOnEdge
12GB 手机纯 CPU 跑超内存 MoE 大模型,无损不降智
BigMoeOnEdge 是一个让 MoE(混合专家)大模型跑在内存不足设备上的推理方案,核心思路是流式加载专家权重:模型的总参数量可以远超设备 RAM,但每次前向只把当前 token 命中的少数专家从磁盘读入内存,其余权重留在存储里。项目基于原生 llama.cpp 实现,不修改量化格式,因此输出与全量加载时一致,属于无损推理。官方演示在仅 12 GB 内存的安卓手机上,纯 CPU 运行前沿规模的 MoE 模型(如 Gemma、Qwen、GPT-OSS 系列 GGUF),无需 GPU、无需云端。它解决的是边缘设备内存墙问题:传统做法要么裁剪模型、要么降精度,而它靠 IO 换内存,让手机也能体验大 MoE 的能力。适合想在本机跑大模型、又受限于内存的开发者与极客。
开源
free
基础设施
GitHub 星标
★ 580
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类基础设施
开发团队Helldez
所属国家
定价模式free
价格说明开源免费,基于llama.cpp,需自行部署
访问状态
是否开源是
开源协议Apache-2.0
主要语言C++
技术栈/模型android,cpp,edge-ai,gemma,gguf,gpt-oss,inference,llama-cpp,llm,mixture-of-experts,moe,on-device-ai,qwen
GitHub 星标★ 580
30天Star增速
HF 下载量
上线时间2026-07-10 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 基于原生 llama.cpp,不改 GGUF 格式,输出与全量加载无损一致
- 12GB 内存安卓手机纯 CPU 即可运行前沿规模 MoE,无需 GPU 与云端
- 按 token 命中专家流式加载,用磁盘 IO 换内存,突破 RAM 上限
不足之处
- 依赖存储读取速度,专家频繁换入换出时推理速度会明显下降
- 目前偏工程验证与演示,缺少成熟的上层应用与易用封装
适用场景
- 在内存有限的安卓手机上本地体验大 MoE 模型对话
- 无 GPU 的边缘设备或嵌入式盒子部署本地大模型
- 隐私敏感场景下完全离线、不联网的端侧推理
替代项目
llama.cpp、PowerInfer、ktransformers
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···