ram-coffers

用二手 POWER8 服务器,让 LLM 推理提速 8.8 倍,省下云账单。

ram-coffers 是一个面向 LLM 推理的基础设施优化项目,通过 NUMA 感知的权重银行(weight banking)技术,在 refurbished 企业级 POWER8 服务器上实现了 147 tokens/秒的推理速度,相比原生 llama.cpp 提升 8.8 倍。该项目旨在降低自托管推理的成本,避免依赖云 API,属于 Proof of Physical AI 技术栈的一部分。其核心能力包括:利用 NUMA 架构优化内存访问模式,提升推理吞吐;支持边缘 AI 和去中心化物理基础设施(DePIN)场景;强调能效和成本优化,适合在二手硬件上部署。项目用 Python 实现,与 llama.cpp 生态兼容,但当前处于早期阶段,文档和社区支持尚待完善。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 160
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队Scottcjn
所属国家
定价模式free
价格说明开源项目,免费使用,需自行部署
访问状态
是否开源
开源协议AGPL-3.0
主要语言Python
技术栈/模型ai-inference,ai-infrastructure,cost-optimization,depin,edge-ai,energy-efficiency,hebbian,inference-optimization,llama-cpp,llm,llm-inference,llmops,numa,power8,powerpc,ppc64le,proof-of-physical-ai,self-hosted,transformer,vec-perm
GitHub 星标★ 160
30天Star增速
HF 下载量
上线时间2026-01-19 00:00:00
最近更新2026-08-20 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-21
浏览次数1

核心亮点

  • 实测推理速度 147 t/s,比原生 llama.cpp 快 8.8 倍,性能提升显著
  • 利用二手企业级硬件,大幅降低自托管推理的硬件成本
  • NUMA 感知优化,针对多路服务器内存访问模式深度调优

不足之处

  • 依赖特定 POWER8 架构,通用 x86 服务器上无法直接复现性能
  • 文档/社区待观察:早期项目,使用教程和生态支持尚不完善

适用场景

  • 在二手企业级服务器上自托管 LLM 推理服务,降低基础设施开支
  • 边缘计算场景,需在本地或去中心化节点上运行推理,避免云依赖
  • 对推理延迟和吞吐有高要求的批量处理任务,如批量文本生成

替代项目

llama.cpp、vLLM、TGI (Hugging Face Text Generation Inference)

项目介绍

ram-coffers 是一个基础设施领域的开源项目,官方简介:LLM infrastructure cost reduction via NUMA-aware weight banking: 147 t/s (8.8x stock llama.cpp) on refurbished enterprise POWER8. Self-hosted inference, no cloud APIs. Part of the Proof of Physical AI stack.。项目使用 Python 开发,在 GitHub 上获得 160 星标。

上一篇:floe-guard

下一篇:没有了!

同类项目推荐

ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma ···

★ 179045 2026-08-09
OpenMemory 开源

AI 工具共用一份记忆,关掉重开照样记得你

Local persistent memory store for LLM applications including claude desktop, github ···

★ 4456 2026-08-09
litellm 开源

一个网关接入所有大模型,告别接口乱、成本散、监控难

The fastest, litest AI Gateway. Rust core with Python SDK. Call 100+ LLM APIs in Ope···

★ 56848 2026-08-09
vllm 开源

同一个模型跑出几倍速度,机器成本省一半

A high-throughput and memory-efficient inference and serving engine for LLMs

★ 89545 2026-08-09