
ram-coffers
用二手 POWER8 服务器,让 LLM 推理提速 8.8 倍,省下云账单。
ram-coffers 是一个面向 LLM 推理的基础设施优化项目,通过 NUMA 感知的权重银行(weight banking)技术,在 refurbished 企业级 POWER8 服务器上实现了 147 tokens/秒的推理速度,相比原生 llama.cpp 提升 8.8 倍。该项目旨在降低自托管推理的成本,避免依赖云 API,属于 Proof of Physical AI 技术栈的一部分。其核心能力包括:利用 NUMA 架构优化内存访问模式,提升推理吞吐;支持边缘 AI 和去中心化物理基础设施(DePIN)场景;强调能效和成本优化,适合在二手硬件上部署。项目用 Python 实现,与 llama.cpp 生态兼容,但当前处于早期阶段,文档和社区支持尚待完善。
项目数据
核心亮点
- 实测推理速度 147 t/s,比原生 llama.cpp 快 8.8 倍,性能提升显著
- 利用二手企业级硬件,大幅降低自托管推理的硬件成本
- NUMA 感知优化,针对多路服务器内存访问模式深度调优
不足之处
- 依赖特定 POWER8 架构,通用 x86 服务器上无法直接复现性能
- 文档/社区待观察:早期项目,使用教程和生态支持尚不完善
适用场景
- 在二手企业级服务器上自托管 LLM 推理服务,降低基础设施开支
- 边缘计算场景,需在本地或去中心化节点上运行推理,避免云依赖
- 对推理延迟和吞吐有高要求的批量处理任务,如批量文本生成
替代项目
llama.cpp、vLLM、TGI (Hugging Face Text Generation Inference)
项目介绍
上一篇:floe-guard
下一篇:没有了!
同类项目推荐
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi-K2.6, GLM-5.2, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma ···
OpenMemory
开源
AI 工具共用一份记忆,关掉重开照样记得你
Local persistent memory store for LLM applications including claude desktop, github ···
litellm
开源
一个网关接入所有大模型,告别接口乱、成本散、监控难
The fastest, litest AI Gateway. Rust core with Python SDK. Call 100+ LLM APIs in Ope···
vllm
开源
同一个模型跑出几倍速度,机器成本省一半
A high-throughput and memory-efficient inference and serving engine for LLMs