ram-coffers

用二手 POWER8 服务器,让 LLM 推理提速 8.8 倍,省下云账单。

ram-coffers 是一个面向 LLM 推理的基础设施优化项目,通过 NUMA 感知的权重银行(weight banking)技术,在 refurbished 企业级 POWER8 服务器上实现了 147 tokens/秒的推理速度,相比原生 llama.cpp 提升 8.8 倍。该项目旨在降低自托管推理的成本,避免依赖云 API,属于 Proof of Physical AI 技术栈的一部分。其核心能力包括:利用 NUMA 架构优化内存访问模式,提升推理吞吐;支持边缘 AI 和去中心化物理基础设施(DePIN)场景;强调能效和成本优化,适合在二手硬件上部署。项目用 Python 实现,与 llama.cpp 生态兼容,但当前处于早期阶段,文档和社区支持尚待完善。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 170
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类基础设施
开发团队Scottcjn
所属国家
定价模式free
价格说明开源项目,免费使用,需自行部署
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型ai-inference,ai-infrastructure,cost-optimization,depin,edge-ai,energy-efficiency,hebbian,inference-optimization,llama-cpp,llm,llm-inference,llmops,numa,power8,powerpc,ppc64le,proof-of-physical-ai,self-hosted,transformer,vec-perm
GitHub 星标★ 170
30天Star增速
HF 下载量
上线时间2026-01-19 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-21
浏览次数7

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 实测推理速度 147 t/s,比原生 llama.cpp 快 8.8 倍,性能提升显著
  • 利用二手企业级硬件,大幅降低自托管推理的硬件成本
  • NUMA 感知优化,针对多路服务器内存访问模式深度调优

不足之处

  • 依赖特定 POWER8 架构,通用 x86 服务器上无法直接复现性能
  • 文档/社区待观察:早期项目,使用教程和生态支持尚不完善

适用场景

  • 在二手企业级服务器上自托管 LLM 推理服务,降低基础设施开支
  • 边缘计算场景,需在本地或去中心化节点上运行推理,避免云依赖
  • 对推理延迟和吞吐有高要求的批量处理任务,如批量文本生成

替代项目

llama.cpp、vLLM、TGI (Hugging Face Text Generation Inference)

项目介绍

ram-coffers 是基础设施领域的开源项目,由 Scottcjn 开发,是 2026 年新上线的项目。

它收录于基础设施分类,该分类目前共有 1,157 个项目,GitHub 星标数为 170。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-27。免费使用,需自行部署。从国内网络环境看,可直接访问。

它主要面向的使用场景是:在二手企业级服务器上自托管LLM推理服务,降低基础设施开支。同类可对比的替代方案包括 llama.cpp、vLLM、TGI (Hugging Face Text Generation Inference)。

上一篇:floe-guard

下一篇:Portainer 容器管理面板

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] No longer maintained.

★ 303 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 9114 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 442 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 182186 2026-08-09