gpu_poor 是基础设施领域的开源项目,由 RahulSChand 开发,2023 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(1,401)位列前 30%,在基础设施分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。完全免费,无付费版本。
它主要面向的使用场景是:购买GPU前评估能否运行目标模型。同类可对比的替代方案包括 llama.cpp、Ollama、GPT4All。

选显卡前先算一算:模型显存和速度一键估算
gpu_poor 是一个用于估算任意大语言模型(LLM)在本地部署时所需 GPU 显存和推理速度(token/s)的命令行工具。它通过解析模型的参数量、量化方式(支持 llama.cpp/ggml、bitsandbytes、QLoRA 等)以及硬件配置,快速给出显存占用和性能预估,帮助开发者在购买 GPU 或配置本地推理环境前做出决策。核心能力包括:输入模型名称或参数规模,自动匹配常见量化格式,计算不同精度下的显存需求,并基于 GPU 型号估算推理吞吐量。项目以 JavaScript 编写,提供简洁的 CLI 交互,适合 AI 开发者和硬件爱好者使用。它解决了模型部署前硬件选型盲目、显存不足导致运行失败的问题,让用户无需实际下载模型即可获得关键部署参数。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1打开在线评估页面
README 给出的官方地址为 https://rahulschand.github.io/gpu_poor/ ,可直接在浏览器中打开使用,无需安装任何依赖。
2克隆项目仓库
如需在本地查看源码或自行运行,先把 GitHub 仓库克隆到本地目录,README 未提供后续安装命令。
git clone https://github.com/RahulSChand/gpu_poor.git3进入项目目录
切换到克隆下来的项目文件夹,查看其中的源码与说明文件,确认本地运行方式。
cd gpu_poor4查看依赖与脚本
README 未给出安装步骤,需自行查看 package.json 等文件确认依赖和可用脚本,不要盲目执行未知命令。
cat package.json5输入参数开始估算
在页面或工具中输入模型参数量、量化方式(GGML/bitsandbytes/QLoRA)、推理框架与 GPU 型号,取得显存与速度结果。
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
模型参数量/模型名称 | 是 | 决定基础权重占用的显存大小 | 7B |
量化方式 | 是 | 影响模型体积,支持 GGML、bitsandbytes、QLoRA 等 | GGML 4-bit |
推理框架 | 否 | 不同框架的显存与吞吐开销不同 | llama.cpp |
GPU 型号 | 是 | 用于估算 token/s 与显存上限 | RTX 3090 |
上下文长度与 batch size | 否 | 影响 KV Cache 与激活内存大小 | 2048 |
训练方式 | 否 | 全量微调、LoRA 或 QLoRA,用于估算微调显存与耗时 | QLoRA |
能得到显存明细输出(含 Total、KV Cache、Model Size 等字段),或得到 Token per second、ms per token 等速度结果,即表示估算成功。
Q:使用这个工具需要先安装环境吗?
A:不需要。README 直接给出了在线页面链接,浏览器打开即可使用;README 未提供任何本地安装命令。
Q:支持哪些量化格式?
A:README 说明支持 GGML/llama.cpp、bitsandbytes、QLoRA 等量化方式,可估算不同精度下的显存占用。
Q:支持哪些推理框架?
A:README 提到支持 vLLM、llama.cpp 和 HuggingFace(HF)三种推理框架的显存与性能拆解。
Q:能估算微调时间吗?
A:可以。README 说明能给出微调每个迭代(forward + backward)的毫秒数,并判断是显存瓶颈还是算力瓶颈。
llama.cpp、Ollama、GPT4All
gpu_poor 是基础设施领域的开源项目,由 RahulSChand 开发,2023 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(1,401)位列前 30%,在基础设施分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。完全免费,无付费版本。
它主要面向的使用场景是:购买GPU前评估能否运行目标模型。同类可对比的替代方案包括 llama.cpp、Ollama、GPT4All。
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···