gpu_poor

选显卡前先算一算:模型显存和速度一键估算

gpu_poor 是一个用于估算任意大语言模型(LLM)在本地部署时所需 GPU 显存和推理速度(token/s)的命令行工具。它通过解析模型的参数量、量化方式(支持 llama.cpp/ggml、bitsandbytes、QLoRA 等)以及硬件配置,快速给出显存占用和性能预估,帮助开发者在购买 GPU 或配置本地推理环境前做出决策。核心能力包括:输入模型名称或参数规模,自动匹配常见量化格式,计算不同精度下的显存需求,并基于 GPU 型号估算推理吞吐量。项目以 JavaScript 编写,提供简洁的 CLI 交互,适合 AI 开发者和硬件爱好者使用。它解决了模型部署前硬件选型盲目、显存不足导致运行失败的问题,让用户无需实际下载模型即可获得关键部署参数。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1401
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队RahulSChand
所属国家
定价模式free
价格说明开源项目,完全免费,无付费版本。
访问状态
是否开源
开源协议
主要语言JavaScript
技术栈/模型ggml,gpu,huggingface,language-model,llama,llama2,llamacpp,llm,pytorch,quantization
GitHub 星标★ 1401
30天Star增速
HF 下载量
上线时间2023-09-12 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 5 分钟 部署方式:命令行工具 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 现代浏览器,可直接使用在线评估页面(README 提供链接)
  • 已知目标模型的名称或参数量规模
  • 已知本地 GPU 型号与显存大小
  • 若要在本地运行:具备 JavaScript/Node.js 运行环境(README 未给出具体版本与安装命令)

安装与启动步骤

  1. 1打开在线评估页面

    README 给出的官方地址为 https://rahulschand.github.io/gpu_poor/ ,可直接在浏览器中打开使用,无需安装任何依赖。

  2. 2克隆项目仓库

    如需在本地查看源码或自行运行,先把 GitHub 仓库克隆到本地目录,README 未提供后续安装命令。

    git clone https://github.com/RahulSChand/gpu_poor.git
  3. 3进入项目目录

    切换到克隆下来的项目文件夹,查看其中的源码与说明文件,确认本地运行方式。

    cd gpu_poor
  4. 4查看依赖与脚本

    README 未给出安装步骤,需自行查看 package.json 等文件确认依赖和可用脚本,不要盲目执行未知命令。

    cat package.json
  5. 5输入参数开始估算

    在页面或工具中输入模型参数量、量化方式(GGML/bitsandbytes/QLoRA)、推理框架与 GPU 型号,取得显存与速度结果。

关键配置

配置项必填说明示例
模型参数量/模型名称决定基础权重占用的显存大小7B
量化方式影响模型体积,支持 GGML、bitsandbytes、QLoRA 等GGML 4-bit
推理框架不同框架的显存与吞吐开销不同llama.cpp
GPU 型号用于估算 token/s 与显存上限RTX 3090
上下文长度与 batch size影响 KV Cache 与激活内存大小2048
训练方式全量微调、LoRA 或 QLoRA,用于估算微调显存与耗时QLoRA

如何确认成功

能得到显存明细输出(含 Total、KV Cache、Model Size 等字段),或得到 Token per second、ms per token 等速度结果,即表示估算成功。

常见问题

Q:使用这个工具需要先安装环境吗?

A:不需要。README 直接给出了在线页面链接,浏览器打开即可使用;README 未提供任何本地安装命令。

Q:支持哪些量化格式?

A:README 说明支持 GGML/llama.cpp、bitsandbytes、QLoRA 等量化方式,可估算不同精度下的显存占用。

Q:支持哪些推理框架?

A:README 提到支持 vLLM、llama.cpp 和 HuggingFace(HF)三种推理框架的显存与性能拆解。

Q:能估算微调时间吗?

A:可以。README 说明能给出微调每个迭代(forward + backward)的毫秒数,并判断是显存瓶颈还是算力瓶颈。

注意事项

  • README 节选中没有安装与本地启动说明,本地运行方式需自行查阅仓库文件,本教程未编造任何安装命令。
  • 估算结果为理论近似值,实际显存占用与 token/s 会受驱动版本、显存带宽、并发与实现细节影响。
  • ollama、node、npm 等命令 README 均未提及,请勿照搬其他项目的安装流程。

核心亮点

  • 支持多种主流量化格式(GGML/BNB/QLoRA),估算贴近实际部署
  • 基于真实 GPU 型号数据库,推理速度估算有参考价值
  • 命令行交互简单,输入模型参数即可快速输出结果

不足之处

  • 估算结果基于理论模型,实际性能可能受驱动、散热等因素影响
  • 文档/社区待观察

适用场景

  • 购买 GPU 前评估能否运行目标模型
  • 比较不同量化方式对显存和速度的影响
  • 快速规划本地 LLM 部署的硬件配置

替代项目

llama.cpp、Ollama、GPT4All

项目介绍

gpu_poor 是基础设施领域的开源项目,由 RahulSChand 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,401)位列前 30%,在基础设施分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。完全免费,无付费版本。

它主要面向的使用场景是:购买GPU前评估能否运行目标模型。同类可对比的替代方案包括 llama.cpp、Ollama、GPT4All。

上一篇:desktop

下一篇:Observal

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09