whichllm

一条命令,找出你电脑上跑得最快的本地大模型

whichllm 是一个帮助用户在本地硬件上找到最适合运行的 LLM 模型的命令行工具。它解决的核心问题是:用户面对海量开源模型,仅凭参数规模难以判断实际性能,而盲目下载测试又耗时费力。该工具通过内置的、基于真实运行时间和近期数据的基准测试,对模型进行排名,而非依赖参数数量。用户只需一条命令,即可快速获取针对自己硬件优化后的模型推荐列表,并可直接运行。其核心能力包括:自动检测硬件配置、拉取并运行基准测试、生成按性能排序的模型清单,以及提供一键运行入口。它简化了本地 LLM 的选型流程,让普通用户也能轻松找到性能最优的模型。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 6674
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Andyyyy64
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型localllm
GitHub 星标★ 6674
30天Star增速
HF 下载量
上线时间2026-03-04 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 5 分钟 部署方式:命令行工具 7 步

环境要求

  • 支持 uv / uvx 运行器(推荐,免安装直接运行)
  • 或 Python + pip 环境(用于 pip install whichllm)
  • macOS 用户可选 Homebrew(brew install)
  • 需要联网访问 HuggingFace 以拉取模型榜单与权重

安装与启动步骤

  1. 1免安装直接运行

    无需项目配置,uvx 会临时拉取最新版 whichllm 并自动检测你的 GPU/CPU/内存,输出推荐模型表格。

    uvx whichllm@latest
  2. 2安装为常驻工具

    经常使用时把 whichllm 装成常驻命令,之后可直接用 whichllm 调用;也可用 pip 或 brew 安装。

    uv tool install whichllm
    uv tool upgrade whichllm
  3. 3模拟指定显卡

    还没买卡时可指定型号模拟,先看该硬件适合跑哪些模型,结果基于实时 HuggingFace 数据。

    uvx whichllm@latest --gpu "RTX 4090"
  4. 4更保守的推荐

    只想选能完整装进显存、速度可用的模型时加这些过滤条件,并预留 1GB 显存给运行时开销。

    uvx whichllm@latest --gpu-only --speed usable --vram-headroom 1GB
  5. 5一键下载并对话

    whichllm 通过 uv 创建隔离环境、装依赖、下载模型并启动交互式聊天,无需手动安装。

    whichllm run "qwen 2.5 1.5b gguf"
  6. 6生成调用代码片段

    打印可直接运行的 Python 代码,也可用 --quant 指定量化版本,例如 Q5_K_M。

    whichllm snippet "llama 3 8b gguf" --quant Q5_K_M
  7. 7输出 Markdown 结果

    用 -m 输出 Markdown,方便贴到 GitHub issue、README、Slack 或博客;可配合 --top 与 --gpu。

    whichllm -m --top 5 --gpu "RTX 4090"

关键配置

配置项必填说明示例
--gpu否手动指定或模拟显卡型号,用于未装卡或换卡前选型--gpu "RTX 4090"
--gpu-only / --fit full-gpu否只保留能完整放入显存的模型,避免部分卸载--gpu-only
--speed否按实际可用速度过滤,可选 usable、fast 等档位--speed usable
--vram-headroom否额外预留显存给运行时开销,模型略大时可加大--vram-headroom 1GB
--top否限制输出结果条数--top 5
--quant否在 snippet 中指定量化格式--quant Q5_K_M

如何确认成功

终端打印出按 score 排序的模型表格,含显存需求、估算生成速度(t/s)、fit 类型和发布日期即成功。

常见问题

Q:默认推荐结果跑起来有点勉强怎么办?

A:默认较激进,会包含部分内存卸载和接近显存上限的模型。改用 --gpu-only --speed usable --vram-headroom 1GB 只保留完整装入显存且速度可用的模型。

Q:LM Studio 提示模型略微过大?

A:说明显存预留不够,加大 --vram-headroom 的值后重新运行推荐即可。

Q:结果里的速度是实测吗?

A:不是实时基准。速度是规划用的估算区间,字段含 estimated_tok_per_sec、speed_range_tok_per_sec 和 speed_confidence,表格中 ~ 和 ? 表示估算置信度。

Q:榜单是固定列表吗?

A:不是静态列表。排名跟踪实时 HuggingFace 数据,README 中的快照仅为示例。

Q:怎么用别的工具跑推荐出的模型?

A:可用 whichllm run 直接下载并对话,或 whichllm snippet 生成 Python 代码;README 也给出 ollama run $(bestllm) 的用法示例。

注意事项

  • 默认推荐包含 full-GPU、部分卸载和纯 CPU 三类候选,仅当它们可用时才会出现。
  • 速度颜色分级:低于 4 tok/s 红、4-10 黄、10-30 绿、30+ 亮绿,可据此判断是否实用。
  • JSON 输出包含 fit_type、vram_required_bytes、estimated_tok_per_sec 等字段,便于自行二次处理。
  • whichllm run 会通过 uv 自动创建隔离环境并下载模型,首次运行耗时取决于模型体积与网速。

核心亮点

  • 基于真实基准测试排名,而非参数数量,结果更贴近实际使用体验
  • 考虑基准测试的时效性,确保推荐模型适配当前主流版本
  • 一键运行,无需手动下载和配置多个模型,极大节省选型时间

不足之处

  • 基准测试可能无法覆盖所有使用场景(如特定任务微调)
  • 文档/社区待观察

适用场景

  • 个人开发者本地搭建 AI 应用,需要快速选择高性能模型
  • 企业评估本地化部署 LLM 的硬件适配性
  • AI 爱好者探索不同模型在自有设备上的表现

替代项目

Ollama、LM Studio、llama.cpp

项目介绍

whichllm 是模型训练领域的开源项目,由 Andyyyy64 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(6,674)位列前 7%,在模型训练分类的 522 个项目里位列前 7%。

近 41 天,它的 GitHub 星标从 6,224 增加到 6,674,净增 450。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:个人开发者本地搭建AI应用,需要快速选择高性能模型。同类可对比的替代方案包括 Ollama、LM Studio、llama.cpp。

上一篇:Firefly

下一篇:VLM-R1

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13