
ollama-benchmark
一键测本地大模型吞吐,选模型不靠猜
ollama-benchmark 是一个面向本地大模型(通过 Ollama 运行)的吞吐量基准测试工具。它解决的核心问题是:当你在本地部署 Llama、Mistral、Qwen 等模型时,很难快速知道不同模型、不同量化版本、不同硬件配置下的实际推理速度到底如何。项目通过调用 Ollama 的 API,自动向模型发送请求并统计每秒生成的 token 数(tokens/s)、首 token 延迟等关键指标,最终以表格或图表形式输出对比结果。核心能力包括:支持批量测试多个模型、可配置提示词与生成长度、输出结构化性能数据、便于横向比较不同模型在同一机器上的表现。它适合开发者、AI 爱好者在选购硬件、选择模型或调优推理参数时,用数据代替感觉来做决策。
项目数据
使用教程
核心亮点
- 直接对接 Ollama API,无需额外部署推理服务,开箱即用
- 输出 tokens/s 等量化指标,可批量对比多个模型在同一硬件上的表现
- Python 实现,代码轻量,便于按需修改测试参数或扩展指标
不足之处
- 仅覆盖吞吐量维度,缺少显存占用、功耗、准确率等综合评测
- 项目星标较少,文档和社区案例有限,长期维护情况待观察
适用场景
- 选购本地推理显卡或主机前,对比不同模型的实际生成速度
- 在 Llama、Qwen、Mistral 等模型间做选型,用数据决定哪个更快
- 调整量化等级或上下文长度后,验证推理性能变化
替代项目
llama.cpp、vLLM、LocalAI
项目介绍
上一篇:llm-jp-eval
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents