ollama-benchmark

一键测本地大模型吞吐,选模型不靠猜

ollama-benchmark 是一个面向本地大模型(通过 Ollama 运行)的吞吐量基准测试工具。它解决的核心问题是:当你在本地部署 Llama、Mistral、Qwen 等模型时,很难快速知道不同模型、不同量化版本、不同硬件配置下的实际推理速度到底如何。项目通过调用 Ollama 的 API,自动向模型发送请求并统计每秒生成的 token 数(tokens/s)、首 token 延迟等关键指标,最终以表格或图表形式输出对比结果。核心能力包括:支持批量测试多个模型、可配置提示词与生成长度、输出结构化性能数据、便于横向比较不同模型在同一机器上的表现。它适合开发者、AI 爱好者在选购硬件、选择模型或调优推理参数时,用数据代替感觉来做决策。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 389
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类评测安全
开发团队aidatatools
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai,ai-tools,benchmark,llm,ollama
GitHub 星标★ 389
30天Star增速
HF 下载量
上线时间2024-01-18 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 直接对接 Ollama API,无需额外部署推理服务,开箱即用
  • 输出 tokens/s 等量化指标,可批量对比多个模型在同一硬件上的表现
  • Python 实现,代码轻量,便于按需修改测试参数或扩展指标

不足之处

  • 仅覆盖吞吐量维度,缺少显存占用、功耗、准确率等综合评测
  • 项目星标较少,文档和社区案例有限,长期维护情况待观察

适用场景

  • 选购本地推理显卡或主机前,对比不同模型的实际生成速度
  • 在 Llama、Qwen、Mistral 等模型间做选型,用数据决定哪个更快
  • 调整量化等级或上下文长度后,验证推理性能变化

替代项目

llama.cpp、vLLM、LocalAI

项目介绍

ollama-benchmark 是一个评测安全领域的开源项目,官方简介:LLM Benchmark for Throughput via Ollama (Local LLMs)。项目使用 Python 开发,在 GitHub 上获得 389 星标。

上一篇:llm-jp-eval

下一篇:llm-coding-benchmark

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24