model-serving-minefield

按症状查 LLM 服务陷阱,避免自信的错误测量

model-serving-minefield 是一个社区维护的 LLM 推理服务“踩坑登记册”,专门收集那些会让测量结果看似正常、实则自信地给出错误结论的陷阱。它覆盖聊天模板、工具解析器、推理字段、量化内核路径、CUDA 工具链、KV 缓存分配、评测框架和版本管理等多个环节。项目以“症状优先”为组织方式:先描述你观察到的异常现象,再给出能抓住该问题的具体检查方法。它解决的是本地部署和评测 LLM 时,因服务链路细节不一致导致 benchmark 分数虚高、模型对比失真、量化效果误判等隐蔽问题。核心能力包括:按症状索引陷阱、提供可复现的检查步骤、覆盖 llama.cpp、lm-eval 等常见工具链,帮助开发者和评测者快速定位测量偏差来源,避免在错误数据上做技术决策。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 132
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队Blackwellboy
所属国家
官网地址
定价模式free
价格说明开源免费,无付费服务
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型benchmarking,chat-template,cuda,debugging,llama-cpp,llm-serving,lm-eval,local-llm,model-evaluation,quantization,reasoning-models,speculative-decoding,troubleshooting,vllm
GitHub 星标★ 132
30天Star增速
HF 下载量
上线时间2026-07-27 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 以症状为入口组织内容,遇到异常可直接反查对应陷阱和检查方法
  • 覆盖聊天模板、工具解析、量化内核、CUDA、KV 分配、评测框架等完整服务链路
  • 聚焦测量可信度,能帮助识别 benchmark 虚高和模型对比失真等隐蔽问题

不足之处

  • 项目处于早期,条目数量和覆盖范围可能有限
  • 作为社区登记册,内容更新和维护依赖贡献者持续投入

适用场景

  • 本地部署 LLM 后 benchmark 分数异常偏高,需要排查评测链路问题
  • 对比不同量化版本模型效果时,怀疑测量结果受内核路径影响
  • 使用 lm-eval 等框架评测时,想确认聊天模板和推理字段是否一致

替代项目

llama.cpp、lm-evaluation-harness

项目介绍

model-serving-minefield 是一个评测安全领域的开源项目,官方简介:Community registry of LLM serving-path traps that produce confidently wrong measurements: templates, tool parsers, reasoning fields, quant kernel paths, CUDA toolchains, KV allocation, eval harnesses, versioning. Symptom-first, with the check that catches each.。项目使用 Python 开发,在 GitHub 上获得 130 星标。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24