
model-serving-minefield
按症状查 LLM 服务陷阱,避免自信的错误测量
model-serving-minefield 是一个社区维护的 LLM 推理服务“踩坑登记册”,专门收集那些会让测量结果看似正常、实则自信地给出错误结论的陷阱。它覆盖聊天模板、工具解析器、推理字段、量化内核路径、CUDA 工具链、KV 缓存分配、评测框架和版本管理等多个环节。项目以“症状优先”为组织方式:先描述你观察到的异常现象,再给出能抓住该问题的具体检查方法。它解决的是本地部署和评测 LLM 时,因服务链路细节不一致导致 benchmark 分数虚高、模型对比失真、量化效果误判等隐蔽问题。核心能力包括:按症状索引陷阱、提供可复现的检查步骤、覆盖 llama.cpp、lm-eval 等常见工具链,帮助开发者和评测者快速定位测量偏差来源,避免在错误数据上做技术决策。
项目数据
使用教程
核心亮点
- 以症状为入口组织内容,遇到异常可直接反查对应陷阱和检查方法
- 覆盖聊天模板、工具解析、量化内核、CUDA、KV 分配、评测框架等完整服务链路
- 聚焦测量可信度,能帮助识别 benchmark 虚高和模型对比失真等隐蔽问题
不足之处
- 项目处于早期,条目数量和覆盖范围可能有限
- 作为社区登记册,内容更新和维护依赖贡献者持续投入
适用场景
- 本地部署 LLM 后 benchmark 分数异常偏高,需要排查评测链路问题
- 对比不同量化版本模型效果时,怀疑测量结果受内核路径影响
- 使用 lm-eval 等框架评测时,想确认聊天模板和推理字段是否一致
替代项目
llama.cpp、lm-evaluation-harness
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents