
evalstats
小样本评测也能算出模型差异是否真实
evalstats 是一个面向 AI 评测场景的 Python 统计推断库,专门解决小样本条件下模型对比与评测结论不可靠的问题。它把蒙特卡洛模拟验证过的统计方法封装成开箱即用的工具,覆盖模型 A/B 对比、置信区间估计、显著性检验,以及对 LLM 裁判偏置的校正。传统评测常直接比较平均分,样本少时极易把噪声当成真实差异,evalstats 通过引入统计检验和偏差修正,让“模型 A 比 B 好”这类结论有可量化的置信度支撑。核心能力包括:小样本友好的假设检验与效应量计算、LLM-as-judge 评分偏置的统计校正、以及经过大量模拟实验验证的默认参数,用户无需自己调参即可得到稳健结果。适合做 prompt 迭代、benchmark 排名、模型选型的研究者和工程师,把评测从“看分数”升级为“看统计显著性”。
项目数据
使用教程
核心亮点
- 内置蒙特卡洛模拟验证过的默认参数,小样本下无需手动调参即可得到稳健统计结论
- 专门处理 LLM 裁判偏置校正,解决用大模型打分时系统性偏差污染评测结果的问题
- 聚焦模型对比的显著性检验与置信区间,直接回答“A 是否真的比 B 好”而非只给平均分
不足之处
- 项目处于早期,星标仅 127,API 稳定性和长期维护节奏有待观察
- 文档与示例相对有限,非统计背景用户上手假设检验概念仍有门槛
适用场景
- 小规模人工标注集上对比两个 prompt 的效果差异是否显著
- 用 LLM-as-judge 批量打分后校正裁判偏置,得到可信的模型排名
- benchmark 样本量不足时,为模型选型结论提供统计置信度支撑
替代项目
scipy、statsmodels、promptfoo
项目介绍
上一篇:faster_coco_eval
下一篇:every_eval_ever
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents