evalstats

小样本评测也能算出模型差异是否真实

evalstats 是一个面向 AI 评测场景的 Python 统计推断库,专门解决小样本条件下模型对比与评测结论不可靠的问题。它把蒙特卡洛模拟验证过的统计方法封装成开箱即用的工具,覆盖模型 A/B 对比、置信区间估计、显著性检验,以及对 LLM 裁判偏置的校正。传统评测常直接比较平均分,样本少时极易把噪声当成真实差异,evalstats 通过引入统计检验和偏差修正,让“模型 A 比 B 好”这类结论有可量化的置信度支撑。核心能力包括:小样本友好的假设检验与效应量计算、LLM-as-judge 评分偏置的统计校正、以及经过大量模拟实验验证的默认参数,用户无需自己调参即可得到稳健结果。适合做 prompt 迭代、benchmark 排名、模型选型的研究者和工程师,把评测从“看分数”升级为“看统计显著性”。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 127
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类评测安全
开发团队ianarawjo
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型ai-evaluation,ai-evaluation-tools,ai-statistics,benchmarking,prompt-engineering,prompt-evaluation,statistical-analysis
GitHub 星标★ 127
30天Star增速
HF 下载量
上线时间2026-03-03 00:00:00
最近更新2026-09-15 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 内置蒙特卡洛模拟验证过的默认参数,小样本下无需手动调参即可得到稳健统计结论
  • 专门处理 LLM 裁判偏置校正,解决用大模型打分时系统性偏差污染评测结果的问题
  • 聚焦模型对比的显著性检验与置信区间,直接回答“A 是否真的比 B 好”而非只给平均分

不足之处

  • 项目处于早期,星标仅 127,API 稳定性和长期维护节奏有待观察
  • 文档与示例相对有限,非统计背景用户上手假设检验概念仍有门槛

适用场景

  • 小规模人工标注集上对比两个 prompt 的效果差异是否显著
  • 用 LLM-as-judge 批量打分后校正裁判偏置,得到可信的模型排名
  • benchmark 样本量不足时,为模型选型结论提供统计置信度支撑

替代项目

scipy、statsmodels、promptfoo

项目介绍

evalstats 是一个评测安全领域的开源项目,官方简介:Statistical inference for AI evaluations, from model comparisons to corrections for LLM judge bias, optimized for small sample sizes. All defaults battle-tested in Monte Carlo simulations.。项目使用 Python 开发,在 GitHub 上获得 127 星标。

上一篇:faster_coco_eval

下一篇:every_eval_ever

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24