Static-to-Dynamic-LLMEval

动态生成评测样本,防数据污染,测出模型真实力

Static-to-Dynamic-LLMEval 是论文《Recent advances in large language model benchmarks against data contamination: From static to dynamic evaluation》的官方代码库。该项目聚焦大语言模型评测中的数据污染问题,提出从静态评测转向动态评测的方法论与工具实现。它通过动态生成测试样本、实时更新评测集等方式,降低模型因预训练数据泄露而导致的分数虚高,提升评测结果的真实性和可靠性。核心能力包括:动态评测流程设计、污染检测机制、以及基于论文方法的可复现实验框架。项目旨在为LLM评测社区提供一种更稳健的评估范式,帮助研究者和开发者更准确地衡量模型真实能力。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 500
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类评测安全
开发团队SeekingDream
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源是
开源协议
主要语言
技术栈/模型benchmark,dynamic-evaluation,evaluation,large-language-model,llm,llms,testing
GitHub 星标★ 500
30天Star增速
HF 下载量
上线时间2025-02-21 00:00:00
最近更新2026-09-08 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-12
浏览次数7

使用教程

核心亮点

  • 针对数据污染痛点,提出动态评测方案,有效缓解静态基准被刷分问题
  • 基于学术论文,方法有理论支撑,实验流程可复现
  • 提供动态评测工具链,支持自定义评测集生成,灵活适配不同模型

不足之处

  • 文档/社区待观察
  • 项目处于早期,星标数较少,生态和工具链成熟度可能不足

适用场景

  • 学术研究:对比静态与动态评测方法,验证模型真实能力
  • 模型发布前评估:使用动态评测防止数据泄露导致的高估
  • 基准测试设计:构建抗污染的评测集,提升评测公信力

替代项目

lm-evaluation-harness、HELM、OpenCompass

项目介绍

Static-to-Dynamic-LLMEval 是评测安全领域的开源项目,由 SeekingDream 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 500。

项目仍在小幅维护中,最近一次代码更新于 2026-09-08。免费使用。

它主要面向的使用场景是:学术研究:对比静态与动态评测方法,验证模型真实能力。同类可对比的替代方案包括 lm-evaluation-harness、HELM、OpenCompass。

上一篇:Object-Detection-Metrics

下一篇:akto

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1519 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2957 2026-09-12