Static-to-Dynamic-LLMEval

动态生成评测样本,防数据污染,测出模型真实力

Static-to-Dynamic-LLMEval 是论文《Recent advances in large language model benchmarks against data contamination: From static to dynamic evaluation》的官方代码库。该项目聚焦大语言模型评测中的数据污染问题,提出从静态评测转向动态评测的方法论与工具实现。它通过动态生成测试样本、实时更新评测集等方式,降低模型因预训练数据泄露而导致的分数虚高,提升评测结果的真实性和可靠性。核心能力包括:动态评测流程设计、污染检测机制、以及基于论文方法的可复现实验框架。项目旨在为LLM评测社区提供一种更稳健的评估范式,帮助研究者和开发者更准确地衡量模型真实能力。

开源 free 评测安全
GitHub 星标 ★ 500
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队SeekingDream
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源
开源协议
主要语言
技术栈/模型benchmark,dynamic-evaluation,evaluation,large-language-model,llm,llms,testing
GitHub 星标★ 500
30天Star增速
HF 下载量
上线时间2025-02-21 00:00:00
最近更新2026-08-11 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-12
浏览次数0

核心亮点

  • 针对数据污染痛点,提出动态评测方案,有效缓解静态基准被刷分问题
  • 基于学术论文,方法有理论支撑,实验流程可复现
  • 提供动态评测工具链,支持自定义评测集生成,灵活适配不同模型

不足之处

  • 文档/社区待观察
  • 项目处于早期,星标数较少,生态和工具链成熟度可能不足

适用场景

  • 学术研究:对比静态与动态评测方法,验证模型真实能力
  • 模型发布前评估:使用动态评测防止数据泄露导致的高估
  • 基准测试设计:构建抗污染的评测集,提升评测公信力

替代项目

lm-evaluation-harness、HELM、OpenCompass

项目介绍

Static-to-Dynamic-LLMEval 是一个评测安全领域的开源项目,官方简介:The official GitHub repository of the paper "Recent advances in large language model benchmarks against data contamination: From static to dynamic evaluation"。项目使用 未知 开发,在 GitHub 上获得 500 星标。

上一篇:Object-Detection-Metrics

下一篇:没有了!

同类项目推荐

MisguidedAttention 开源

用误导性提示词,测出大模型推理的短板

A collection of prompts to challenge the reasoning abilities of large language model···

★ 485 2026-08-09
giskard-oss 开源

给 LLM 应用做全面质检,上线前自动揪出漏洞和偏见

Open-Source Evaluation & Testing library for LLM Agents

★ 5741 2026-08-09
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 160 2026-08-10