
Static-to-Dynamic-LLMEval
动态生成评测样本,防数据污染,测出模型真实力
Static-to-Dynamic-LLMEval 是论文《Recent advances in large language model benchmarks against data contamination: From static to dynamic evaluation》的官方代码库。该项目聚焦大语言模型评测中的数据污染问题,提出从静态评测转向动态评测的方法论与工具实现。它通过动态生成测试样本、实时更新评测集等方式,降低模型因预训练数据泄露而导致的分数虚高,提升评测结果的真实性和可靠性。核心能力包括:动态评测流程设计、污染检测机制、以及基于论文方法的可复现实验框架。项目旨在为LLM评测社区提供一种更稳健的评估范式,帮助研究者和开发者更准确地衡量模型真实能力。
项目数据
核心亮点
- 针对数据污染痛点,提出动态评测方案,有效缓解静态基准被刷分问题
- 基于学术论文,方法有理论支撑,实验流程可复现
- 提供动态评测工具链,支持自定义评测集生成,灵活适配不同模型
不足之处
- 文档/社区待观察
- 项目处于早期,星标数较少,生态和工具链成熟度可能不足
适用场景
- 学术研究:对比静态与动态评测方法,验证模型真实能力
- 模型发布前评估:使用动态评测防止数据泄露导致的高估
- 基准测试设计:构建抗污染的评测集,提升评测公信力
替代项目
lm-evaluation-harness、HELM、OpenCompass
项目介绍
下一篇:没有了!
同类项目推荐
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
MisguidedAttention
开源
用误导性提示词,测出大模型推理的短板
A collection of prompts to challenge the reasoning abilities of large language model···
giskard-oss
开源
给 LLM 应用做全面质检,上线前自动揪出漏洞和偏见
Open-Source Evaluation & Testing library for LLM Agents
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University