Static-to-Dynamic-LLMEval 是评测安全领域的开源项目,由 SeekingDream 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 500。
项目仍在小幅维护中,最近一次代码更新于 2026-09-08。免费使用。
它主要面向的使用场景是:学术研究:对比静态与动态评测方法,验证模型真实能力。同类可对比的替代方案包括 lm-evaluation-harness、HELM、OpenCompass。

动态生成评测样本,防数据污染,测出模型真实力
Static-to-Dynamic-LLMEval 是论文《Recent advances in large language model benchmarks against data contamination: From static to dynamic evaluation》的官方代码库。该项目聚焦大语言模型评测中的数据污染问题,提出从静态评测转向动态评测的方法论与工具实现。它通过动态生成测试样本、实时更新评测集等方式,降低模型因预训练数据泄露而导致的分数虚高,提升评测结果的真实性和可靠性。核心能力包括:动态评测流程设计、污染检测机制、以及基于论文方法的可复现实验框架。项目旨在为LLM评测社区提供一种更稳健的评估范式,帮助研究者和开发者更准确地衡量模型真实能力。
lm-evaluation-harness、HELM、OpenCompass
Static-to-Dynamic-LLMEval 是评测安全领域的开源项目,由 SeekingDream 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 500。
项目仍在小幅维护中,最近一次代码更新于 2026-09-08。免费使用。
它主要面向的使用场景是:学术研究:对比静态与动态评测方法,验证模型真实能力。同类可对比的替代方案包括 lm-evaluation-harness、HELM、OpenCompass。
下一篇:akto
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.