LooGLE 是评测安全领域的开源项目,由 bigai-nlco 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 200。
项目仍在小幅维护中,最近一次代码更新于 2026-09-01。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:研究长上下文语言模型的评测与对比。同类可对比的替代方案包括 LongBench、ZeroSCROLLS、L-Eval。

测长文本模型真实力,看它能否抓住长文关键
LooGLE 是 ACL 2024 发布的面向长上下文语言模型的评测基准,旨在系统评估模型对超长文档的理解与生成能力。它解决了现有基准在长文本任务上区分度不足、依赖检索或记忆捷径的问题,通过设计六大任务(短依赖、长依赖、摘要、时间线、多跳推理、需外部知识)来全面测试模型的短时与长时依赖建模、信息检索、推理和生成能力。核心能力包括:提供超过 200 个真实世界长文档(平均 9000+ 词),任务设计强调对长文本的深度理解而非简单复制;支持自动评估与人工评估结合,并公开了基线模型(如 GPT-4、Claude)的评测结果,便于研究者对比。该基准特别关注模型在长上下文中的‘有效理解’与‘信息定位’能力,为长上下文模型的发展提供可靠度量。
LongBench、ZeroSCROLLS、L-Eval
LooGLE 是评测安全领域的开源项目,由 bigai-nlco 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 200。
项目仍在小幅维护中,最近一次代码更新于 2026-09-01。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:研究长上下文语言模型的评测与对比。同类可对比的替代方案包括 LongBench、ZeroSCROLLS、L-Eval。
上一篇:lmms-eval
下一篇:Video-MME-v2
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···