LooGLE

测长文本模型真实力,看它能否抓住长文关键

LooGLE 是 ACL 2024 发布的面向长上下文语言模型的评测基准,旨在系统评估模型对超长文档的理解与生成能力。它解决了现有基准在长文本任务上区分度不足、依赖检索或记忆捷径的问题,通过设计六大任务(短依赖、长依赖、摘要、时间线、多跳推理、需外部知识)来全面测试模型的短时与长时依赖建模、信息检索、推理和生成能力。核心能力包括:提供超过 200 个真实世界长文档(平均 9000+ 词),任务设计强调对长文本的深度理解而非简单复制;支持自动评估与人工评估结合,并公开了基线模型(如 GPT-4、Claude)的评测结果,便于研究者对比。该基准特别关注模型在长上下文中的‘有效理解’与‘信息定位’能力,为长上下文模型的发展提供可靠度量。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 200
维护状态 维护中
是否开源
定价模式 free

项目数据

分类开源模型
开发团队bigai-nlco
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型acl2024,large-language-models,llm,long-context
GitHub 星标★ 200
30天Star增速
HF 下载量
上线时间2023-11-02 00:00:00
最近更新2026-09-01 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 任务设计区分短依赖与长依赖,能暴露模型在长文本上的真实短板
  • 基于真实长文档构建,避免合成数据偏差,贴近实际应用
  • 提供多模型基线结果,便于横向对比和追踪进展

不足之处

  • 项目处于早期,文档和社区支持尚待完善
  • 评测集规模有限,可能无法覆盖所有长文本场景

适用场景

  • 研究长上下文语言模型的评测与对比
  • 开发长文本理解应用时验证模型能力
  • 学术论文中作为基准测试工具

替代项目

LongBench、ZeroSCROLLS、L-Eval

项目介绍

LooGLE 是评测安全领域的开源项目,由 bigai-nlco 开发,2023 年首次发布。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 200。

项目仍在小幅维护中,最近一次代码更新于 2026-09-01。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:研究长上下文语言模型的评测与对比。同类可对比的替代方案包括 LongBench、ZeroSCROLLS、L-Eval。

上一篇:lmms-eval

下一篇:Video-MME-v2

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24