InfiniteBench

测出大模型在10万字长文本下的真实水平

InfiniteBench 是论文《∞Bench: Extending Long Context Evaluation Beyond 100K Tokens》的官方代码库,旨在评估和推动大语言模型在超长上下文(超过10万token)场景下的表现。它解决了现有基准测试在长上下文任务上覆盖不足、难度不够的问题,提供了一套标准化、可复现的评测框架。核心能力包括:支持多种长上下文任务(如文本检索、多文档问答、代码理解等),提供自动生成测试数据与评分脚本,并兼容主流模型API与本地模型。通过该工具,研究者和开发者可以量化模型在100K+ token输入下的真实能力,识别模型在长文本处理中的弱点,从而指导模型优化和选型。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 393
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队OpenBMB
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型benchmark,large-language-models,long-context
GitHub 星标★ 393
30天Star增速
HF 下载量
上线时间2023-11-22 00:00:00
最近更新2026-09-12 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 覆盖多种长上下文任务,如检索、问答、代码,评测维度全面
  • 提供自动化生成与评分流程,便于复现和横向对比
  • 官方论文配套,数据和方法有学术背书

不足之处

  • 项目处于早期,文档和社区支持待观察
  • 评测运行成本高,需消耗大量计算资源

适用场景

  • 大模型长上下文能力基准测试
  • 模型选型时对比不同模型的长文本处理效果
  • 研究长上下文模型优化方向

替代项目

LongBench、L-Eval、ZeroSCROLLS

项目介绍

InfiniteBench 是评测安全领域的开源项目,由 OpenBMB 开发,2023 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 393。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-12。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:大模型长上下文能力基准测试。同类可对比的替代方案包括 LongBench、L-Eval、ZeroSCROLLS。

上一篇:MMStar

下一篇:ChatGPT-Sentiment-Evaluation

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12