InfiniteBench 是评测安全领域的开源项目,由 OpenBMB 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 393。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-12。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:大模型长上下文能力基准测试。同类可对比的替代方案包括 LongBench、L-Eval、ZeroSCROLLS。

测出大模型在10万字长文本下的真实水平
InfiniteBench 是论文《∞Bench: Extending Long Context Evaluation Beyond 100K Tokens》的官方代码库,旨在评估和推动大语言模型在超长上下文(超过10万token)场景下的表现。它解决了现有基准测试在长上下文任务上覆盖不足、难度不够的问题,提供了一套标准化、可复现的评测框架。核心能力包括:支持多种长上下文任务(如文本检索、多文档问答、代码理解等),提供自动生成测试数据与评分脚本,并兼容主流模型API与本地模型。通过该工具,研究者和开发者可以量化模型在100K+ token输入下的真实能力,识别模型在长文本处理中的弱点,从而指导模型优化和选型。
LongBench、L-Eval、ZeroSCROLLS
InfiniteBench 是评测安全领域的开源项目,由 OpenBMB 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 393。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-12。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:大模型长上下文能力基准测试。同类可对比的替代方案包括 LongBench、L-Eval、ZeroSCROLLS。
上一篇:MMStar
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.