BEAM 是评测安全领域的开源项目,由 mohammadtavakoli78 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 145。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:科研机构评测超长上下文模型的记忆能力。同类可对比的替代方案包括 LongBench、L-Eval、ZeroSCROLLS。

百万级上下文下,科学评测并增强大模型长期记忆
BEAM 是一个针对大语言模型长期记忆能力的基准测试与增强框架,由 ICLR 2026 论文提出。它解决了现有模型在处理超过百万 token 的上下文时,长期记忆能力无法有效评估和提升的问题。BEAM 提供了一套标准化的评测协议,涵盖多种长期记忆任务,并提出了相应的记忆增强方法,帮助研究者和开发者量化并改进模型在超长序列下的信息保持与利用能力。其核心能力包括:构建超长上下文测试集、设计记忆保持与检索的评估指标,以及集成记忆增强模块(如外部存储或压缩机制)。项目代码基于 Python 实现,便于集成到主流 LLM 训练和推理流程中。
LongBench、L-Eval、ZeroSCROLLS
BEAM 是评测安全领域的开源项目,由 mohammadtavakoli78 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 145。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:科研机构评测超长上下文模型的记忆能力。同类可对比的替代方案包括 LongBench、L-Eval、ZeroSCROLLS。
上一篇:Loong
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.