hash-hop 是评测安全领域的开源项目,由 magic-ai-research 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 230。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。开源免费。
它主要面向的使用场景是:研究团队对比多个LLM的长上下文检索与推理能力。同类可对比的替代方案包括 LongBench、RULER。

自动生成超长文本定位题,快速测出模型长上下文真本事
hash-hop 是一个面向大语言模型长上下文能力的评测工具,用 Python 编写并通过 Terraform 管理评测所需的基础设施。它要解决的问题是:现有长上下文评测往往依赖人工构造样本或固定数据集,难以规模化、可复现地检验模型在超长输入下的检索、推理与信息保持能力。hash-hop 的核心思路是把评测任务与哈希/跳转式定位机制结合,自动生成需要模型在长文本中定位并利用特定片段的任务,从而量化模型是否真正利用了远距离上下文,而非仅靠局部线索猜测。项目提供可复现的评测流程,借助 Terraform 声明式地拉起运行环境,降低部署成本,适合研究团队在自有模型或 API 模型上做横向对比。当前星标约 230,属于早期项目,功能与文档仍在演进中。
LongBench、RULER
hash-hop 是评测安全领域的开源项目,由 magic-ai-research 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 230。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。开源免费。
它主要面向的使用场景是:研究团队对比多个LLM的长上下文检索与推理能力。同类可对比的替代方案包括 LongBench、RULER。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.