hash-hop

自动生成超长文本定位题,快速测出模型长上下文真本事

hash-hop 是一个面向大语言模型长上下文能力的评测工具,用 Python 编写并通过 Terraform 管理评测所需的基础设施。它要解决的问题是:现有长上下文评测往往依赖人工构造样本或固定数据集,难以规模化、可复现地检验模型在超长输入下的检索、推理与信息保持能力。hash-hop 的核心思路是把评测任务与哈希/跳转式定位机制结合,自动生成需要模型在长文本中定位并利用特定片段的任务,从而量化模型是否真正利用了远距离上下文,而非仅靠局部线索猜测。项目提供可复现的评测流程,借助 Terraform 声明式地拉起运行环境,降低部署成本,适合研究团队在自有模型或 API 模型上做横向对比。当前星标约 230,属于早期项目,功能与文档仍在演进中。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 230
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类评测安全
开发团队magic-ai-research
所属国家
定价模式free
价格说明开源免费,定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型terraform-managed
GitHub 星标★ 230
30天Star增速
HF 下载量
上线时间2024-08-29 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-25
浏览次数0

使用教程

核心亮点

  • 用哈希/跳转机制自动生成需跨长距离定位的评测样本,减少人工造题成本
  • 通过 Terraform 管理评测基础设施,环境可声明式复现,便于团队协作与结果对比
  • 聚焦长上下文这一当前模型关键短板,能暴露模型在超长输入下的检索与信息保持缺陷

不足之处

  • 项目处于早期,评测任务类型和覆盖维度可能还不够全面
  • 文档与社区生态尚不成熟,接入自有模型或自定义任务的上手成本待观察

适用场景

  • 研究团队对比多个 LLM 的长上下文检索与推理能力
  • 模型厂商在发布新版本前做长上下文回归测试
  • 评测机构构建可复现的长上下文基准并公开结果

替代项目

LongBench、RULER

项目介绍

hash-hop 是评测安全领域的开源项目,由 magic-ai-research 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 230。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。开源免费。

它主要面向的使用场景是:研究团队对比多个LLM的长上下文检索与推理能力。同类可对比的替代方案包括 LongBench、RULER。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12