hypoarena 是评测安全领域的开源项目,由 OpSafari 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 494 个项目,GitHub 星标数为 562。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-01。开源免费,NumPy 核心,CPU-only torch 可选。
它主要面向的使用场景是:科研团队评估不同大模型在文献假设生成任务上的真实能力差异。同类可对比的替代方案包括 SciAgent、PaperQA。

埋好因果链的合成文献,用 Elo 赛出谁能挖出真假设
HypoArena 是一个面向科学假设发现的评测工作台,核心目标是让「AI 能否从文献中挖出真正有价值的假设」这件事变得可复现、可量化。它用合成文献生成器在语料里埋入已知的因果链,再让不同模型或策略通过「生成—辩论—进化」循环去挖掘假设,最后用 Elo 锦标赛检验系统能否恢复出预设的能力排序。项目内置假设—证据图结构,把每个假设和支撑它的文献片段绑定,避免模型凭空编造;同时提供释义去重、贝叶斯证据累积和可复现报告,方便横向比较不同适配器。计算核心基于 NumPy,CPU 即可运行,torch 只是可选依赖,离线适配器可插拔,适合在无网络或受限环境下做对照实验。它解决的是假设生成类研究长期缺少客观基准的问题:以往只能靠人工读论文判断好坏,现在可以用埋点因果链和 Elo 排名给出可重复的分数。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
SciAgent、PaperQA
hypoarena 是评测安全领域的开源项目,由 OpSafari 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 494 个项目,GitHub 星标数为 562。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-01。开源免费,NumPy 核心,CPU-only torch 可选。
它主要面向的使用场景是:科研团队评估不同大模型在文献假设生成任务上的真实能力差异。同类可对比的替代方案包括 SciAgent、PaperQA。
上一篇:getIPIntel
下一篇:没有了!
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents