hypoarena

埋好因果链的合成文献,用 Elo 赛出谁能挖出真假设

HypoArena 是一个面向科学假设发现的评测工作台,核心目标是让「AI 能否从文献中挖出真正有价值的假设」这件事变得可复现、可量化。它用合成文献生成器在语料里埋入已知的因果链,再让不同模型或策略通过「生成—辩论—进化」循环去挖掘假设,最后用 Elo 锦标赛检验系统能否恢复出预设的能力排序。项目内置假设—证据图结构,把每个假设和支撑它的文献片段绑定,避免模型凭空编造;同时提供释义去重、贝叶斯证据累积和可复现报告,方便横向比较不同适配器。计算核心基于 NumPy,CPU 即可运行,torch 只是可选依赖,离线适配器可插拔,适合在无网络或受限环境下做对照实验。它解决的是假设生成类研究长期缺少客观基准的问题:以往只能靠人工读论文判断好坏,现在可以用埋点因果链和 Elo 排名给出可重复的分数。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 562
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类评测安全
开发团队OpSafari
所属国家
官网地址
定价模式free
价格说明开源免费,NumPy 核心,CPU-only torch 可选
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 562
30天Star增速
HF 下载量
上线时间2026-09-30 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-06
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 用合成文献埋入已知因果链,让假设发现能力有客观标准答案可对照
  • 生成—辩论—进化循环配合可插拔离线适配器,方便横向对比不同模型策略
  • NumPy 核心加 CPU-only torch,无需 GPU 也能跑完整评测流程

不足之处

  • 合成文献与真实科研语料的分布差距较大,评测结论外推到真实场景需谨慎
  • 项目处于早期,社区规模小,适配器与数据集的生态丰富度有限

适用场景

  • 科研团队评估不同大模型在文献假设生成任务上的真实能力差异
  • AI 研究者做假设发现算法的消融实验,需要可复现的基准与排名
  • 受限离线环境下搭建无 GPU 的假设挖掘评测流水线

替代项目

SciAgent、PaperQA

项目介绍

hypoarena 是评测安全领域的开源项目,由 OpSafari 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 494 个项目,GitHub 星标数为 562。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-01。开源免费,NumPy 核心,CPU-only torch 可选。

它主要面向的使用场景是:科研团队评估不同大模型在文献假设生成任务上的真实能力差异。同类可对比的替代方案包括 SciAgent、PaperQA。

上一篇:getIPIntel

下一篇:没有了!

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1527 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2986 2026-09-12