fanoutqa

多文档多跳问答基准,测出大模型真实推理力

FanOutQA 是 ACL 2024 论文的官方配套代码,用于构建和评估大语言模型在多跳、多文档问答任务上的能力。它提供了一个包含 180 个高难度问题的基准数据集,每个问题需要模型从多个维基百科文档中提取并整合信息,且答案需引用具体段落。项目核心能力包括:支持多种评估模式(如闭卷、开卷、证据链推理)、提供检索器与生成器的接口、内置评估指标(如 F1、EM、引用准确率),并附带基线模型(如 GPT-4)的评测结果。它解决了现有问答基准偏重单跳或单文档、难以测试模型复杂推理与证据整合能力的问题,为研究者提供了一个标准化、可复现的评测工具,尤其适合评估模型在长文本和多源信息处理上的表现。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 63
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队zhudotexe
所属国家
定价模式free
价格说明开源项目,MIT许可证,代码免费使用,无在线服务。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型benchmark,large-language-models,llms,natural-language-processing
GitHub 星标★ 63
30天Star增速
HF 下载量
上线时间2024-02-12 00:00:00
最近更新2026-07-30 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 官方配套代码,数据与评估流程完整,可复现论文结果
  • 支持多种评估模式,灵活适配不同推理场景
  • 提供引用级评估指标,能检验答案的证据支撑质量

不足之处

  • 数据集规模较小(180题),可能不足以全面评估模型
  • 文档/社区待观察

适用场景

  • 学术研究:评估大模型多跳推理与证据整合能力
  • 模型开发:对比不同检索器或生成器在复杂问答上的表现
  • 教育评测:用于测试学生或内部模型的长文本理解水平

替代项目

HotpotQA、2WikiMultiHopQA、MuSiQue

项目介绍

fanoutqa 是数据集领域的开源项目,由 zhudotexe 开发,2024 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 63。

项目仍在小幅维护中,最近一次代码更新于 2026-07-30。MIT许可证,代码免费使用,无在线服务。

它主要面向的使用场景是:学术研究:评估大模型多跳推理与证据整合能力。同类可对比的替代方案包括 HotpotQA、2WikiMultiHopQA、MuSiQue。

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09