hallucination-leaderboard

看哪个大模型摘要最不容易瞎编

hallucination-leaderboard 是一个用于评估大语言模型在短文档摘要任务中产生幻觉(即生成与原文不符内容)程度的开源排行榜。它通过统一的评测流程和指标,量化不同模型在摘要时的忠实度,帮助开发者直观对比各模型的可靠性。项目提供标准化的测试集和评分方法,支持模型排名展示,并允许社区贡献新模型结果。其核心价值在于将‘幻觉’这一抽象问题转化为可量化的榜单,为模型选型和改进提供数据支撑。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3313
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队vectara
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可自由使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型generative-ai,hallucinations,llm
GitHub 星标★ 3313
30天Star增速
HF 下载量
上线时间2023-10-31 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 5 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 与 Hugging Face 的网络环境
  • 本地安装 Git(仅克隆仓库时需要)
  • 现代浏览器(查看在线交互排行榜)

安装与启动步骤

  1. 1克隆项目仓库

    把排行榜仓库拉到本地,README.md 中包含最新榜单表格与历史版本分支说明。

    git clone https://github.com/vectara/hallucination-leaderboard.git
  2. 2查看排行榜数据

    打开 README.md,表格列出各模型的幻觉率、事实一致性率、回答率与平均摘要长度。

  3. 3查看在线交互榜单

    README 提供 Hugging Face 上的交互式排行榜页面,可直接网页浏览对比模型。

  4. 4切换历史版本

    早期基于 HHEM-1.0 的结果保存在独立分支,需要对比旧数据时切过去查看。

    git checkout hhem-1.0-final

如何确认成功

本地 README.md 能看到模型榜单表格,且浏览器能正常打开 Hugging Face 上的交互式排行榜页面。

常见问题

Q:需要安装 Python 依赖才能使用吗?

A:README 未提供任何安装或运行命令,该仓库主要用于展示评测结果,直接查阅 README 表格或在线榜单即可。

Q:如何查看旧版本的排行榜?

A:README 给出两个历史分支:hhem-1.0-final 和 hhem-2.3-old-dataset,克隆仓库后切换分支查看对应版本数据。

Q:排行榜多久更新一次?

A:README 说明会随模型和评测模型更新而定期更新,表格上方标注有最近更新日期(Last updated)。

Q:能否提交自己模型的评测结果?

A:README 未说明提交方式,如有需求可通过 GitHub 仓库反馈,请以仓库中实际提供的信息为准。

注意事项

  • README 中未给出本地运行或评测的命令,本文步骤仅为查阅榜单所需的最小准备动作。
  • 不同分支对应不同 HHEM 版本和数据集,跨版本比较模型分数时注意口径一致。
  • 榜单数值会随更新变化,引用时请注明查看日期与所用版本。

核心亮点

  • 提供标准化短文档摘要幻觉评测集,结果可复现
  • 榜单实时更新,覆盖主流开源与闭源模型
  • 量化忠实度指标,便于横向对比和趋势观察

不足之处

  • 评测场景仅限短文档摘要,覆盖任务类型有限
  • 文档/社区待观察

适用场景

  • 选择摘要模型时对比其忠实度
  • 研究幻觉问题并验证改进方法
  • 跟踪模型更新对幻觉表现的影响

替代项目

HaluEval、TruthfulQA、FActScore

项目介绍

hallucination-leaderboard 是评测安全领域的开源项目,由 vectara 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,313)位列前 30%,在评测安全分类的 466 个项目里位列前 8%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可自由使用和部署,无付费版本。

它主要面向的使用场景是:选择摘要模型时对比其忠实度。同类可对比的替代方案包括 HaluEval、TruthfulQA、FActScore。

上一篇:AI-Infra-Guard

下一篇:OSWorld

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12