long-form-factuality 是评测安全领域的开源项目,由 google-deepmind 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 693。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-01。代码公开,可自行部署使用,无收费计划。
它主要面向的使用场景是:研究机构对大模型事实性进行横向评测。同类可对比的替代方案包括 HELM、MMLU、TruthfulQA。

测出大模型长篇回答里有多少真话
这是一个用于评估大语言模型长文本事实性(long-form factuality)的基准测试工具,来自论文《Long-form factuality in large language models》的官方代码。它解决了当前LLM在生成开放式长回答时容易产生事实性错误、且缺乏系统评估方法的问题。核心能力包括:提供了一套包含38个主题、覆盖广泛领域的提示词集(LongFact),用于触发模型生成长文本回答;实现了基于细粒度事实分解的自动评估指标(如F1分数),通过将回答拆分为独立事实点并与参考知识库比对,量化模型的事实准确率;支持多种主流LLM(如GPT、Claude、Llama等)的接入与评估,并提供了可视化分析工具。该基准有助于研究者客观比较不同模型在长文本生成中的事实可靠性,推动模型在事实性方面的改进。
HELM、MMLU、TruthfulQA
long-form-factuality 是评测安全领域的开源项目,由 google-deepmind 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 693。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-01。代码公开,可自行部署使用,无收费计划。
它主要面向的使用场景是:研究机构对大模型事实性进行横向评测。同类可对比的替代方案包括 HELM、MMLU、TruthfulQA。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.