uqlm

量化 LLM 不确定性,精准识别幻觉,提升 AI 输出可信度。

UQLM 是一个专注于大语言模型(LLM)不确定性量化的 Python 包,源自 JMLR 2026 论文。它解决的核心问题是:LLM 在生成文本时经常产生幻觉(hallucination),而模型自身给出的置信度往往不可靠。UQLM 提供了一套系统化的工具,用于估计模型输出的置信度分数、检测幻觉内容,并评估不同不确定性量化方法的效果。其核心能力包括:集成多种置信度估计方法(如基于 logits、采样一致性、自评估等)、统一的评估框架、以及便于与现有 LLM 工作流集成的 API。该包旨在帮助开发者更好地理解模型何时可能出错,从而提升 AI 系统的安全性和可靠性,尤其适用于对输出准确性要求高的应用场景。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1202
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类评测安全
开发团队cvs-health
所属国家
定价模式free
价格说明开源Python包,Apache-2.0许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型ai-evaluation,ai-safety,confidence-estimation,confidence-score,hallucination,hallucination-detection,hallucination-evaluation,hallucination-mitigation,llm,llm-evaluation,llm-hallucination,llm-safety,uncertainty-estimation,uncertainty-quantification
GitHub 星标★ 1202
30天Star增速
HF 下载量
上线时间2025-04-17 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数8

使用教程

难度:入门 约 5 分钟 部署方式:库/依赖 4 步

环境要求

  • 已安装 Python 及 pip(README 未限定具体版本,建议使用较新的 Python 3.x)
  • 能正常访问 PyPI 以拉取 uqlm 包
  • 建议在独立虚拟环境中安装,避免与已有依赖冲突
  • 如需调用商业 LLM 作为后端,需自备对应服务的 API 密钥(README 节选未给出变量名,请查阅官方文档)

安装与启动步骤

  1. 1检查 Python 环境

    确认本机已安装 Python 与 pip,可正常执行 pip 命令。README 未限定最低版本,建议用较新版本。

    python --version
    pip --version
  2. 2安装 uqlm

    README 给出的唯一安装方式:从 PyPI 安装最新版。建议在虚拟环境或容器中执行,避免污染全局环境。

    pip install uqlm
  3. 3验证安装

    导入 uqlm 包,若无报错说明安装成功。可顺带打印版本号,确认拉取到的是预期版本。

    python -c "import uqlm; print(getattr(uqlm, '__version__', 'ok'))"
  4. 4查看官方文档

    README 节选未包含使用示例与打分器配置,请打开官方文档了解幻觉检测的调用方式与评估流程。

如何确认成功

执行 python -c "import uqlm" 无 ImportError;也可用 pip show uqlm 查看已安装版本与路径。

常见问题

Q:安装时下载很慢或超时怎么办?

A:可临时指定国内镜像源加速,例如执行 pip install uqlm -i https://pypi.tuna.tsinghua.edu.cn/simple,安装完成后无需再做其他配置。

Q:uqlm 支持哪些 Python 版本?

A:README 节选未写明版本要求,建议使用较新的 Python 3.x,并以官方文档 https://cvs-health.github.io/uqlm/latest/index.html 的说明为准。

Q:装好之后怎么开始做幻觉检测?

A:README 节选只给了安装命令,打分器调用示例请查阅官方文档的 Hallucination Detection 章节,按其示例代码逐步运行。

Q:需要配置 API 密钥吗?

A:取决于所选的评分方法:基于 logits 或采样一致性的方法需要调用 LLM 后端,因此通常要准备对应服务商的密钥,具体变量名请参考官方文档。

注意事项

  • README 节选仅提供 pip install uqlm 一条安装命令,本教程未虚构任何使用命令。
  • 项目许可证为 Apache-2.0,商用前请确认许可条款。
  • 建议在虚拟环境(如 venv/uv)中安装,避免与其他项目的依赖版本冲突。
  • 更多用法、示例和 API 说明请访问官方文档站点。

核心亮点

  • 提供多种置信度估计方法,覆盖 logits、采样、自评等主流思路,便于对比选型
  • 基于 JMLR 论文,方法论有学术背书,评估框架严谨
  • API 设计简洁,易于集成到现有 LLM 推理管道中,快速上手

不足之处

  • 文档/社区待观察
  • 依赖较新,可能对旧版本 Python 或框架兼容性有限

适用场景

  • 构建 RAG 系统时,对检索答案进行幻觉检测和置信度过滤
  • 金融、医疗等高风险领域,对 LLM 输出进行可靠性评估
  • LLM 应用开发中,用于自动化评估不同模型或提示词的不确定性表现

替代项目

lm-polygraph、uncertainty-baselines、langkit

项目介绍

uqlm 是评测安全领域的开源项目,由 cvs-health 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,202)位列前 30%,在评测安全分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源Python包,Apache-2.0许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:构建RAG系统时,对检索答案进行幻觉检测和置信度过滤。同类可对比的替代方案包括 lm-polygraph、uncertainty-baselines、langkit。

上一篇:chinese-llm-benchmark

下一篇:judgeval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12