hallucination-detection

本站收录 12 个带「hallucination-detection」标签的 AI 开源项目

iFixAiiFixAi 是一个面向 AI Agent 的独立审计工具,旨在快速回答 AI Agent 经济中最关键的问题:Agent 是否在按预期工作?它支持由人类或 A★ 16,623uptrainUpTrain 是一个开源的统一平台,用于评估和改进生成式 AI 应用。它提供 20 多种预配置检查项,覆盖语言、代码、嵌入等场景,可为 LLM 输出打分,并对★ 2,365future-agiFuture AGI 是一个开源的端到端平台,用于评估、观测和优化 LLM 及 AI 智能体应用。它集成了追踪、评测、模拟、数据集管理、网关和护栏等核心功能,帮★ 2,102uqlmUQLM 是一个专注于大语言模型(LLM)不确定性量化的 Python 包,源自 JMLR 2026 论文。它解决的核心问题是:LLM 在生成文本时经常产生幻觉★ 1,205dingoDingo 是一个面向 AI 数据、模型与应用的质量评测工具,用 Python 编写。它要解决的问题是:大模型项目里数据质量参差不齐、模型输出难以量化评估,团队★ 757sigmapsigmap 是一个面向 AI 编程会话的代码上下文压缩工具,核心目标是把喂给大模型的代码信息压缩到原来的约 3%,从而显著降低 token 消耗。它通过提取代★ 637entrolyentroly 是一个面向 AI 代理和开发者的上下文优化平台,专注于解决 AI 交互中的上下文膨胀、信息丢失和可追溯性问题。它支持文件、对话、RAG、代码、日★ 471Awesome-LVLM-Hallucination这是一个持续更新的精选列表,汇总了大型视觉语言模型(LVLM)幻觉研究的最新论文、资源和相关工作。它旨在解决LVLM在生成文本时可能产生与图像内容不符的幻觉信息★ 332UHGEvalUHGEval 是一个面向大语言模型幻觉评估的用户友好型框架,由 ACL 2024 论文提出。它旨在解决 LLM 在实际应用中生成不忠实或虚假内容的问题,通过提★ 182Lookback-LensLookback-Lens 是 EMNLP 2024 论文的官方代码实现,专注于检测和缓解大语言模型中的上下文幻觉问题。它提出了一种仅利用注意力图(attent★ 154SIMURGSIMURG 是一个面向大语言模型流式输出的在线异常检测与防护工具。它解决的核心问题是:LLM 在解码过程中常出现重复循环、语言漂移、乱码等退化现象,而传统方案★ 108Chain-of-EmbeddingChain-of-Embedding 是 ICLR 2025 论文的官方代码与数据仓库,提出了一种无需生成输出即可让大语言模型进行自我评估的方法。它利用潜在空间★ 105