Awesome-LLM-Uncertainty-Reliability-Robustness

一页看懂LLM可靠性研究全景,找论文、查基准、避幻觉坑

这是一个聚焦大语言模型不确定性、可靠性与鲁棒性的精选资源清单,汇集了相关论文、工具、数据集和评测基准。项目解决LLM在实际应用中普遍存在的幻觉、过度自信、知识边界模糊和对抗攻击脆弱性等问题,帮助研究者和工程师系统性地追踪该领域的前沿进展。核心能力包括:按主题分类整理数百篇关键论文,覆盖校准、思维链推理、上下文学习、幻觉检测、不确定性量化等方向;提供常用评测基准和工具链的索引;持续更新以反映最新研究动态。作为awesome系列的一员,它降低了领域入门门槛,让使用者能快速定位到特定问题的解决方案和参考资料。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 834
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队jxzhangjhu
所属国家
官网地址
定价模式free
价格说明这是一个开源资源列表,完全免费,无需付费或试用。
访问状态
是否开源是
开源协议MIT
主要语言
技术栈/模型awesome-list,calibration,chain-of-thought,chatgpt,gpt-3,gpt-4,hallucination,in-context-learning,large-language-models,llms,prompt-engineering,prompting,reliability,robustness,safety,uncertainty-estimation,uncertainty-quantification
GitHub 星标★ 834
30天Star增速
HF 下载量
上线时间2023-03-20 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 主题分类清晰,覆盖校准、幻觉、鲁棒性等关键子领域,检索效率高
  • 收录了大量最新论文和评测基准,紧跟GPT-4、ChatGPT等前沿模型研究
  • 作为awesome-list维护活跃,社区贡献机制保证内容持续更新

不足之处

  • 文档/社区待观察
  • 仅提供资源索引,不含代码实现或评测结果,需自行阅读原文
  • 部分分类深度不一,个别子领域条目较少,覆盖不均衡

适用场景

  • 研究者快速调研LLM不确定性量化与校准方法时查找核心文献
  • 工程师评估模型在敏感场景(医疗、金融)的可靠性,筛选评测基准
  • 学生入门LLM安全与鲁棒性方向,梳理知识体系和关键论文

替代项目

Awesome-LLM-Safety、Awesome-LLM-Hallucination、TrustLLM

项目介绍

Awesome-LLM-Uncertainty-Reliability-Robustness 是评测安全领域的开源项目,由 jxzhangjhu 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(834)位列前 30%,在评测安全分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。这是一个开源资源列表,完全免费,无需付费或试用。

它主要面向的使用场景是:研究者快速调研LLM不确定性量化与校准方法时查找核心文献。同类可对比的替代方案包括 Awesome-LLM-Safety、Awesome-LLM-Hallucination、TrustLLM。

上一篇:geobench

下一篇:Rules.txt

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12