Awesome-LLM-Reasoning-Failures

一库看懂大模型推理翻车现场与原因

这是一个围绕《Large Language Model Reasoning Failures》论文整理的开源资源库,系统收集大语言模型在推理任务中出错的案例、分类与相关研究。它解决的核心问题是:当前 LLM 在数学、逻辑、形式化证明、常识与具身推理等场景中常给出看似合理却错误的答案,而研究者缺少统一入口来定位失败模式。项目按认知推理、具身推理、形式推理、非形式推理等维度组织条目,汇总论文、基准测试、失败案例与分析方法,帮助研究者快速理解模型在哪些环节容易出错、错误有何规律。对做评测、安全对齐或推理增强的团队来说,它可作为选题与对照的索引,降低文献检索成本,也便于在设计新基准时参考已有失败分类。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 223
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类评测安全
开发团队Peiyang-Song
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源是
开源协议MIT
主要语言
技术栈/模型cognitive-reasoning,embodied-reasoning,failure-analysis,formal-reasoning,informal-reasoning,llm,llm-reasoning,logical-reasoning,physical-reasoning
GitHub 星标★ 223
30天Star增速
HF 下载量
上线时间2025-08-18 00:00:00
最近更新2026-09-20 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-25
浏览次数0

使用教程

核心亮点

  • 按认知、具身、形式、非形式等维度分类整理推理失败案例,检索路径清晰
  • 直接对应同名论文,可作为论文的配套资源索引,方便复现与延伸阅读
  • 聚焦失败分析而非单纯刷榜,对评测与安全对齐方向有实际参考价值

不足之处

  • 以链接和文献汇总为主,缺少可运行的评测代码或统一数据格式
  • 早期项目,条目覆盖与更新频率依赖维护者,社区讨论规模有限

适用场景

  • 研究 LLM 推理能力边界,快速定位已有失败模式与相关论文
  • 设计新的推理评测基准时,参考失败分类避免重复造轮子
  • 安全对齐团队排查模型在逻辑与常识推理上的系统性错误

替代项目

Awesome-LLM、LLM-Reasoning-Papers

项目介绍

Awesome-LLM-Reasoning-Failures 是评测安全领域的开源项目,由 Peiyang-Song 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 223。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源免费,无在线服务。

它主要面向的使用场景是:研究LLM推理能力边界,快速定位已有失败模式与相关论文。同类可对比的替代方案包括 Awesome-LLM、LLM-Reasoning-Papers。

上一篇:hash-hop

下一篇:Awesome-KV-Cache-Optimization

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12