interpretability
本站收录 15 个带「interpretability」标签的 AI 开源项目
awesome-production-machine-learning这是一个精选清单,汇集了部署、监控、版本管理和扩展机器学习系统的开源工具与库。它解决了机器学习模型从实验到生产落地过程中工具分散、选型困难的问题,帮助工程师和数★ 20,963
pytorch-grad-campytorch-grad-cam 是一个用于计算机视觉模型可解释性的高级工具库,基于 PyTorch 实现 Grad-CAM 及其多种变体。它解决了深度学习模型★ 12,984
inseqinseq 是一个用于序列生成模型的可解释性工具库,专注于帮助研究者和开发者理解 LLM 等生成式模型在输出文本时的内部决策过程。它解决了生成模型(如 GPT、★ 476
chat2graphChat2Graph 是一个图原生的智能体系统,旨在将对话能力与知识图谱技术深度融合。它解决的核心问题是:传统对话系统或 RAG 系统难以处理多跳关系查询、缺乏★ 430
Awesome-Attention-Heads这是一个关于大语言模型注意力头可解释性的精选资源库与综述项目。它系统性地整理了针对LLM中注意力头(attention heads)的解读、分析和可视化相关的研★ 416
diffusers-interpretDiffusers-Interpret 是一个面向 Hugging Face Diffusers 模型的可解释性工具库,旨在帮助开发者和研究者理解扩散模型生成图★ 277
J-WashJ-Wash 是一个基于 Anthropic Jacobian Lens 技术构建的大语言模型手动对齐工具。它通过分析模型内部激活值的雅可比矩阵,帮助开发者直观★ 230
axbenchaxbench 是斯坦福 NLP 团队推出的 Python 库,用于系统化评估大语言模型可解释性方法的实际效用。它解决的核心问题是:当前众多解释性方法(如注意力★ 218
KnowledgeCircuitsKnowledgeCircuits 是一个来自 NeurIPS 2024 的研究项目,专注于解析预训练 Transformer 模型(如大语言模型)内部的知识存★ 173
awesome-activation-engineering这是一个精选资源列表,专注于“激活工程”(Activation Engineering)领域,即通过修改神经网络内部激活值来引导模型行为的技术。项目整理了相关论★ 141
awesome-artificial-intelligence-research这是一个面向 AI 研究者的精选资源清单(Awesome List),系统整理了人工智能各子领域的前沿论文、工具、数据集与学习资料,覆盖推荐系统、计算机视觉、机★ 133
Chain-of-EmbeddingChain-of-Embedding 是 ICLR 2025 论文的官方代码与数据仓库,提出了一种无需生成输出即可让大语言模型进行自我评估的方法。它利用潜在空间★ 105
MonetMonet 是一个面向 Transformer 架构的开源模型,提出了混合单语义专家(Mixture of Monosemantic Experts)机制,旨在★ 79
automated-brain-explanationsautomated-brain-explanations 是一个用于生成和验证大脑自然语言解释的开源项目。它主要解决神经科学研究中,如何将复杂的脑成像数据(如 ★ 68
odysseyodyssey 是一个面向电子健康记录(EHR)数据的基础模型开发工具包。它旨在解决医疗领域数据复杂、标注困难、模型训练门槛高的问题,提供从数据预处理、模型构建★ 61