SAELens

把大模型内部激活拆成可读特征,训练与复用 SAE

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1553
维护状态 较活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队decoderesearch
所属国家
定价模式free
价格说明开源免费,无付费服务
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 1553
30天Star增速
HF 下载量
上线时间2023-11-29 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-12
浏览次数0

项目介绍

SAELens 是一个用于在语言模型上训练稀疏自编码器(Sparse Autoencoder, SAE)的开源工具库。它解决的核心问题是:大语言模型内部神经元是多义、纠缠的,难以直接解释某个激活代表什么概念;SAE 通过把稠密激活分解为大量稀疏、近似单义的潜在特征,让模型内部表示更可读、可干预。SAELens 提供从 HuggingFace 模型加载激活、配置并训练 SAE、评估稀疏度与重构质量、以及把训练好的 SAE 用于特征可视化和因果干预的完整流程,并内置对多种预训练 SAE 的加载接口,方便研究者直接复用。它面向可解释性研究和安全分析,让研究者不必从零实现训练循环与评估指标,能更快复现和对比不同 SAE 架构与超参数。

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:进阶 约 20 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目为 Python 库,README 未给出具体版本要求)
  • PyTorch(SAELens 的推理基于任何 PyTorch 模型)
  • 可选:TransformerLens、Hugging Face Transformers、NNsight 等用于提取激活的框架
  • 网络可访问 GitHub 与官方文档站以便查阅安装与使用说明

安装与启动步骤

  1. 1确认环境依赖

    先准备 Python 与 PyTorch 环境。README 说明 SAELens 的推理可与任何 PyTorch 模型配合使用,不限于 TransformerLens。

  2. 2获取项目源码

    从 GitHub 克隆 SAELens 仓库到本地,便于查看源码与配套说明。

    git clone https://github.com/decoderesearch/SAELens.git
  3. 3查阅官方文档

    README 明确指向官方文档,安装方式、下载与分析预训练 SAE、训练自己的 SAE 都以该文档为准。

  4. 4加载预训练 SAE

    按 README,各模型的预训练 SAE 可通过 SAELens 直接导入,用于分析与复用,无需自己训练。

  5. 5生成特征面板

    使用 SAE-Vis 库(callummcdougall/sae_vis)为训练好的 SAE 生成 feature dashboard 做可视化。

如何确认成功

README 未给出安装验证命令;按官方文档成功导入 SAELens 并加载一个预训练 SAE 即表示环境可用。

常见问题

Q:SAELens 只能搭配 TransformerLens 使用吗?

A:不是。README 说明推理可与任何 PyTorch 模型配合,与 TransformerLens 通过 HookedSAETransformer 深度集成,也可用于 Hugging Face Transformers、NNsight 等框架,只要提取激活后传给 SAE 的 encode()/decode()。

Q:怎么下载和分析预训练 SAE?

A:README 将这部分指向官方文档 https://decoderesearch.github.io/SAELens/ ,请按文档中“下载与分析预训练 SAE”章节操作。

Q:怎么训练自己的 SAE?

A:README 未给出训练命令,仅说明官方文档包含“训练自己的稀疏自编码器”的说明,请以文档为准。

Q:如何生成特征可视化面板?

A:使用 SAE-Vis 库,地址见 https://github.com/callummcdougall/sae_vis/tree/main ,README 称可用它生成 feature dashboards。

Q:一定要有 GPU 吗?

A:README 节选中没有说明硬件要求,是否需要 GPU 请查阅官方文档。

注意事项

  • 本次 README 节选中没有安装命令,因此未给出 pip install 等具体安装指令,请以官方文档为准
  • 项目定位是可解释性研究与安全分析工具,使用前建议先了解 SAE(稀疏自编码器)的基本概念
  • 核心能力包括:训练 SAE、分析 SAE、加载预训练 SAE、生成特征可视化

核心亮点

  • 提供从激活采集、SAE 训练到评估的端到端流程,减少重复造轮子
  • 内置多种预训练 SAE 的加载与复用接口,便于直接做可解释性实验
  • 与 HuggingFace 生态衔接,支持常见开源语言模型,上手成本较低

不足之处

  • 主要面向研究场景,缺少面向生产部署的工程化封装与性能优化
  • 文档和教程相对偏少,新用户配置训练参数时可能需要读源码

适用场景

  • 研究大模型内部特征与概念表示的可解释性实验
  • 对模型激活做稀疏分解后开展因果干预与行为分析
  • 复现或对比不同 SAE 架构、稀疏度与重构效果的基准测试

替代项目

TransformerLens、dictionary_learning

上一篇:opacus

下一篇:neural-structured-learning

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63550 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1314 2026-08-13