J-Wash

可视化模型内部机制,手动微调对齐行为并导出结果

J-Wash 是一个基于 Anthropic Jacobian Lens 技术构建的大语言模型手动对齐工具。它通过分析模型内部激活值的雅可比矩阵,帮助开发者直观理解模型对输入变化的敏感度,从而定位模型行为中的潜在偏差或错误模式。用户可以通过交互式界面手动调整模型行为,实现精细化的对齐控制,并将调整结果导出为可复用的配置或数据。该工具解决了传统对齐方法依赖黑盒测试、难以精确干预模型内部机制的问题,为模型安全性和可控性提供了新的技术路径。核心能力包括雅可比矩阵可视化、手动干预接口、结果导出功能,适用于研究、审计和模型微调等场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 228
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Extraltodeus
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型abliteration,ai,anthropic,artificial-intelligence,huggingface,interpretability,j-wash,jacobian-lens,large-language-models,llm,mechanistic-interpretability,model-editing,neural-networks,pytorch,research,steering,transformers,visualization
GitHub 星标★ 228
30天Star增速
HF 下载量
上线时间2026-07-13 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 基于前沿的 Jacobian Lens 技术,提供模型内部激活值的深度可解释性
  • 支持手动干预模型行为,实现比纯自动对齐更精细的控制
  • 结果可导出,便于集成到现有工作流或用于审计记录

不足之处

  • 依赖 Anthropic 特定技术,可能对非 Claude 模型兼容性有限
  • 早期项目,文档和社区支持尚不完善

适用场景

  • 研究模型内部机制与安全对齐的学术场景
  • 企业审计模型行为并记录对齐过程的合规场景
  • 开发者调试模型输出偏差的日常开发场景

替代项目

TransformerLens、Elicit、LIMA

项目介绍

J-Wash 是模型训练领域的开源项目,由 Extraltodeus 开发,是 2026 年新上线的项目。

它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 228。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:研究模型内部机制与安全对齐的学术场景。同类可对比的替代方案包括 TransformerLens、Elicit、LIMA。

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13