Differential-Transformer-PyTorch

用差分注意力降低噪声,让模型更聚焦关键信息

Differential-Transformer-PyTorch 是微软提出的 Differential Transformer 架构的 PyTorch 非官方实现,专注于序列建模,采用类似大语言模型的 decoder-only 结构。该架构核心是新颖的差分注意力机制(Differential Attention),通过计算两个注意力分布的差异来降低噪声,从而提升模型对关键信息的聚焦能力。项目还集成了多头注意力、RMSNorm 和 SwiGLU 激活函数,旨在复现论文中的性能表现,为研究者和开发者提供一个可直接使用的参考实现。它解决了传统注意力机制中噪声干扰和注意力分散的问题,尤其适合长序列建模和需要高精度信息检索的任务。当前项目处于早期阶段,代码简洁,便于学习和二次开发,但功能完整性和稳定性有待完善。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 86
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队nanowell
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型differential-transformer,large-language-models,machine-learning,pytorch
GitHub 星标★ 86
30天Star增速
HF 下载量
上线时间2024-10-08 00:00:00
最近更新2026-02-05 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 实现差分注意力机制,有效降低注意力噪声,提升关键信息聚焦能力
  • 代码结构清晰,基于 PyTorch,易于理解和二次开发
  • 包含完整的多头注意力、RMSNorm、SwiGLU 等现代 LLM 组件,紧跟前沿

不足之处

  • 项目早期,文档和社区支持较少
  • 未提供预训练模型或完整训练脚本,需自行训练验证

适用场景

  • 长序列文本建模,如文档摘要、机器翻译
  • 需要高精度信息检索的任务,如问答系统
  • 作为研究基线,对比传统 Transformer 的噪声抑制效果

替代项目

Transformer-XL、Longformer、Sparse Transformer

项目介绍

Differential-Transformer-PyTorch 是开源模型领域的开源项目,由 nanowell 开发,2024 年首次发布。

它收录于开源模型分类,该分类目前共有 424 个项目,GitHub 星标数为 86。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-02-05。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:长序列文本建模,如文档摘要、机器翻译。同类可对比的替代方案包括 Transformer-XL、Longformer、Sparse Transformer。

上一篇:Baichuan2

下一篇:rubra

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10