MHLA

用 token 级多头,让线性注意力恢复全量表达力

MHLA 是一个面向图像生成与语言建模的线性注意力机制改进项目,旨在解决线性注意力在表达力上的不足。传统线性注意力通过核函数近似 softmax 注意力,虽降低了计算复杂度,但牺牲了模型对复杂 token 关系的建模能力。MHLA 提出在 token 级别引入多头机制,将每个 token 的注意力计算拆分为多个子空间,从而在不显著增加计算成本的前提下恢复线性注意力的表达力。项目基于 PyTorch 实现,支持图像分类(ImageNet)、图像生成(如 Sana 架构)、视频生成和语言建模等任务,提供了与 DiT 等主流架构的集成示例。核心能力包括:高效的线性注意力实现、token 级多头分解策略、以及跨模态任务的验证。该项目为 ICLR 2026 投稿,代码已开源,适合研究高效注意力机制和长序列建模的开发者。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 157
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队DAGroup-PKU
所属国家
定价模式free
价格说明开源项目,MIT许可证,提供在线项目页面,无收费信息,完全免费。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型dit,image-classification,image-generation,imagenet,language-modeling,linear-attention,sana,video-generation
GitHub 星标★ 157
30天Star增速
HF 下载量
上线时间2025-12-28 00:00:00
最近更新2026-09-01 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 提出 token 级多头分解,直接提升线性注意力对细粒度关系的建模能力
  • 支持图像生成、分类、视频、语言多任务,验证场景广泛
  • 基于 Sana/DiT 集成,易于在现有扩散模型上替换使用

不足之处

  • 早期项目,文档和社区支持待观察
  • 未提供与标准 softmax 注意力的详细性能对比基准

适用场景

  • 长序列图像生成(如高分辨率扩散模型)
  • 视频生成中的时空注意力建模
  • 高效语言模型的长上下文推理

替代项目

FlashAttention、Linear Attention (Linformer)、Mamba

项目介绍

MHLA 是模型训练领域的开源项目,由 DAGroup-PKU 开发,2025 年首次发布。

它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 157。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-01。MIT许可证,提供在线项目页面,无收费信息,完全免费。从国内网络环境看,可直接访问。

它主要面向的使用场景是:长序列图像生成(如高分辨率扩散模型)。同类可对比的替代方案包括 FlashAttention、Linear Attention (Linformer)、Mamba。

上一篇:WaDi

下一篇:flow-matching

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13