
long-context-attention
把超长上下文注意力切到多卡上,训练推理都能跑更长
long-context-attention 是面向长上下文 Transformer 训练与推理的序列并行注意力实现,核心是 USP(Unified Sequence Parallelism),把 DeepSpeed-Ulysses 式的头维切分与 Ring-Attention 式的序列维切分统一成 2D 混合并行方案。它解决的是单卡显存装不下超长序列、而单一并行策略在扩展性和通信效率上受限的问题:通过在不同并行维度上同时切分注意力头与序列块,让模型在数十万 token 的上下文长度下仍能保持较高 GPU 利用率,并兼容训练与推理两种流程。项目以 Python/PyTorch 实现,提供可直接替换的注意力接口,便于接入现有 Megatron/DeepSpeed 类训练框架,同时支持因果与非因果注意力,适合需要处理长文档、长代码库或长对话历史的大模型团队。
项目数据
使用教程
核心亮点
- 统一 Ulysses 头并行与 Ring 序列并行,兼顾扩展性与通信效率
- 同时覆盖训练和推理,接口可替换现有注意力模块
- 基于 PyTorch 实现,便于接入 DeepSpeed/Megatron 生态
不足之处
- 693 星属早期项目,生产环境验证案例有限
- 依赖特定并行框架版本,跨框架迁移需额外适配
适用场景
- 长文档理解模型的预训练与微调
- 长代码库或长对话历史的大模型推理
- 需要超长上下文的科研实验与并行策略对比
替代项目
DeepSpeed-Ulysses、Ring-Attention、Megatron-LM
项目介绍
上一篇:ai8x-training
下一篇:Primus
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···