long-context-attention

把超长上下文注意力切到多卡上,训练推理都能跑更长

long-context-attention 是面向长上下文 Transformer 训练与推理的序列并行注意力实现,核心是 USP(Unified Sequence Parallelism),把 DeepSpeed-Ulysses 式的头维切分与 Ring-Attention 式的序列维切分统一成 2D 混合并行方案。它解决的是单卡显存装不下超长序列、而单一并行策略在扩展性和通信效率上受限的问题:通过在不同并行维度上同时切分注意力头与序列块,让模型在数十万 token 的上下文长度下仍能保持较高 GPU 利用率,并兼容训练与推理两种流程。项目以 Python/PyTorch 实现,提供可直接替换的注意力接口,便于接入现有 Megatron/DeepSpeed 类训练框架,同时支持因果与非因果注意力,适合需要处理长文档、长代码库或长对话历史的大模型团队。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 693
维护状态 活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队feifeibear
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型attention-is-all-you-need,deepspeed-ulysses,llm-inference,llm-training,pytorch,ring-attention
GitHub 星标★ 693
30天Star增速
HF 下载量
上线时间2024-03-27 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 统一 Ulysses 头并行与 Ring 序列并行,兼顾扩展性与通信效率
  • 同时覆盖训练和推理,接口可替换现有注意力模块
  • 基于 PyTorch 实现,便于接入 DeepSpeed/Megatron 生态

不足之处

  • 693 星属早期项目,生产环境验证案例有限
  • 依赖特定并行框架版本,跨框架迁移需额外适配

适用场景

  • 长文档理解模型的预训练与微调
  • 长代码库或长对话历史的大模型推理
  • 需要超长上下文的科研实验与并行策略对比

替代项目

DeepSpeed-Ulysses、Ring-Attention、Megatron-LM

项目介绍

long-context-attention 是一个模型训练领域的开源项目,官方简介:USP: Unified (a.k.a. Hybrid, 2D) Sequence Parallel Attention for Long Context Transformers Model Training and Inference。项目使用 Python 开发,在 GitHub 上获得 693 星标。

上一篇:ai8x-training

下一篇:Primus

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61694 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1279 2026-08-13