xlstm

让 LSTM 重获新生,长序列建模更快更省

xLSTM 是 Sepp Hochreiter 团队提出的新一代 LSTM 架构的官方实现,旨在解决传统 LSTM 在长序列建模中的记忆容量和并行化瓶颈。它通过引入指数门控和可并行化的矩阵内存结构,显著提升了模型对长程依赖的捕捉能力,同时保留了 LSTM 的线性计算复杂度。该仓库提供了完整的训练、评估和推理代码,支持多种下游任务(如语言建模、时间序列预测),并兼容 PyTorch 生态。核心能力包括:基于 sLSTM 和 mLSTM 的两种变体、可扩展的硬件高效实现、以及针对长上下文场景的优化。项目解决了 Transformer 在高计算成本和二次复杂度上的痛点,为序列建模提供了高效且可解释的替代方案。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2205
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队NX-AI
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型deep-learning,deep-learning-architecture,llm,machine-learning,nlp,rnn
GitHub 星标★ 2205
30天Star增速
HF 下载量
上线时间2024-05-08 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境(README 提供 conda 环境文件 environment_pt240cu124.yaml)
  • PyTorch >= 1.8(README 说明已测试的版本范围)
  • 使用 xLSTM Large 7B 时需额外安装 mlstm_kernels 包
  • 可选的 conda 或 pip 包管理工具

安装与启动步骤

  1. 1创建conda环境

    用仓库提供的 environment_pt240cu124.yaml 创建隔离环境,这是 README 推荐的经过测试的环境。

    conda env create -f environment_pt240cu124.yaml
  2. 2克隆并安装仓库

    从 GitHub 拉取源码并以可编辑模式安装 xlstm 模块,适合需要修改代码的场景。

    git clone https://github.com/NX-AI/xlstm.git
    cd xlstm
    pip install -e .
  3. 3或用pip直接安装

    只想用模型代码、不需要改源码时,直接安装 xlstm 包即可。

    pip install xlstm
  4. 4安装7B依赖内核

    若要使用 xLSTM Large 7B 模型,需先安装官方 mlstm_kernels 内核包。

    pip install mlstm_kernels
  5. 5跑前向传播验证

    按 README 在 notebooks/xlstm_large/demo.ipynb 中的示例,初始化随机模型并做一次前向传播。

    import torch
    from xlstm.xlstm_large.model import xLSTMLargeConfig, xLSTMLarge
    
    # run a forward pass
    out = xlstm(input)
    out.shape[1:] == (256, 2048)

如何确认成功

执行前向传播后输出张量形状满足 out.shape[1:]==(256, 2048),即说明安装与模型调用成功。

常见问题

Q:语言建模任务该用哪个类?

A:README 建议 token 类/语言建模任务使用 xLSTMLMModel,其他非语言任务或嵌入其他架构时使用 xLSTMBlockStack。

Q:xLSTM Large 7B 的代码在哪里?

A:提供独立单文件实现 xlstm/xlstm_large/model.py,示例见 notebooks/xlstm_large/demo.ipynb。

Q:7B 模型和论文版实现依赖一样吗?

A:不一样。xLSTM Large 实现需额外安装 mlstm_kernels,且不依赖 NeurIPS 论文版架构实现。

Q:对 PyTorch 版本有要求吗?

A:该包基于 PyTorch,README 说明测试过 >=1.8;推荐直接用 environment_pt240cu124.yaml 建环境。

注意事项

  • README 中 conda 创建命令被截断,此处按官方环境文件的标准用法补全,请以仓库内文件说明为准。
  • 使用 xLSTM Large 7B 前务必先安装 mlstm_kernels,否则单文件实现无法运行。
  • 推荐优先用 conda 环境文件复现经过测试的依赖组合,避免自行升级 PyTorch 导致不兼容。

核心亮点

  • 引入指数门控和矩阵内存,长序列记忆能力大幅超越传统 LSTM
  • 线性计算复杂度,比 Transformer 更省显存和算力,适合长上下文
  • 官方实现,代码质量高,支持 PyTorch,易于集成到现有项目

不足之处

  • 文档和社区生态仍在建设,教程和示例相对较少
  • 与 Transformer 生态相比,第三方工具和预训练模型资源有限

适用场景

  • 长文本语言建模,如书籍、文档级理解
  • 时间序列预测,如金融、气象数据
  • 边缘设备或资源受限环境下的序列推理

替代项目

Mamba、RWKV、Transformer

项目介绍

xlstm 是开源模型领域的开源项目,由 NX-AI 开发,2024 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(2,205)位列前 30%,在开源模型分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:长文本语言建模,如书籍、文档级理解。同类可对比的替代方案包括 Mamba、RWKV、Transformer。

上一篇:Chinese-Llama-2-7b

下一篇:hello-claw

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10