Liger-Kernel 是模型训练领域的开源项目,由 linkedin 开发,2024 年首次发布。
在全站 12,753 个收录项目中,它的 GitHub 星标数(6,618)位列前 7%,在模型训练分类的 516 个项目里位列前 8%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,Apache 2.0 许可证。
它主要面向的使用场景是:单卡或少量卡微调7B/8B模型时降低显存占用。同类可对比的替代方案包括 flash-attention、unsloth。

不改模型结构,给 LLM 训练省显存提吞吐
Liger-Kernel 是 LinkedIn 开源的一套面向大语言模型训练的 Triton 内核集合,目标是解决 LLM 微调与训练中显存占用高、计算效率低的问题。它把 RMSNorm、RoPE、SwiGLU、CrossEntropy、FusedLinearCrossEntropy 等常见算子用 Triton 重写并融合,减少中间张量的读写与显存分配,从而在不改变模型结构的前提下提升吞吐、降低显存。项目以 Python 包形式提供,可直接替换 HuggingFace Transformers 中的对应层,兼容 Llama、Llama3、Mistral、Gemma2、Phi3 等主流架构,支持全参微调、LoRA、DPO、GRPO 等训练流程。对显存受限、想用单卡或少量卡训练更大模型或更长序列的团队,它提供了一条低侵入的加速路径,社区活跃且迭代较快。
1克隆项目仓库
从 GitHub 拉取 Liger-Kernel 源码,后续所有安装命令都在仓库根目录执行。
git clone https://github.com/linkedin/Liger-Kernel.git
cd Liger-Kernel2安装默认依赖
README 推荐的可编辑安装方式,setup.py 会自动检测本地后端并选择默认依赖。
pip install -e .3装开发依赖(可选)
需要参与开发或跑测试时使用,安装 dev 附加依赖组。
pip install -e ".[dev]"4ROCm 环境准备
在 ROCm 上需先从 PyTorch ROCm 索引安装 ROCm 版 PyTorch,再执行上面的安装。
pip3 install torch torchvision --index-url https://download.pytorch.org/whl/rocm7.25安装 cuTile 依赖
需要 cuTile 支持时安装该可选项;也可换用带 tileiras 编译器的版本。
pip install -e ".[cutile]"6安装 CuTe DSL
需要 NVIDIA CUTLASS Python DSL 支持时安装该附加依赖组。
pip install -e ".[cutedsl]"在 Python 中执行 import liger_kernel 不报错,即表示包已成功安装到当前环境。
Q:该安装哪个 extras 依赖组?
A:一般场景直接用 pip install -e . 即可,setup.py 会按本地后端选默认依赖;开发用 .[dev],cuTile 用 .[cutile],CUTLASS DSL 用 .[cutedsl]。
Q:ROCm 机器上安装失败怎么办?
A:README 提示需先执行 pip3 install torch torchvision --index-url https://download.pytorch.org/whl/rocm7.2 安装 ROCm 版 PyTorch,再运行 pip install -e .。
Q:如何把 Liger 内核应用到模型上?
A:README 的 Getting Started 说明有多种应用方式,取决于需要的定制程度,可参考官网文档与 High-level/Low-level APIs 章节。
Q:有没有发布版而非源码安装?
A:项目在 PyPI 上提供 liger-kernel 稳定版与 liger-kernel-nightly 每日构建版,可据此选择安装渠道。
flash-attention、unsloth
Liger-Kernel 是模型训练领域的开源项目,由 linkedin 开发,2024 年首次发布。
在全站 12,753 个收录项目中,它的 GitHub 星标数(6,618)位列前 7%,在模型训练分类的 516 个项目里位列前 8%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,Apache 2.0 许可证。
它主要面向的使用场景是:单卡或少量卡微调7B/8B模型时降低显存占用。同类可对比的替代方案包括 flash-attention、unsloth。
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···