FlagGems

用 Triton 写 LLM 算子,一套代码跑多种 GPU

FlagGems 是一个用 Triton 语言实现的大语言模型算子库,目标是提供一套高性能、可移植的 GPU 算子集合,替代或补充 PyTorch 原生算子以及厂商定制算子库。它解决的核心问题是:大模型训练和推理中,许多关键算子(如注意力、归一化、激活、矩阵乘等)在不同硬件上性能差异大,而 CUDA 手写算子开发成本高、可移植性差。FlagGems 用 Triton 统一实现,借助 Triton 的自动调优和跨平台能力,让同一套算子代码能在 NVIDIA、AMD 等多种 GPU 上运行,并针对 LLM 常见形状做优化。项目提供与 PyTorch 兼容的接口,用户可像调用 torch 算子一样使用,也支持接入 vLLM 等推理框架。核心能力包括:覆盖常见 LLM 算子的 Triton 实现、自动调优配置、与 PyTorch 生态的无缝集成,以及面向国产 GPU 的适配潜力。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1121
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队flagos-ai
所属国家
官网地址
定价模式free
价格说明开源免费,采用Apache等开源许可证
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型pytorch,triton,triton-kernels
GitHub 星标★ 1121
30天Star增速
HF 下载量
上线时间2024-03-21 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

难度:进阶 约 15 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可用的 GPU 环境(NVIDIA / AMD 等 Triton 支持的加速器)
  • Python 环境(README 未指定具体版本)
  • 已安装 PyTorch(FlagGems 注册到其 ATen 后端)
  • 已安装 Triton(算子以内核形式用 Triton 语言实现)
  • 网络可访问 GitHub 与官方文档站点

安装与启动步骤

  1. 1确认环境与依赖

    README 说明 FlagGems 基于 Triton 实现,并注册到 PyTorch 的 ATen 后端,使用前需先具备可用的 GPU 与 Python、PyTorch、Triton 环境。

  2. 2获取项目代码

    把 FlagGems 仓库克隆到本地,后续安装与使用都基于该目录。README 未给出具体安装命令。

    git clone https://github.com/flagos-ai/FlagGems.git
  3. 3查看快速开始文档

    README 明确指向官方 Getting Started 页面,按其中的步骤完成安装,不要凭猜测执行其他安装命令。

  4. 4查看使用说明文档

    README 指向官方 usage 文档,其中说明了如何在实际代码中使用该软件及其细节。

如何确认成功

按官方 Getting Started 文档运行其中的示例,算子调用能够正常执行且无报错,即视为环境可用。

常见问题

Q:安装命令在哪里找?

A:README 没有列出安装命令,只提供了官方 Getting Started 文档链接 https://flagos-ai.github.io/FlagGems/getting-started/,请以该文档为准。

Q:不会英文怎么办?

A:README 顶部提供了中文版文档链接 ./README_cn.md,可切换到中文说明阅读。

Q:怎么在代码里使用它?

A:README 指向官方 usage 文档 https://flagos-ai.github.io/FlagGems/usage/,其中介绍了使用该软件的细节。

Q:支持哪些硬件平台?

A:README 称其内核是后端中立的,可在多种 AI 加速器上运行,具体支持范围请查阅官方文档。

注意事项

  • 本教程依据 README 节选整理,README 未给出任何具体安装命令,实际安装请以官方 Getting Started 文档为准。
  • FlagGems 通过注册到 PyTorch 的 ATen 后端来接入,使用方式与 torch 算子保持一致。
  • 项目属于 FlagOS 体系,目标是同一套算子代码在多种 AI 加速器上运行。
  • 缺少 GPU 或 Triton 环境时无法真正运行算子,请先确认硬件条件。

核心亮点

  • 用 Triton 统一实现,相比 CUDA 手写算子大幅降低开发和维护成本
  • 算子覆盖 LLM 常见需求,且提供 PyTorch 兼容接口,迁移成本低
  • 面向多硬件后端设计,有潜力适配国产 GPU,减少对 CUDA 生态的依赖

不足之处

  • 项目处于成长阶段,算子覆盖度和稳定性相比 cuBLAS/cuDNN 等成熟库仍有差距
  • 社区和文档规模较小,遇到问题可参考的案例和讨论有限

适用场景

  • 大模型训练/推理中替换 PyTorch 原生算子以提升性能
  • 在非 NVIDIA GPU 上运行 LLM 时作为算子后端
  • 为 vLLM 等推理框架提供 Triton 算子加速支持

替代项目

PyTorch、vLLM、Triton

项目介绍

FlagGems 是一个基础设施领域的开源项目,官方简介:FlagGems is an operator library for large language models implemented in the Triton Language.。项目使用 Python 开发,在 GitHub 上获得 1120 星标。

上一篇:onWatch

下一篇:worker-vllm

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8576 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181269 2026-08-09