tilelang 是开发框架领域的开源项目,由 tile-ai 开发,2024 年首次发布。
在全站 13,916 个收录项目中,它的 GitHub 星标数(8,469)位列前 6%,在开发框架分类的 844 个项目里位列前 7%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-07。
它主要面向的使用场景是:为自研大模型实现高性能注意力或矩阵乘算子。同类可对比的替代方案包括 Triton、TVM。

用 Python 写高性能 GPU 算子,少调优也能跑得快
TileLang 是一个面向高性能算子开发的领域特定语言(DSL),用 Python 编写,目标是简化 GPU、CPU 及各类加速器上的 kernel 开发。它把常见的分块(tile)、内存层级、线程绑定和流水线调度抽象成高层原语,开发者只需描述计算逻辑与数据布局,编译器负责生成高效的底层代码。相比直接写 CUDA/HIP 或 Triton,TileLang 降低了手工调优的复杂度,同时保留对性能关键细节的控制能力。它适用于矩阵乘、注意力、卷积等深度学习算子的快速实现与自动调优,支持在多种后端上运行,并可与 PyTorch 等框架配合做算子替换。项目处于成长阶段,社区活跃,适合需要自研高性能算子的团队作为开发与实验平台。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
1安装稳定版
从 PyPI 安装最新的 tilelang 稳定版,这是 README 推荐的首选安装方式。
pip install tilelang2验证安装
导入 tilelang 并打印版本号,能输出版本即安装成功。
python -c "import tilelang; print(tilelang.__version__)"3可选装 nightly
nightly wheel 包含下一个稳定版之前的新特性与修复,但稳定性可能不如正式版。
pip install tilelang --find-links https://tile-ai.github.io/whl/nightly4AMD 环境准备
AMD GPU 上 Linux wheel 开箱可用,但需先装 ROCm 版 PyTorch,且运行时要求主机已安装 ROCm。
pip install torch --index-url https://download.pytorch.org/whl/rocm7.0
pip install tilelang5运行快速开始示例
把示例代码保存后运行,它会定义、编译、执行并校验一个 FP16 GEMM 加 ReLU 的 kernel,成功时打印 GEMM + ReLU passed.
import torch
import tilelang
import tilelang.language as T
@tilelang.jit
def matmul_relu(A, B, block_M: int = 128, block_N: int = 128, block_K: int = 32):
M, N, K = T.const("M, N, K")
A: T.Tensor((M, K), T.float16)
B: T.Tensor((K, N), T.float16)
C = T.empty((M, N), T.float16)
with T.Kernel(T.ceildiv(N, block_N), T.ceildiv(M, block_M), threads=128) as (bx, by):
A_shared = T.alloc_shared((block_M, block_K), T.float16)
B_shared = T.alloc_shared((block_K, block_N), T.float16)
C_local = T.alloc_fragment((block_M, block_N), T.float32)
T.clear(C_local)
for k in T.Pipelined(T.ceildiv(K, block_K), num_stages=3):
T.copy(A[by * block_M, k * block_K], A_shared)
T.copy(B[k * block_K, bx * block_N], B_shared)
T.gemm(A_shared, B_shared, C_local)
for i, j in T.Parallel(block_M, block_N):
C_local[i, j] = T.max(C_local[i, j], 0)
T.copy(C_local, C[by * block_M, bx * block_N])
return C
M = N = K = 1024
a = torch.randn((M, K), device="cuda", dtype=torch.float16)
b = torch.randn((K, N), device="cuda", dtype=torch.float16)
c = matmul_relu(a, b)
torch.testing.assert_clos执行 python -c "import tilelang; print(tilelang.__version__)" 能打印版本号;运行快速开始示例打印出 GEMM + ReLU passed.
Q:nightly 版和稳定版该选哪个?
A:优先用 pip install tilelang 安装稳定版;nightly 含最新特性和修复,但可能不如正式版稳定,仅在有需要时使用 --find-links 方式安装。
Q:AMD GPU 上能直接用吗?
A:同样的 Linux wheel 开箱可用,但需先安装 ROCm 版 PyTorch,且运行时主机必须已安装 ROCm,详见官方安装指南中的 ROCm 说明。
Q:想用 Docker、源码构建或自定义 TVM 怎么办?
A:README 未给出这些命令,需按官方完整安装指南操作:https://tilelang.com/get_started/Installation.html
Q:示例为什么指定 device="cuda"?
A:示例使用 PyTorch CUDA 张量,在 ROCm 系统上 PyTorch 同样使用 cuda 这个设备名;TileLang 会根据当前环境自动选择目标。
Triton、TVM
tilelang 是开发框架领域的开源项目,由 tile-ai 开发,2024 年首次发布。
在全站 13,916 个收录项目中,它的 GitHub 星标数(8,469)位列前 6%,在开发框架分类的 844 个项目里位列前 7%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-07。
它主要面向的使用场景是:为自研大模型实现高性能注意力或矩阵乘算子。同类可对比的替代方案包括 Triton、TVM。
上一篇:x
下一篇:streamdown
dsh-our-free-model
开源
装个插件就能免密钥白嫖前沿大模型,不限量
在 dsh 里装上这个插件即可,无需登录、注册或填 API Key,就能使用包括 DeepSeek V4.1 Fl···
langchain
开源
组装 AI 应用的乐高积木,从想法到上线不换工具
The agent engineering platform.
transformers
开源
全球最大的模型仓库全家桶,想用的模型一把抓
Transformers: the model-definition framework for state-of-the-art machine learning m···
ComfyUI_Custom_Nodes_AlekPet
开源
给 ComfyUI 装上语音翻译和姿态检测,工作流更全能
Custom nodes that extend the capabilities of Comfyui