rapid_llm

用 Triton 手写轻量推理框架,快速读懂并改造 LLM 内核

rapid_llm 是一个基于 Triton 内核实现的轻量级类 LLaMA 大模型推理框架,用 Python 编写,目标是在不依赖庞大生态的前提下提供可读、可改的推理内核实现。它解决的是主流推理框架(如 vLLM、SGLang)代码体量大、CUDA 定制深、二次开发门槛高的问题,让开发者能用更少的代码理解并改造注意力计算、KV Cache 管理与请求调度。核心能力包括 Triton 编写的注意力内核、连续批处理(continuous batching)调度、对 FlashAttention-3 的支持,以及对 LLaMA3、Qwen3-MoE、Qwen3-VL 等模型结构的适配,同时涉及张量并行与多模态输入的初步支持。项目定位偏教学与实验,适合作为学习推理系统内部机制的起点,也方便研究者快速验证新的调度或内核优化想法。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 195
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队harleyszhang
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型attention,continues,continuous-batching,flash-attention-3,llama3,llm,llm-inference,python3,qwen3-moe,qwen3-vl,tensor-parallel,triton-kernels
GitHub 星标★ 195
30天Star增速
HF 下载量
上线时间2024-10-06 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1

使用教程

核心亮点

  • 基于 Triton 实现注意力内核,代码量小、可读性高,便于二次开发和教学演示
  • 支持连续批处理与 FlashAttention-3,具备现代推理框架的关键调度与加速特性
  • 覆盖 LLaMA3、Qwen3-MoE、Qwen3-VL 等较新模型结构,并涉及张量并行与多模态场景

不足之处

  • 项目处于早期阶段,星标仅 195,生产环境稳定性与性能调优经验有限
  • 文档与社区生态尚不完善,遇到问题可参考的案例和讨论较少

适用场景

  • 学习大模型推理系统内部实现,理解注意力内核与调度机制
  • 在科研或课程中快速验证新的批处理策略、KV Cache 管理或 Triton 内核优化
  • 作为轻量基线,对比 vLLM 等框架在特定模型上的推理性能与实现差异

替代项目

vLLM、SGLang

项目介绍

rapid_llm 是一个基础设施领域的开源项目,官方简介:A light llama-like llm inference framework based on the triton kernel.。项目使用 Python 开发,在 GitHub 上获得 195 星标。

上一篇:llmserve

下一篇:kubeai

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8433 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181124 2026-08-09