
rapid_llm
用 Triton 手写轻量推理框架,快速读懂并改造 LLM 内核
rapid_llm 是一个基于 Triton 内核实现的轻量级类 LLaMA 大模型推理框架,用 Python 编写,目标是在不依赖庞大生态的前提下提供可读、可改的推理内核实现。它解决的是主流推理框架(如 vLLM、SGLang)代码体量大、CUDA 定制深、二次开发门槛高的问题,让开发者能用更少的代码理解并改造注意力计算、KV Cache 管理与请求调度。核心能力包括 Triton 编写的注意力内核、连续批处理(continuous batching)调度、对 FlashAttention-3 的支持,以及对 LLaMA3、Qwen3-MoE、Qwen3-VL 等模型结构的适配,同时涉及张量并行与多模态输入的初步支持。项目定位偏教学与实验,适合作为学习推理系统内部机制的起点,也方便研究者快速验证新的调度或内核优化想法。
开源
free
基础设施
GitHub 星标
★ 195
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类基础设施
开发团队harleyszhang
所属国家
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型attention,continues,continuous-batching,flash-attention-3,llama3,llm,llm-inference,python3,qwen3-moe,qwen3-vl,tensor-parallel,triton-kernels
GitHub 星标★ 195
30天Star增速
HF 下载量
上线时间2024-10-06 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1
使用教程
核心亮点
- 基于 Triton 实现注意力内核,代码量小、可读性高,便于二次开发和教学演示
- 支持连续批处理与 FlashAttention-3,具备现代推理框架的关键调度与加速特性
- 覆盖 LLaMA3、Qwen3-MoE、Qwen3-VL 等较新模型结构,并涉及张量并行与多模态场景
不足之处
- 项目处于早期阶段,星标仅 195,生产环境稳定性与性能调优经验有限
- 文档与社区生态尚不完善,遇到问题可参考的案例和讨论较少
适用场景
- 学习大模型推理系统内部实现,理解注意力内核与调度机制
- 在科研或课程中快速验证新的批处理策略、KV Cache 管理或 Triton 内核优化
- 作为轻量基线,对比 vLLM 等框架在特定模型上的推理性能与实现差异
替代项目
vLLM、SGLang
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···