tiny-llm

在苹果芯片上从零手写一个迷你 vLLM,吃透推理服务

tiny-llm 是一个面向系统工程师的 LLM 推理服务实战课程,专注于在 Apple Silicon 上构建一个精简版 vLLM + Qwen。项目通过亲手实现推理服务核心组件,帮助学习者深入理解 LLM 推理的完整流程,包括张量并行、KV Cache、连续批处理等关键概念。它解决了传统教程偏重模型使用而忽视系统实现的问题,提供从零搭建的代码和文档,让学习者能真正掌握推理服务的性能优化和工程落地。核心能力包括:基于 Apple Silicon 的硬件适配、vLLM 核心机制的简化复现、以及 Qwen 模型的实际部署。适合希望从系统层面理解 LLM 推理的工程师,也适合作为学习 vLLM 内部原理的入门教材。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4672
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队skyzh
所属国家
定价模式free
价格说明开源课程,Apache-2.0 许可证,完全免费,可自行部署学习。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型course,large-language-model,llm,python,qwen,serving,vllm
GitHub 星标★ 4672
30天Star增速
HF 下载量
上线时间2025-04-19 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 30 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 运行环境需支持 MLX(课程基于 Apple Silicon 与 MLX 数组、MLX 扩展运行时)
  • 已安装 Python(项目开发语言为 Python)
  • 对矩阵运算、GPU kernel、LLM 推理有基础了解(课程面向系统工程师)
  • 能访问 GitHub 以获取课程代码与更新

安装与启动步骤

  1. 1克隆课程仓库

    从 GitHub 拉取 tiny-llm 课程代码到本地。README 节选未提供安装脚本或依赖清单,克隆后以仓库内文档为准。

    git clone https://github.com/skyzh/tiny-llm.git
  2. 2进入仓库目录

    切换到克隆下来的目录,查看目录结构与文档,确认各周章节的组织方式。

    cd tiny-llm
  3. 3阅读学习路径

    按 README 与官网的四周边学习路径规划:第 1 周从矩阵乘到文本生成,第 2 周加入 KV Cache 与优化。

  4. 4确认运行环境

    课程基于 MLX arrays 与 MLX 扩展运行时,不使用高层神经网络层,请在支持 MLX 的机器上学习。

如何确认成功

README 节选未给出启动命令或服务端口;能按课程完成 Week 1 的 MLX 数组与算子练习,即可认为环境就绪。

常见问题

Q:有现成的安装或启动命令吗?

A:README 节选未提供 pip 安装、启动脚本或端口说明,具体安装方式请以 GitHub 仓库最新文档与官网为准。

Q:需要 NVIDIA GPU 吗?

A:课程围绕 Apple Silicon 与 MLX 构建,讲解的是该平台上的算子实现与推理服务机制。

Q:需要先掌握 vLLM 吗?

A:不需要。课程从数组与矩阵运算起步,逐步引入 kernel、KV Cache、连续批处理等 vLLM 核心概念。

Q:学完大概要多久?

A:课程按四周学习路径组织,第 1 周搭建 Qwen3 文本生成,第 2 周起推进 KV Cache 与各类优化。

注意事项

  • README 节选只包含课程介绍与学习路径,没有安装命令、端口或配置文件信息,部署步骤请以官方仓库和官网为准。
  • 课程要求自己实现算子(Python、C++ 或 Metal),不直接调用 MLX 已优化的对应算子,MLX 仅作为正确性基准与性能基线。
  • 示例模型为 Qwen3,加载与生成过程需要按各章节说明自行编写实现。

核心亮点

  • 手写实现 vLLM 核心机制,学习曲线陡峭但收获扎实
  • 针对 Apple Silicon 优化,硬件适配性强,便于本地实践
  • 课程化设计,文档和代码配套,适合系统工程师转型

不足之处

  • 仅覆盖推理服务基础,高级特性(如量化、分布式)未深入
  • 文档/社区待观察

适用场景

  • 学习 LLM 推理服务原理,作为系统工程师的进阶课程
  • 在 Apple Silicon 设备上快速搭建轻量级推理服务
  • 作为 vLLM 源码阅读前的引导性项目

替代项目

vLLM、TinyChat、llama.cpp

项目介绍

tiny-llm 是学习教育领域的开源项目,由 skyzh 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,672)位列前 10%,在学习教育分类的 427 个项目里位列前 15%。

近 44 天,它的 GitHub 星标从 4,454 增加到 4,672,净增 218。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源课程,Apache-2.0 许可证,完全免费,可自行部署学习。

它主要面向的使用场景是:学习LLM推理服务原理,作为系统工程师的进阶课程。同类可对比的替代方案包括 vLLM、TinyChat、llama.cpp。

上一篇:happy-llm

下一篇:generative-ai

同类项目推荐

awesome-awesome-ai 开源

一站式导航AI资源,告别收藏夹吃灰

An awesome list for collecting awesome lists related to AI.

★ 136 2026-08-09
machine-learning 开源

免费学AI,从入门到实战,社区共建资源库

Learn AI together, for free. AI learning and teaching resources for everyone.

★ 231 2026-08-09
groundhog 开源

拆解 Cursor 原理,手把手教你造 AI 编程助手

Groundhog's primary purpose is to teach people how Cursor and all these other coding···

★ 405 2026-08-09
notebooks 开源

跟着最新视觉模型教程,边看边跑代码,快速上手实战

A collection of tutorials on state-of-the-art computer vision models and techniques.···

★ 9686 2026-08-10