LLM-workshop-2024

4小时动手搭建迷你GPT,彻底搞懂LLM原理

LLM-workshop-2024 是一个为期4小时的编码工作坊,旨在帮助开发者深入理解大型语言模型(LLM)的实现原理与实际应用。项目通过Jupyter Notebook提供交互式教程,从零开始构建一个迷你GPT模型,涵盖分词、嵌入、注意力机制、Transformer架构、预训练与微调等核心环节,并演示如何将模型应用于文本生成、对话等场景。它解决了初学者面对LLM黑盒的困惑,通过动手实践让学习者掌握模型内部工作机制,同时提供清晰的代码注释和逐步讲解,适合有一定Python基础但希望深入LLM领域的开发者快速入门。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1116
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队rasbt
所属国家
官网地址
定价模式free
价格说明开源项目,免费提供代码和教程,无在线服务,需自行部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型large-language-models,llm,pytorch
GitHub 星标★ 1116
30天Star增速
HF 下载量
上线时间2024-06-25 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 10 分钟 部署方式:本地安装 5 步

环境要求

  • Python 基础与 PyTorch 使用经验
  • 可运行 Jupyter Notebook 的环境
  • 预训练与微调环节需要 GPU(云端环境已提供)
  • 本地运行需按仓库 setup 文件夹内的说明配置依赖

安装与启动步骤

  1. 1选择运行方式

    README 提供开箱即用的云端环境,已装好所有代码示例与依赖,可直接在 GPU 上跑预训练和微调。

  2. 2克隆仓库

    把教程仓库下载到本地,后续在仓库目录中打开各章节的 Notebook。

    git clone https://github.com/rasbt/LLM-workshop-2024.git
  3. 3进入项目目录

    切换到克隆下来的仓库根目录,所有 Notebook 与 setup 说明都在这里。

    cd LLM-workshop-2024
  4. 4按 setup 说明装环境

    README 未列出具体依赖命令,请打开仓库内 setup 文件夹,按其说明配置本地运行环境。

  5. 5启动 Jupyter 打开教程

    用 Jupyter 打开仓库中的 Notebook,按顺序学习分词、注意力、预训练与微调章节。

    jupyter notebook

如何确认成功

云端 Studio 成功加载,或本地 Jupyter 打开仓库 Notebook 后能正常执行单元格代码。

常见问题

Q:没有 GPU 能学吗?

A:可以。入门与架构讲解部分 CPU 即可运行,但预训练和微调部分需要 GPU,建议使用 README 中提供的 Lightning.ai 云端环境。

Q:不想本地配环境怎么办?

A:README 明确提供了开箱即用的云端环境链接,所有代码示例和依赖已安装好,可直接在浏览器中运行。

Q:教程内容与代码出自哪里?

A:代码基于《Build a Large Language Model From Scratch》一书,并使用了 LitGPT 库,README 中给出了对应链接。

Q:需要什么前置知识?

A:面向想理解 LLM 内部机制的开发者,需要一定 Python 基础,并了解 PyTorch 的基本用法。

注意事项

  • 依赖安装细节 README 未直接列出,请以仓库 setup 文件夹中的说明为准。
  • 仓库提供现成云端环境,预训练与微调建议直接在带 GPU 的云端运行。
  • 本项目为教学性质的 4 小时工作坊,内容以 Jupyter Notebook 交互式讲解为主。

核心亮点

  • 从零手写Transformer核心组件,代码可运行且注释详细
  • 工作坊形式设计,时间紧凑,适合周末集中学习
  • 基于Jupyter Notebook,交互式体验,边看边改边理解

不足之处

  • 仅提供英文教程,对中文用户有一定语言门槛
  • 示例模型规模较小,与生产级LLM差距明显
  • 依赖特定环境配置,初学者可能遇到依赖安装问题

适用场景

  • 开发者自学LLM原理,通过动手实践加深理解
  • 企业内部技术培训,快速提升团队AI基础
  • 高校教学辅助,作为深度学习课程的实践环节

替代项目

Andrej Karpathy的nanoGPT、Hugging Face的Transformers教程、fast.ai的Practical Deep Learning

项目介绍

LLM-workshop-2024 是学习教育领域的开源项目,由 rasbt 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,116)位列前 30%,在学习教育分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。免费提供代码和教程,无在线服务,需自行部署。

它主要面向的使用场景是:开发者自学LLM原理,通过动手实践加深理解。同类可对比的替代方案包括 Andrej Karpathy的nanoGPT、Hugging Face的Transformers教程、fast.ai的Practical Deep Learn…。

上一篇:ML_Guide

下一篇:Tutorbot-Spock

同类项目推荐

awesome-awesome-ai 开源

一站式导航AI资源,告别收藏夹吃灰

An awesome list for collecting awesome lists related to AI.

★ 136 2026-08-09
machine-learning 开源

免费学AI,从入门到实战,社区共建资源库

Learn AI together, for free. AI learning and teaching resources for everyone.

★ 231 2026-08-09
groundhog 开源

拆解 Cursor 原理,手把手教你造 AI 编程助手

Groundhog's primary purpose is to teach people how Cursor and all these other coding···

★ 405 2026-08-09
notebooks 开源

跟着最新视觉模型教程,边看边跑代码,快速上手实战

A collection of tutorials on state-of-the-art computer vision models and techniques.···

★ 9686 2026-08-10