how-to-train-your-gpt

手把手从零写GPT,每行代码都讲透

这是一个从零开始构建现代大语言模型(LLM)的教学项目,以Jupyter Notebook形式呈现,每一行代码都有详细注释,并用通俗易懂的方式解释,适合初学者和希望深入理解LLM内部机制的开发者。项目覆盖了从数据准备、模型架构、训练循环到推理的完整流程,帮助用户理解Transformer、注意力机制、分词、优化器等核心概念。它解决的是LLM学习资源过于抽象或黑盒的问题,通过手把手实现一个可运行的GPT模型,让学习者真正掌握LLM的工作原理。核心能力包括:提供完整可运行的代码、逐行注释、直观的可视化解释,以及从零构建的实践路径。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3364
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队raiyanyahya
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型attention-mechanism,deep-learning,educational,from-scratch,gpt,language-model,llama,llm,machine-learning,natural-language-processing,python,pytorch,tokenisation,transformers,tutorial
GitHub 星标★ 3364
30天Star增速
HF 下载量
上线时间2026-05-03 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 5 步

环境要求

  • 已安装 Python 环境与 pip(README 全程使用 pip 安装依赖)
  • 已安装 Jupyter Notebook
  • PyTorch(README 给出 CPU 版安装源,GPU 版需按其提示另选)
  • 依赖包:tiktoken、numpy、datasets、matplotlib
  • 能联网访问 GitHub 或直接使用 Google Colab

安装与启动步骤

  1. 1获取项目代码

    把仓库克隆到本地,或直接点击 README 中的 Colab 徽章,在浏览器打开 notebooks/colab_train.ipynb。

    git clone https://github.com/raiyanyahya/how-to-train-your-gpt.git
  2. 2进入项目目录

    克隆完成后进入仓库根目录,notebooks 目录下存放各章节和主题讲解文件。

    cd how-to-train-your-gpt
  3. 3安装依赖

    README 提供的 CPU 版一键安装命令,已包含 jupyter、tiktoken、torch、numpy、datasets、matplotlib。

    pip install jupyter tiktoken torch numpy datasets matplotlib --index-url https://download.pytorch.org/whl/cpu
  4. 4启动 Jupyter

    启动后在浏览器中打开 notebooks 目录下的章节笔记本,按章节顺序逐格运行。

    jupyter notebook
  5. 5按章节学习

    从第一章开始依次运行 notebook,逐行阅读注释,理解分词、注意力、训练循环与推理。

如何确认成功

Jupyter 启动后浏览器能打开笔记本界面,且运行首个代码单元 import torch 不报错。

常见问题

Q:没有 GPU 可以运行吗?

A:可以。README 明确给出的就是 CPU 版 PyTorch 安装命令,能正常安装运行,只是训练速度会慢一些。

Q:本地不想装环境怎么办?

A:README 顶部提供 Google Colab 徽章链接,可直接在浏览器打开 notebooks/colab_train.ipynb 运行,无需本地安装。

Q:GPU 用户怎么安装 PyTorch?

A:README 中提示 “For GPU see below”,即 CPU 命令下方的 GPU 说明,需按对应 CUDA 版本另选安装命令,不要照抄 CPU 源。

Q:项目适合零基础吗?

A:面向初学者设计,采用通俗语言和逐行注释,但仍需基本的 Python 和命令行操作能力。

注意事项

  • 项目为 12 章、7500+ 行的交互式教学笔记本,另含 28 个专题讲解文件,建议按顺序学习。
  • 所有命令以 README 的 Quick Start 为准,--index-url 指向的是 CPU 版 PyTorch 源。
  • 本教程仅整理 README 中出现的安装命令,未包含 README 未给出的训练脚本或参数。

核心亮点

  • 逐行注释代码,学习体验极佳
  • 从零构建完整LLM,覆盖数据到推理全流程
  • 用简单语言解释复杂概念,适合新手

不足之处

  • 项目仍在成长中,部分章节可能未完善
  • 文档/社区待观察

适用场景

  • 初学者入门LLM原理与实现
  • 教学备课或自学深度学习
  • 快速理解Transformer架构细节

替代项目

nanoGPT、minGPT、Karpathy's Neural Networks: Zero to Hero

项目介绍

how-to-train-your-gpt 是模型训练领域的开源项目,由 raiyanyahya 开发,是 2026 年新上线的项目。

在全站 13,014 个收录项目中,它的 GitHub 星标数(3,364)位列前 30%,在模型训练分类的 518 个项目里位列前 13%。

近 42 天,它的 GitHub 星标从 2,339 增加到 3,364,净增 1,025。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:初学者入门LLM原理与实现。同类可对比的替代方案包括 nanoGPT、minGPT、Karpathy's Neural Networks: Zero to Hero。

上一篇:maxtext

下一篇:trainer

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13