LLMs-from-scratch

手把手从零造出 ChatGPT,原理代码一次搞懂

手把手教你用 PyTorch 从零实现一个 ChatGPT 级别的 LLM,逐行讲解代码与原理,是深入理解 Transformer 架构与大模型训练的最佳学习路径。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 105400
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队rasbt
所属国家
定价模式free
价格说明开源项目,完全免费,可自行部署学习,无付费版本。
访问状态
是否开源
开源协议NOASSERTION
主要语言Jupyter Notebook
技术栈/模型ai,artificial-intelligence,attention-mechanism,deep-learning,finetuning,from-scratch,generative-ai,gpt,instruction-tuning,language-model,large-language-models,llm,machine-learning,natural-language-processing,pretraining,python,pytorch,tokenizer,transformers
GitHub 星标★ 105400
30天Star增速
HF 下载量
上线时间2023-07-23 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数14

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 已安装 Git,用于克隆代码仓库
  • 已安装 Python 与 Jupyter Notebook / JupyterLab 运行环境
  • 能正常访问 GitHub 的网络环境
  • 建议配合官方书籍《Build a Large Language Model (From Scratch)》阅读代码

安装与启动步骤

  1. 1克隆代码仓库

    README 给出的官方源码仓库地址,克隆到本地任意目录即可,仓库为书籍配套代码。

    git clone https://github.com/rasbt/LLMs-from-scratch.git
  2. 2进入项目目录

    切换到刚克隆下来的仓库根目录,后续所有操作都在此目录内进行。

    cd LLMs-from-scratch
  3. 3创建虚拟环境

    README 未给出具体依赖清单,先建独立 Python 虚拟环境,避免污染系统环境。

    python -m venv .venv
  4. 4激活虚拟环境

    Linux/macOS 用 source 激活;Windows 请改用 .venvScriptsctivate。

    source .venv/bin/activate
  5. 5启动 Jupyter

    项目主体是 Jupyter Notebook,启动后在浏览器中按章节打开对应的 .ipynb 文件学习。

    jupyter lab

如何确认成功

终端启动 Jupyter 后浏览器自动打开工作台,能列出仓库中的 Notebook 文件即表示环境就绪。

常见问题

Q:这个仓库需要付费吗?

A:仓库本身是公开的官方源码仓库,免费获取;配套书籍《Build a Large Language Model (From Scratch)》需另行购买。

Q:代码在哪里购买配套书籍?

A:README 给出的官方购书链接为 https://amzn.to/4fqvn0D(Amazon),出版商 Manning 页面为 http://mng.bz/orYv。

Q:可以用预训练好的大模型权重吗?

A:可以,README 说明书中包含加载更大规模预训练模型权重以进行微调的代码。

Q:代码是什么形式?

A:项目主体语言为 Jupyter Notebook,按书籍章节组织,逐行讲解 GPT 类 LLM 的构建、预训练与微调。

注意事项

  • README 节选未提供依赖安装命令和具体版本要求,实际依赖请以仓库内各章节说明为准,不要照搬网上其他项目的依赖。
  • 本项目定位是教学与学习,代码对应书中从零实现 GPT 类模型的各个阶段。
  • 官方网站与购书入口:https://amzn.to/4fqvn0D
  • 若无法访问 GitHub,可先配置好网络代理再执行克隆命令。

核心亮点

  • 从零逐行实现ChatGPT类LLM,覆盖数据预处理、注意力机制、预训练、指令微调等全流程,教学路径清晰
  • 配合作者出版的《Build a Large Language Model from Scratch》书籍,代码与章节一一对应,知识点拆解细致
  • 项目拥有超过10万星标,社区反馈活跃,Issue讨论和更新频繁,错误修正及时

不足之处

  • 定位为教学示例,代码优化和工程化程度不足,不直接适用于生产环境部署
  • 依赖作者个人讲解顺序,读者需要投入大量时间跟踪逐步实现,对初学者有一定门槛
  • 部分高级主题(如多模态、分布式训练、模型并行)未深入涉及,覆盖面相对有限

适用场景

  • 想系统学习大语言模型内部原理的开发者或研究人员
  • 作为高校或培训机构深度学习与NLP课程的动手实践教材
  • 需要快速搭建可运行的小型GPT类模型以验证研究想法或教学演示

替代项目

karpathy/nanoGPT、karpathy/minGPT、karpathy/LLM101n

项目介绍

LLMs-from-scratch 是模型训练领域的开源项目,由 rasbt 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(105,400)位列前 1%,在模型训练分类的 518 个项目里位列前 1%。

近 44 天,它的 GitHub 星标从 101,953 增加到 105,400,净增 3,447。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。完全免费,可自行部署学习,无付费版本。

它主要面向的使用场景是:想系统学习大语言模型内部原理的开发者或研究人员。同类可对比的替代方案包括 karpathy/nanoGPT、karpathy/minGPT、karpathy/LLM101n。

上一篇:MirrorFlow

下一篇:LlamaFactory

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13