diy-llm

6个渐进作业,动手吃透大模型全栈

diy-llm 是 Datawhale 社区推出的开源大模型全栈学习项目,面向想从零理解并动手实现 LLM 的开发者与学习者。它把大模型知识拆成预训练数据、Tokenizer、Transformer、MoE、分布式训练、Scaling Laws、推理与对齐等模块,并配套 6 个渐进式代码作业,让学习者在 Jupyter Notebook 里边写边跑,逐步搭起一条从数据处理到训练、推理、对齐的完整链路。相比只讲理论的课程,它强调代码实践与阶段递进,适合已有 Python 和深度学习基础、希望系统补齐 LLM 工程能力的人,也方便用于自学、组队打卡或教学辅导。

开源 free 学习教育
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1379
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类学习教育
开发团队datawhalechina
所属国家
定价模式free
价格说明开源免费学习教程
访问状态
是否开源
开源协议
主要语言Jupyter Notebook
技术栈/模型datawhale,gpu-programming,grpo,llm,nlp,rl,sft,transformer
GitHub 星标★ 1379
30天Star增速
HF 下载量
上线时间2025-11-24 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:高级 约 15 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 熟练掌握 Python 与软件工程能力
  • 熟悉 PyTorch,了解神经网络基本原理
  • 具备线性代数、概率统计、微积分等数学基础
  • 对机器学习与深度学习有扎实掌握
  • 了解 CUDA 基础更佳(可选,不懂也可跟入门教程)

安装与启动步骤

  1. 1阅读在线教程

    先浏览官方在线阅读地址,了解课程模块划分与 6 个渐进式作业的先后顺序。

  2. 2克隆项目仓库

    把 diy-llm 仓库克隆到本地,后续所有 Notebook 作业都在该目录下完成。

    git clone https://github.com/datawhalechina/diy-llm.git
  3. 3进入项目目录

    切换到刚克隆下来的目录,确认能看到 README 与课程 Notebook 文件。

    cd diy-llm
  4. 4安装基础依赖

    README 只在快速开始处提示“根据具体作业需求安装”,未给出统一命令;请按所打开作业 Notebook 内的说明安装对应依赖。

  5. 5运行作业 Notebook

    用 Jupyter 打开对应作业的 Notebook 边写边跑,按课程顺序从数据、Tokenizer 逐步往后推进。

如何确认成功

能打开项目 README 与课程 Notebook,并按各作业说明跑通第一个作业的代码单元格,即表示环境可用。

常见问题

Q:没有 GPU 或不懂 CUDA 能学吗?

A:可以。README 把 GPU 编程列为可选前置,不了解 CUDA 基础也没关系,项目内提供了入门教程。

Q:需要多深的深度学习基础?

A:README 要求对机器学习与深度学习有扎实掌握,并熟悉 PyTorch、了解神经网络基本原理,否则建议先补齐前置知识。

Q:依赖安装命令在哪?

A:README 快速开始部分仅说明“根据具体作业需求安装”,未提供统一依赖清单,需以各作业 Notebook 内的说明为准。

Q:课程内容偏理论还是偏代码?

A:两者并重。项目强调代码驱动,会提供作业实现代码,并分享写下每一行代码时的思考过程。

注意事项

  • README 未给出统一的依赖安装命令与端口、路径等配置,请以各作业 Notebook 内的说明为准。
  • 项目内容较多,建议按模块循序渐进学习,不要跳步。
  • 课程包含国产模型(如 Qwen、DeepSeek)相关的本土化案例,便于国内环境实践。
  • 如需英文说明可切换到 README_EN.md。

核心亮点

  • 按预训练数据、Tokenizer、Transformer、MoE、分布式训练、Scaling Laws、推理与对齐分模块,知识链路完整
  • 6 个渐进式代码作业,从易到难,适合边学边写、检验掌握程度
  • 基于 Jupyter Notebook,可直接运行调试,降低动手门槛

不足之处

  • 内容偏教学作业,缺少生产级工程化与大规模集群实操细节
  • 进阶模块如分布式训练、MoE 对算力有要求,普通设备难以完整跑通

适用场景

  • 个人自学大模型原理并动手实现关键组件
  • 高校或训练营用作 LLM 课程配套实验
  • 团队内部组织组队打卡、共学大模型全栈知识

替代项目

llm-cookbook、minbpe、nanoGPT

项目介绍

diy-llm 是一个学习教育领域的开源项目,官方简介:Covers pre-training data, Tokenizer, Transformer, MoE,distributed training, Scaling Laws, inference & alignment .6 progressive code assignments for full-stack LLM learning | 涵盖预训练数据、分词器、Transformer、MoE、分布式训练、缩放定律、推理与对齐,6 项渐进代码作业,掌握 LLM 全栈知识。项目使用 Jupyter Notebook 开发,在 GitHub 上获得 1366 星标。

上一篇:llm-zoomcamp

下一篇:llm-course

同类项目推荐

awesome-awesome-ai 开源

一站式导航AI资源,告别收藏夹吃灰

An awesome list for collecting awesome lists related to AI.

★ 136 2026-08-09
machine-learning 开源

免费学AI,从入门到实战,社区共建资源库

Learn AI together, for free. AI learning and teaching resources for everyone.

★ 231 2026-08-09
groundhog 开源

拆解 Cursor 原理,手把手教你造 AI 编程助手

Groundhog's primary purpose is to teach people how Cursor and all these other coding···

★ 405 2026-08-09
notebooks 开源

跟着最新视觉模型教程,边看边跑代码,快速上手实战

A collection of tutorials on state-of-the-art computer vision models and techniques.···

★ 9676 2026-08-10