minGPT学习路径

① 第一优先:train.py(必须先看)

为什么先看它

这是整个项目的"主流程控制器",决定你前面看的模型怎么被用起来。

你要重点抓三件事:

  • 数据是怎么进来的(dataset / dataloader)
  • model forward 怎么被调用
  • loss / optimizer / training loop

你要建立的理解

"一个 GPT 是怎么被训练起来的完整闭环"

你会第一次把:

  • Transformer结构
  • loss计算
  • 训练循环

串成一个系统。


② 第二优先:model.py(GPT核心)

如果 README 只是"介绍结构",那 model.py 是真实实现结构

重点看:

1. GPT class

  • forward pass
  • block stack

2. Block

  • attention + mlp

3. Attention(最关键)

  • QKV projection
  • mask(causal attention)
  • softmax

你要搞清楚:

token 是怎么一步步变成 logits 的


③ 第三优先:attention.py(如果单独拆出来)

如果仓库里 attention 是单独模块:

你要重点看:

  • scaled dot-product attention
  • causal mask
  • multi-head split & concat

这一块是你理解 LLM 的"分水岭"。


④ 第四优先:dataset / data loader

重点是:

  • tokenization(字符级 or BPE)
  • block sampling(seq_len怎么切)
  • batch shape(B,T,C)

你要解决的问题是:

"模型看到的数据长什么样"


⑤ 第五优先:config / hyperparameters

重点:

  • n_layer
  • n_head
  • n_embd
  • block_size

你要开始建立一个直觉:

"这些参数如何影响模型能力与成本"


推荐你的学习路径(非常重要)

你现在不要"顺着文件看",而要按这个认知链:

复制代码
数据长什么样 → train.py怎么喂 → model.py怎么处理 → attention怎么计算 → loss怎么回传

给你一个关键判断(很多人卡在这里)

如果你现在只是"读代码",会很慢。

正确方式是:

👉 每看一个文件,都回答一个问题

文件 你要回答的问题
train.py 模型怎么被训练起来
model.py token怎么变logits
attention token之间怎么交互
dataset token从哪来
config 为什么这样设
相关推荐
百数平台10 小时前
百数AI文本知识库配置详解:本地文档上传与自定义录入、解析分段策略全说明
低代码·ai
百数平台11 小时前
百数AI对话流(Chatflow)开发指南:会话历史配置、角色面板、开场白预置问题与智能体挂载
低代码·ai
笨蛋©12 小时前
[实战] 扫描图纸转DXF:2026年制造业数字化图纸处理与GD&T识别实操指南
ai·数字化·cad·质量管理·制造业
俊哥V14 小时前
每日 AI 研究简报 · 2026-10-08
人工智能·ai
jason.zeng@150220715 小时前
(六)Prompt 优化
python·ai·langchain·prompt·ai编程·llama
小鹿的周先生15 小时前
第19章-Agent
java·spring·ai
全栈练习生16 小时前
大模型推理全链路
python·ai
欣欣之王来了16 小时前
2024主流国产大模型深度对比:文心一言/通义千问/智谱AI/Qwen等选型指南
人工智能·ai·大模型
笨蛋©17 小时前
2026制造业质量数字化:Infra CONVERT 中国代理技术支持下的检验计划自动化实战
ai·数字化·cad·质量管理·制造业
玩AI的奶茶17 小时前
从零到跑通:在算家云上部署大模型的完整操作手册(实例创建 / 镜像选择 / 远程连接 / 成本控制)
人工智能·ai·gpu算力·token·算力租赁