论文解读之GPT1:Improving Language Understanding by Generative Pre-Training

近期会整理经典的大模型架构和其具体训练、数据过程,从GPT1开始

一、介绍

GPT系列的特点是自监督大规模训练后在具体任务上进行有监督微调,事实证明这种方式可以有效利用大规模的无标签语料以提升模型对于自然语言的理解力,即使其调整参数以记忆足够多知识的模型

结构类似于llama,为多层的decoder-only:

二、训练

2.1 无监督预训练

即,最大化根据之前位置正确的token生成当前位置正确token的对数概率

以下的公式清晰展示了输入在这个模型中的处理流程以及概率输出:

文本被token化后,进过输入的token embedding 矩阵映射后,加上位置编码,接着经过n层decoder块的处理后,softmax转化为词表大小的概率输出

2.2 有监督微调

对于有标签训练,加了一个输出的映射层,这个层负责从transformer的docoder块输出的向量中映射到标签的空间,有监督的损失与无监督类似:

在有监督训练阶段,加入了一定权重的无监督损失函数,有利于:

(1)改善有监督模型的泛化性(2)加速收敛

在此阶段,额外的参数为映射到标签的矩阵,和以及额外的分隔符embedding:

2.3 特定任务输入转换

对于分类、情感分析、相似度、多选等问题,对于训练数据输入前有一定的处理

比如在输入的不同文本段间中加分隔符,如上图

三、数据

预训练:含超过7000本书的:BooksCorpus dataset、1B Word Benchmark

四、实验

4.1 模型结构

12层的decoder-only, layer normalization, gelu激活函数, adam优化器,采用字节对编码词表的token化

4.2 细节

预训练100epoch;微调 3epoch

五、结论

GPT1 主要是探索了decoder-only模型以及其先预训练+有监督微调的范式的效果,有一定的开创性意义

相关推荐
熊猫钓鱼>_>2 分钟前
WorkBuddy使用心得:腾讯版“免部署小龙虾“的办公新体验
人工智能·ai·腾讯云·agent·wechat·openclaw·workbuddy
KG_LLM图谱增强大模型4 分钟前
MedHELM:真实临床医疗任务大语言模型的整体评估框架
人工智能·语言模型·自然语言处理
海涛从不浪5 分钟前
Claude Code+MiniMax安装配置(新手小白向)
人工智能
Neptune17 分钟前
大模型入门:从 TOKEN 到 Agent,搞懂 AI 的底层逻辑(上)
人工智能·深度学习
scott1985127 分钟前
扩散模型之(十六)像素空间生成模型
人工智能·深度学习·计算机视觉·生成式
拖拖7657 分钟前
深度学习架构的进化:ResNet-v2 与预激活的力量
人工智能
蔚天灿雨11 分钟前
Kage:在 Codex、Claude 和 QoderCLI 等 CodingAgentCLI 之间 Fork 与迁移 Session
人工智能·ai·agent·ai编程
no_work19 分钟前
yolo摄像头下的目标检测识别集合
人工智能·深度学习·yolo·目标检测·计算机视觉
一只叫煤球的猫24 分钟前
为什么不用 RAG 做记忆系统 ——压缩上下文与 memory.md 的架构选择
人工智能·后端·ai编程
智能工业品检测-奇妙智能30 分钟前
国产化系统的性价比对比
人工智能·spring boot·后端·openclaw·奇妙智能