论文阅读——GPT3

来自论文:Language Models are Few-Shot Learners

Arxiv:https://arxiv.org/abs/2005.14165v2

记录下一些概念等。,没有太多细节。

预训练LM尽管任务无关,但是要达到好的效果仍然需要在特定数据集或任务上微调。因此需要消除这个限制。解决这些问题的一个潜在途径是元学习------在语言模型的背景下,这意味着该模型在训练时发展了一系列广泛的技能和模式识别能力,然后在推理时使用这些能力来快速适应或识别所需的任务(如图1.1所示)

"in-context learning":

关于"zero-shot", "one-shot", or "few-shot"的解释:

随着模型增大,in-context learning效果越好:

关于"zero-shot", "one-shot", or "few-shot"

模型结构和GPT2一样,但是改了初始化、预归一化、reversible tokenization,以及在transformers层中使用类似Sparse Transformer的交替密集和局部稀疏的注意力模式。

内容窗口大小=2048 tokens

训练了8个不同大小的模型:

其他细节:

训练大模型需要大batch,小学习率。

few-shot learning中,实例样本数量k取值可以从0到最大窗口大小,一般可以设为10-100。

相关推荐
李燚5 小时前
RAG 流水线设计:Eino 的 Loader → Transformer → Indexer → Retriever(第60篇-E46)
人工智能·深度学习·transformer·agent·rag·aiagent·eino
hoLzwEge11 小时前
CLAUDE.md:为 Claude Code 注入项目记忆
深度学习·程序员·代码规范
金斗潼关12 小时前
使用MLP神经网络模型预测质数
人工智能·深度学习·神经网络
心运软件17 小时前
基于深度学习的IMDB电影评论情感分析完整实现
人工智能·pytorch·深度学习·数据分析
wuling12918 小时前
李沐《动手学深度学习》(Dive into Deep Learning)d2l 安装记录
人工智能·深度学习
满怀冰雪18 小时前
09-使用 paddle.nn 构建第一个多层感知机
python·深度学习·神经网络·paddle
handsomestWei19 小时前
RNN和QKV区别
人工智能·rnn·深度学习
m沐沐19 小时前
【计算机视觉】OpenCV 人脸检测与 Haar 级联分类器——原理、实现与实战案例
人工智能·pytorch·python·深度学习·opencv·计算机视觉·人脸检测
m沐沐20 小时前
【计算机视觉】OpenCV 物体跟踪——原理、算法与CSRT跟踪器实战
人工智能·python·深度学习·opencv·算法·计算机视觉·人脸识别
LaughingZhu20 小时前
Product Hunt 每日热榜 | 2026-07-26
人工智能·深度学习·神经网络·搜索引擎·百度