Simple and Scalable Strategies to Continually Pre-train Large Language Models

Simple and Scalable Strategies to Continually Pre-train Large Language Models

相关链接:arxiv

关键字:Large Language ModelsPre-trainingContinual LearningDistribution ShiftAdaptation

摘要

大型语言模型(LLMs)通常会在数十亿个tokens上进行预训练,然后新数据一旦可用,就开始重新训练过程。一个更为高效的解决方案是持续地预训练这些模型------与重新训练相比,可以节省大量计算资源。然而,新数据分布的变化通常会导致在以前数据上的表现下降或者对新数据适应不良。本文展示了一个简单且可扩展的学习率重新增温(LR re-warming)、重新递减(LR re-decaying)结合以前数据重播的策略足以与在所有可用数据上从零开始重新训练的模型在最终损失和语言模型(LM)评估基准上匹配性能。具体来说,我们在英语到英语(300B参数模型)内的弱分布转换和英语到德语(405M参数模型)的更强分布转换下证明了这一点。选定弱但真实的转换进行大规模实验后,我们还发现我们的持续学习策略对于10B参数LLM的新训练基线也是匹配的。我们的结果表明,LLMs可以通过简单且可扩展的持续学习策略成功更新,仅使用一小部分计算资源即可与重新训练的基线匹配。

核心方法

  • 持续性预训练:为了有效利用计算资源与适应新数据,我们提出LR重新增温和重新递减策略。
  • 加热与递减学习率:通过增温与重新递减学习率来适应新数据集是必要的。这有助于适应性,但也可能增加遗忘。
  • 数据重播:在模型训练中重放以前数据的一定比例,以防止LLMs忘记旧数据(catastrophic forgetting)。
  • 无限学习率计划:我们还提出了一个无限学习率计划,以避免因为学习率重新增温导致的遗忘。

实验说明

使用的模型质量是:405M和10B参数,数据集规模是:超过2000B tokens的大型数据集。

实验结果示例(部分)

Model Dataset Training Tokens Validation Loss
405M Pile+SP Final Pile 300B 2.4
405M Pile+SP Final SP 300B 2.75
405M SP (PT Pile) Pile Continued 2.6
405M SP (PT Pile) SP Continued 2.8
  • 模型:包括Pile训练和在Pile基础上持续训练的模型。
  • 数据集:Pile和SP(SlimPajama)。
  • 训练Tokens:显示了用于训练的tokens数量。
  • 验证损失:显示模型在Pile和SP数据集上的验证损失。

结论

我们展示了LLMs可以通过简单且可扩展的持续学习策略成功更新,只用了一小部分计算资源即可与从零开始在所有可用数据上重新训练的基线匹配。这些策略包括LR重新增温和重新递减、数据重播。通过这些策略,我们成功实现了对模型进行快速适应新数据的同时,最小化了对旧数据的遗忘

相关推荐
聆风吟º2 小时前
CANN runtime 实战指南:异构计算场景中运行时组件的部署、调优与扩展技巧
人工智能·神经网络·cann·异构计算
聆风吟º4 小时前
CANN runtime 全链路拆解:AI 异构计算运行时的任务管理与功能适配技术路径
人工智能·深度学习·神经网络·cann
User_芊芊君子4 小时前
CANN大模型推理加速引擎ascend-transformer-boost深度解析:毫秒级响应的Transformer优化方案
人工智能·深度学习·transformer
智驱力人工智能5 小时前
小区高空抛物AI实时预警方案 筑牢社区头顶安全的实践 高空抛物检测 高空抛物监控安装教程 高空抛物误报率优化方案 高空抛物监控案例分享
人工智能·深度学习·opencv·算法·安全·yolo·边缘计算
人工不智能5775 小时前
拆解 BERT:Output 中的 Hidden States 到底藏了什么秘密?
人工智能·深度学习·bert
h64648564h6 小时前
CANN 性能剖析与调优全指南:从 Profiling 到 Kernel 级优化
人工智能·深度学习
心疼你的一切6 小时前
解密CANN仓库:AIGC的算力底座、关键应用与API实战解析
数据仓库·深度学习·aigc·cann
学电子她就能回来吗7 小时前
深度学习速成:损失函数与反向传播
人工智能·深度学习·学习·计算机视觉·github
爱吃泡芙的小白白7 小时前
突破传统:CNN卷积层(普通/空洞)核心技术演进与实战指南
人工智能·神经网络·cnn·卷积层·空洞卷积·普通卷积
Coder_Boy_8 小时前
TensorFlow小白科普
人工智能·深度学习·tensorflow·neo4j