Fine Tuning——Prompt-Learning && Delta Tuning

预训练大模型只能提供较好的初始化,面对纷繁复杂的NLP任务场景,需要进一步的微调训练。

T5
  • 110亿参数
  • 从训练"分类层"转为 训练 "encoder-decoder"
  • sequence to sequence 序列到序列的训练,输出token而不是分类
  • demonstration 例证
GPT3
  • 1750亿参数

    模型太大,单机根本无法微调

  • 没有任何参数被微调,通过prompt方式使用

  • Descriptions(Prompts) + Few-shot examples to generate tokens

    in-context leaning :大模型见过几个examples再输出

  • 优点

    更好的语言理解和语言生成效果

    更大的容积去学习新的知识

Fine tuning 的改变

以前的方法微调要改变全部模型的参数,在GPT3上是不现实的,在110b其实就很难了

每个任务对应一个100多亿的模型,100个任务就有100个模型,从存储角度来讲也不现实

高效的微调大模型 Effective Model Adaptation

从task 和 data的角度出发

prompt-learning

给模型加入一些额外的上下文 trigger出一些token

让输入数据变得更具体

从优化的角度出发

delta Tuning

用小参数去驱动大参数

相关推荐
weixin_4684668517 分钟前
DeepSeek-V4-Flash正式版深度解析:当“轻量模型”用后训练撬动Agent能力革命
人工智能·大模型·agent·deepseek·deepseek-v4
donoot18 分钟前
《大话文渊慧典》:六
人工智能·深度学习·aigc·ppstructure·文渊慧典·大话系列
阿部多瑞 ABU32 分钟前
正反馈的死亡螺旋:数字资本时代泛二次元文化-情感-金融复合体的系统性分析
大数据·人工智能·金融
过期的秋刀鱼!41 分钟前
学习曲线-过拟合和欠拟合要做什么以及原因
人工智能·python·深度学习·算法·机器学习·模型评估
haerapi1 小时前
别把页面塞进三个枚举:用“数据、过程、消息”重建 UI 状态
人工智能
非优秀程序员1 小时前
Netdata 接入 RTX5090显卡(集群),实现自动化监测及预警邮件发送
人工智能
罗小罗同学1 小时前
Nat. Biomed. Eng最新发表的医学AI基础模型CLEAR,可以将诊断决策与临床概念一一匹配,不再是传统黑箱模型
人工智能·医学图像处理·医工交叉·医学ai
Leslie1651 小时前
多人共享目录如何不失控:用 setgid、ACL、umask 与粘滞位设计 Linux 权限
人工智能
mit6.8241 小时前
“Copilot“ 超级应用“年内问世(`・ω・´)
人工智能
zhbcddxr1 小时前
GEO服务商度量监测能力测评:可见度追踪与报表排行
大数据·人工智能·microsoft