论文略读:LoRA Learns Less and Forgets Less

202405 arxiv

1 主要思想

LORA相比于全参数训练,学的少,但忘的也少

2 实验分析

2.1 训练的表现

  • 在编程和数学任务中,LoRA相比全参数微调表现出明显的劣势

2.2 遗忘的表现

  • 这边的遗忘,是指在数据集A上预训练,然后在数据集B上继续finetune,看在数据集A上的表现
  • 相比全参数微调,LoRA学会的东西较少,但遗忘也相对更少

3 论文的分析:Lora的正则化特性

  • LoRA提供了比经典正则化技术,如权重衰减和dropout,更强的正则化效果。
  • 在下游任务上LoRA的表现低于大多数正则化方法(左图);在遗忘上LoRA优于所有正则化方法(右图)
相关推荐
犀利豆2 分钟前
Claude Code Tools 研究系列(三)ExitPlanMode
人工智能·后端
星栈19 分钟前
oh-my-pi工程级AI编码工使用体验
人工智能·后端·agent
建筑工程企业管理系统26 分钟前
erp工程项目管理系统落地价值:实现工程多项目成本精细化核算与管控
大数据·数据库·人工智能
万岳科技系统开发39 分钟前
校园跑腿外卖搭建助力高校周边商家拓展线上业务
大数据·人工智能·小程序
冬奇Lab44 分钟前
开源项目第173期:AI For Beginners — 微软出品的 12 周 24 课 AI 完整课程
人工智能·开源·资讯
陈彬深大1 小时前
《AI 渐进编程》之二十三:自适应调度——什么时候启用多Agent流水线
人工智能
invicinble1 小时前
搭建智能体--skill和mcp的进一步理解
人工智能
周末程序猿1 小时前
LLM智能路由实践:通过 Harness 工程节约模型成本
人工智能·agent
冬奇Lab1 小时前
代码库知识库系列(04):三种 Chunking 策略对比——AST 精确分割反而输了?
人工智能
宋哥转AI2 小时前
深入理解 AI Agent 02|混合检索与重排序实战:BM25、RRF 与 Cross-Encoder 的工程实践
人工智能