LLM论文笔记 27: Looped Transformers for Length Generalization

  • Arxiv日期:2024.9.25

关键词

  • 长度泛化

  • transformer结构优化

核心结论

  1. RASP-L限制transformer无法处理包含循环的任务的长度泛化

  2. Loop Transformer显著提升了长度泛化能力

  • Input Injection显著提升了模型的长度泛化性能,尤其在二进制加法等复杂任务上效果显著

  • 在推理中,通过输出置信度判断迭代停止点的策略能够实现接近最佳的性能

主要方法

Transformer在长度泛化(length generalization)上表现有限,尤其是对未见长度的输入。本文重点研究解决这一问题的Loop Transformer架构(Looped Transformers),通过循环处理增加模型对输入长度的适应能力。

n-RASP-L问题 :(=n循环RASP-L问 )定义了一类任务,这些任务可以通过多次迭代应用某些基础操作(RASP-L操作)来解决。这些任务包括复制、求和、二进制加法等。

本质上是将内部无法处理的循环替换到外部,做到"n次transformer"

注:本系列不包括基础的知识点讲解,为笔记/大纲性质而非教程,用于论文知识点和思想和快速记忆和回顾,更多细节建议阅读论文原文

相关推荐
勤劳的进取家3 分钟前
论文阅读:PURPLE: Making a Large Language Model a Better SQL Writer
人工智能·语言模型·自然语言处理
Lifeng666666665 分钟前
显存不够?节约显存高效微调语言模型的五种方法及实验
人工智能·语言模型·自然语言处理
请叫我秀才5 分钟前
大模型基本原理:从传统NLP到语言大模型
人工智能·自然语言处理
老大白菜6 分钟前
FastMCP:为大语言模型构建强大的上下文和工具服务
人工智能·microsoft·语言模型
路人与大师7 分钟前
用算法实现 用统计的方式实现 用自然语言处理的方法实现 用大模型实现 专利精益化统计分析
人工智能·算法·自然语言处理
Binary Oracle11 分钟前
图解BERT
人工智能·深度学习·bert
Ao00000012 分钟前
机器学习——支持向量机SVM
人工智能·机器学习·支持向量机
努力学习GIS116 分钟前
ArcGISpro中的空间统计分析(二)
人工智能·机器学习
断问天21 分钟前
超简单Translation翻译模型部署
语言模型
张彦峰ZYF26 分钟前
探索常识性概念图谱:构建智能生活的知识桥梁
人工智能·后端·架构