从功能来看,我觉得翻译成"归积"比较合适,与"卷积"对应
其中"归"指的是"归一化操作",例如LayerNorm、RMSNorm、GroupNorm,虽然最新有论文Transformers without Normalization,但这篇论文引入的DyT操作可以看成是一种简化的归一化操作;另外"归"还有一层含义是"归纳",而以Transformer为基础的大语言模型擅长对信息进行"归纳"
"积"类似"卷积"里的"积",泛指加权求和操作。Multi-Head Attention和FFN都可以看成是一种加权求和操作,前者作用于Time维度,后者作用于Channel维度。同时"积"还可以理解成积分,Transformer Decoder有点像t维度上的积分操作