-
它既可以在large language model中用,也可以再diffusion中用,只要是矩阵乘法应该都可以吧。
-
固定层来增加一点新层,然后做finetune. 下面中的adapter和prefixLayer是什么?

它的操作其实就是将一个全fine tune的操作dd的矩阵乘,转换为两个dr, r*d的矩阵乘。显然这样极大的降低了finetune的参数量。
它的好处是可以通过config, 将full fine tuning作为一个特例存在。你认为underperform,就调大参数,调高rank即可。
训练完之后,推理几乎不会有额外的lantency,因为它是可以合并推理的。
这部分size小(几十M)可以放在内存中;可以在一个batch中训练不同的Loar
再有,就是,(这是MOE吗)

- CNN时代的33卷积变换为两个31和1*3的卷积串联起来。
- Repvgg在训练的时候拆分,在推理的时候合并。
我们真的需要fine tuning所有的参数吗?我们fine tuning的代价与这个矩阵的rank有什么关系?