技术栈
循环transformer
I Am a robert girl
3 小时前
注意力机制
·
模型优化
·
moe
·
大模型架构
·
混合专家
·
循环transformer
·
foil
如何循环 MoE:压平专家,解开注意力
从今天觉醒,技术赋予每一个人数字生命过去两年,大模型架构的演进基本沿着两条独立路线展开。一条是循环 Transformer(Looped Transformer):把同一组层反复用几遍,用额外算力把固定尺寸的模型"榨"得更充分,让参数被复用得更彻底。另一条是稀疏混合专家(MoE):每个 token 只激活众多专家中的少数几个,从而在总参数量膨胀的同时控制单 token 计算量。
我是有底线的