技术栈

foil

I Am a robert girl
3 小时前
注意力机制·模型优化·moe·大模型架构·混合专家·循环transformer·foil
如何循环 MoE:压平专家,解开注意力从今天觉醒,技术赋予每一个人数字生命过去两年,大模型架构的演进基本沿着两条独立路线展开。一条是循环 Transformer(Looped Transformer):把同一组层反复用几遍,用额外算力把固定尺寸的模型"榨"得更充分,让参数被复用得更彻底。另一条是稀疏混合专家(MoE):每个 token 只激活众多专家中的少数几个,从而在总参数量膨胀的同时控制单 token 计算量。
我是有底线的