flâneur — a map of the web's best reading

为什么线性注意力要加Short Conv? - 科学空间|Scientific Spaces

kexue.fm · saved by 1 readers

如果读者有关注模型架构方面的进展,那么就会发现,比较新的线性Attention(参考《线性注意力简史:从模仿、创新到反哺》)模型都给 Q,K,V 𝑄 , 𝐾 , 𝑉 加上了Short Conv,比如下图所示的DeltaNet: DeltaNet中的Short Conv 为什么要加这个Short Conv呢?直观理解可能是增加模型深度、增强模型的Token-Mixing能力等,说白了就是补偿线性化导致的表达能力下降。这个说法当然是大差不差,但它属于“万能模版”式的回答,我们更想对它的生效机制有更准确的认知。 接下来,笔者将给出自己的一个理解(更准确说应该是猜测)。 从《线性注意力简史:从模仿、创新到反哺》我们知道,目前的新式线性Attention背后的核心思想都是TTT(Test Time Training)或者说Online Learning。TTT基于优化器更新与RNN迭代的相似性,通过优化器来构建(不一定是线性的)RNN模型,诸如DeltaNet、GDN、Comba等线性Attention都可以看成它的特例。 具体来说,TTT将 K,V 𝐾 , 𝑉 视为成对的语料 ( k 1 , v 1 ),( k 2 , v 2 ),⋯,( k t , v t ) ( 𝑘 1 , 𝑣 1 ) , ( 𝑘 2 , 𝑣 2 ) , ⋯ , ( 𝑘 𝑡 , 𝑣 𝑡 ) ,我们用它训练一个模型 v=f( S t ;k) 𝑣 = 𝑓 ( 𝑆 𝑡 ; 𝑘 ) ,然后输出 o t =f( S t ; q t ) 𝑜 𝑡 = 𝑓 ( 𝑆 𝑡 ; 𝑞 𝑡 ) ,其中 S t 𝑆 𝑡 是模型参数,用SGD更新: S t = S t−1 − η t ∇ S t−1 L(f( S t−1 ; k t ), v t ) (1) (1) 𝑆 𝑡 = 𝑆 𝑡 − 1 − 𝜂 𝑡 ∇ 𝑆 𝑡 − 1 𝐿 ( 𝑓 ( 𝑆 𝑡 − 1 ; 𝑘 𝑡 ) , 𝑣 𝑡 ) 当然,如果我们愿意,也可以考虑其他优化器,比如《Test-Time Training Done Right》尝试了Muon优化器。除了可以改变优化器外,可以灵活改变的地方还有模型 v=f( S t ;k) 𝑣 = 𝑓 ( 𝑆 𝑡 ; 𝑘 ) 的架构以

Explore this link on the map →

saved by