TileLang 实战:KDA 从零到一--Gated DeltaNet
前两篇分别实现了无遗忘的 chunked 线性注意力,以及带标量衰减的版本。两者的状态更新都只做加法:新的键值对累加进状态,旧信息靠衰减系数被动遗忘。本篇补上最后一块–删除。
递推式变成:
比上一篇多出的是 –一个删除力度的系数:它决定在 这个方向上,旧内容被擦掉多少。
上两篇见《Chunked 线性注意力》与《标量衰减》,本文沿用其符号约定与四层参考验证框架。本篇会用到 Householder 变换、WY 表示与 UT 变换这些线性代数工具,背景推导见《线性注意力的线性代数前置知识》。