
滑动窗口注意力是一种稀疏注意力机制,它通过限制模型在计算注意力时仅能关注序列中一个固定大小的局部窗口内的信息,从而有效降低计算复杂度。
清华大学在2026年的研究中比较了不同窗口大小的SWA混合模型,并发现了“大窗口懒惰症”现象。 百度在Unlimited OCR模型中提出了其变体“参考滑动窗口注意力”,将解码阶段的KV Cache固定为常数。 该机制也被应用于阿里RTPurboV2等模型的混合架构中。
想要了解更多“滑动窗口注意力”的信息,请点击:滑动窗口注意力百科

滑动窗口注意力是一种稀疏注意力机制,它通过限制模型在计算注意力时仅能关注序列中一个固定大小的局部窗口内的信息,从而有效降低计算复杂度。
清华大学在2026年的研究中比较了不同窗口大小的SWA混合模型,并发现了“大窗口懒惰症”现象。 百度在Unlimited OCR模型中提出了其变体“参考滑动窗口注意力”,将解码阶段的KV Cache固定为常数。 该机制也被应用于阿里RTPurboV2等模型的混合架构中。
想要了解更多“滑动窗口注意力”的信息,请点击:滑动窗口注意力百科