当前位置:首页 > 科技资讯 > 正文

揭秘VLM中的Attention偏置:如何影响视觉Token剪枝

Attention机制真的可靠吗?近年来,Vision-Language Models(VLMs)在视觉问答、图像理解和视频理解等任务中表现出色,通常依赖language-to-vision attention衡量视觉与文本间的相关性,进行visual token pruning以降低推理成本。然而,一个被忽视的问题是:attention能否真正反映“语义重要性”?

最新研究中,上海大学曾丹团队分析了主流VLM中attention的行为模式,发现attention受结构性偏置影响。直接利用这些带偏的attention进行visual token pruning,会无意中保留不重要的视觉区域,丢失关键信息。

揭秘VLM中的Attention偏置:如何影响视觉Token剪枝 VLM attention偏置 视觉Token剪枝 语义重要性 第1张

Attention的两个核心偏置来源

1. 位置偏置(Recency Bias):attention更偏爱“后面的token”

研究发现,语言到视觉的attention随visual token位置增大而上升,模型更倾向于关注序列靠后的视觉token。这表现为对图像下方区域给予更高attention,与图像语义无直接关系。

这种位置偏置在visual token pruning时被放大,导致保留“位置靠后但语义无关”的视觉token。

揭秘VLM中的Attention偏置:如何影响视觉Token剪枝 VLM attention偏置 视觉Token剪枝 语义重要性 第2张

2. Padding Attention Sink:空白区域为何获得高attention?

另一问题是padding区域的attention异常偏高。由于输入图像尺寸不一,padding不可避免,但这些区域在语义上无用。研究发现padding对应的视觉token在attention计算中常获得异常大权重,导致attention sink现象,误导基于attention的pruning策略。

揭秘VLM中的Attention偏置:如何影响视觉Token剪枝 VLM attention偏置 视觉Token剪枝 语义重要性 第3张

核心思路:对Attention进行Debiasing

针对上述问题,研究团队从更基础的角度考虑:既然attention有偏,能否先修正?他们通过拟合attention随token位置变化的整体趋势,显式建模位置偏置,并修正原始attention,削弱与内容无关的位置因素,使attention更接近真实语义相关性。

同时,在pruning阶段显式抑制padding区域的attention贡献。整个过程不涉及模型修改或重新训练。

揭秘VLM中的Attention偏置:如何影响视觉Token剪枝 VLM attention偏置 视觉Token剪枝 语义重要性 第4张

实验结果

研究将attention去偏策略作为plug-and-play模块,集成到多种主流pruning方法中评估。实验覆盖6种pruning baselines,在多个VLM上测试,验证于多个图像与视频理解任务。

结果显示,在几乎所有设置下,去偏修正后剪枝模型性能提升,尤其在更激进的token压缩条件下效果更明显。

揭秘VLM中的Attention偏置:如何影响视觉Token剪枝 VLM attention偏置 视觉Token剪枝 语义重要性 第5张 揭秘VLM中的Attention偏置:如何影响视觉Token剪枝 VLM attention偏置 视觉Token剪枝 语义重要性 第6张

结论

研究指出,attention并不等同于语义重要性。忽视其固有偏置会误导基于attention的剪枝策略。通过简单有效的去偏修正,在不增加训练成本下,显著提升visual token pruning的可靠性与泛化能力。该研究为高效部署多模态模型提供新视角,也为更稳健的attention机制设计奠定基础。

文章链接:https://arxiv.org/abs/2508.17807

文章代码:https://github.com/intcomp/attention-bias

作者:上海大学、南开大学Kai Zhao¹等