Attention机制真的可靠吗?近年来,Vision-Language Models(VLMs)在视觉问答、图像理解和视频理解等任务中表现出色,通常依赖language-to-vision attention衡量视觉与文本间的相关性,进行visual token pruning以降低推理成本。然而,一个被忽视的问题是:attention能否真正反映“语义重要性”?
最新研究中,上海大学曾丹团队分析了主流VLM中attention的行为模式,发现attention受结构性偏置影响。直接利用这些带偏的attention进行visual token pruning,会无意中保留不重要的视觉区域,丢失关键信息。
研究发现,语言到视觉的attention随visual token位置增大而上升,模型更倾向于关注序列靠后的视觉token。这表现为对图像下方区域给予更高attention,与图像语义无直接关系。
这种位置偏置在visual token pruning时被放大,导致保留“位置靠后但语义无关”的视觉token。
另一问题是padding区域的attention异常偏高。由于输入图像尺寸不一,padding不可避免,但这些区域在语义上无用。研究发现padding对应的视觉token在attention计算中常获得异常大权重,导致attention sink现象,误导基于attention的pruning策略。
针对上述问题,研究团队从更基础的角度考虑:既然attention有偏,能否先修正?他们通过拟合attention随token位置变化的整体趋势,显式建模位置偏置,并修正原始attention,削弱与内容无关的位置因素,使attention更接近真实语义相关性。
同时,在pruning阶段显式抑制padding区域的attention贡献。整个过程不涉及模型修改或重新训练。
研究将attention去偏策略作为plug-and-play模块,集成到多种主流pruning方法中评估。实验覆盖6种pruning baselines,在多个VLM上测试,验证于多个图像与视频理解任务。
结果显示,在几乎所有设置下,去偏修正后剪枝模型性能提升,尤其在更激进的token压缩条件下效果更明显。
研究指出,attention并不等同于语义重要性。忽视其固有偏置会误导基于attention的剪枝策略。通过简单有效的去偏修正,在不增加训练成本下,显著提升visual token pruning的可靠性与泛化能力。该研究为高效部署多模态模型提供新视角,也为更稳健的attention机制设计奠定基础。
文章链接:https://arxiv.org/abs/2508.17807
文章代码:https://github.com/intcomp/attention-bias
作者:上海大学、南开大学Kai Zhao¹等
本文由主机测评网于2026-06-15发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647699.html