一、研究背景与问题视觉变换器ViTs作为通用特征提取器广泛应用于全监督、文本监督如CLIP和自监督如DINO等多种范式下的下游任务。然而近期研究发现ViTs在不同监督模式下均存在密集特征伪影问题标签监督ViT存在“注意力缺陷”文本监督ViT在开放词汇任务中无法准确对齐像素与文本自监督ViT产生“高范数标记”影响对象定位。现有方法如Register、CLIPSelf等均只能部分缓解某一类伪影无法统一解决。这表明学界对ViT内部工作机制的理解仍不完整。二、核心发现伪影源于“懒惰聚合”行为作者通过系统分析首次提出并验证了ViT伪影的统一根本原因——懒惰聚合Lazy Aggregation定义ViT利用大量语义无关的背景块作为捷径来编码全局语义而非真正关注前景对象。驱动因素粗粒度语义监督仅有图像级标签缺乏块级空间指导全局注意力机制允许前景语义扩散到背景标记中。表现特征背景块获得高“块得分”CLS-块相似度该偏差从训练初期即出现并持续存在移除高得分背景块不影响甚至提升分类准确率。三、提出的解决方案LaSt-ViTLazyStrike作者提出一种频率感知的选择性聚合机制核心思想是将CLS标记锚定到前景稳定特征上从而阻断背景捷径。技术路线稳定性得分计算对每个块在通道维度进行一维傅里叶变换 低通滤波比较原始与滤波后特征的差异衡量其稳定性。通道级Top-K池化对每个通道选取最稳定的K个块进行聚合生成新的CLS表示。投票计数统计每个块被选中的次数作为其重要性指标高投票块自然对应于前景区域。该方法直接集成到预训练过程中无需改变网络架构、无需事后微调或测试时干预。四、实验验证与性能提升作者在12个基准测试上进行了广泛验证涵盖三种监督范式监督类型下游任务关键结果全监督粗分割、PCA可视化ViT-B/16在VOC12上达到41.9% mIoU接近DINO47.7%证明涌现属性并非自监督独有文本监督CLIP等零样本语义分割6个数据集、开放词汇检测/分割在VOC上mIoU从49.0%→75.0%26%在COCO检测新颖类别上提升高达15.8%自监督DINO无监督对象发现CorLocVOC07达到64.4%VOC12达67.6%COCO达51.6%超越LOST等SOTA方法伪影消除效果点入框PiB得分从42.7提升至55.112.4接近ResNet水平高范数现象被完全消除图6特征PCA可视化显示前景与背景被清晰区分。五、消融研究与理论验证增大块大小减少背景标记比例→ PiB提升但分类准确率下降 → 验证粗粒度监督的作用限制全局注意力窗口注意力→ PiB提升准确率下降 → 验证全局依赖性的作用与MaxPool等简单池化对比证明性能提升源于语义聚合而非池化副作用Top-K消融表明选择约一半标记K≈N/2效果最佳。六、核心贡献总结首次统一解释了不同监督范式下ViT伪影的共同根源——懒惰聚合提出了两个新评价指标块得分Patch Score和点入框Point-in-Box用于量化伪影程度设计了频率引导的选择性聚合方法LaSt-ViT简单高效无需架构改动在12个多样化基准上取得一致且显著的性能提升覆盖分类、分割、检测、发现等任务揭示了涌现语义分割属性并非自监督独有全监督ViT经本方法处理后同样具备。该工作不仅提供了一个实用性强、通用性高的伪影消除方案更从第一性原理层面深化了我们对ViT内部表征学习机制的理解指出“全局优化目标与局部语义一致性之间的内在冲突”是ViT设计的根本性挑战为未来架构设计和训练策略优化提供了新的理论基准。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示图 1. LazyStrike 提供了一个统一的框架用于分析和缓解 ViT 在不同监督设置下的各种伪影。该图展示了全监督中间和自监督右下的块得分定义为 CLS-块相似度以及全监督下特征的 PCA 投影左。摘要在大规模数据上预训练的视觉变换器ViTs为各种下游任务提供了通用的表征。然而在不同监督范式paradigms和下游任务中ViTs 中的伪影artifacts被广泛观察到。通过对 ViTs 中伪影的系统性分析我们发现其基本机制尚未得到充分阐明。在本文中通过系统性分析我们得出结论这些伪影源于一种“懒惰聚合”lazy aggregation行为ViT 利用语义上不相关的背景块作为捷径shortcuts来表示全局语义这是由全局注意力和粗粒度语义监督驱动的。我们的解决方案选择性地将块特征整合到 CLS 标记中减少了背景主导捷径的影响并在 12 个基准测试中在标签、文本和自监督下持续提升了性能。我们希望这项工作能为理解 ViT 行为提供一个新的视角。1. 引言视觉变换器ViTs[7] 已成为图像识别的事实标准 [6, 13, 22-24, 40]。更重要的是它们作为各种特定视觉任务 [4, 9, 12, 33, 45] 的通用特征提取器充当冻结的基础模型foundation model在大规模数据上预训练后将图像嵌入为特征表示这得益于其在数据和模型规模上的可扩展性。更广泛地说这种通用的 ViT 特征提取器可以适应预训练期间的各种监督方法不同的方法表现出特别适合不同下游任务的特征。具体来说监督方法——例如使用全监督分类标签或文本监督的图像-文本对例如 CLIP [27] 模型训练 ViTs——为开放词汇open-vocabulary任务生成密集特征并作为大型视觉语言模型LVLMs[20] 的视觉编码器。或者自监督方法 [1, 2, 25]特别是仅基于图像训练的 DINO [1] 模型展示了对象和部件发现的潜力使其适用于无监督分割任务 [31]。然而最近的研究揭示了 ViTs 在应用于需要密集特征的下游任务时令人费解的密集特征伪影。例如DINO [43] 证明了标签监督的 ViTs 存在注意力缺陷attention deficit[26]而 CLIPSelf [37] 观察到文本监督的 ViTs 无法产生在开放词汇任务中与文本线索精确对齐的密集图像特征。同时Regiser [5] 揭示了自监督的 ViTs 在注意力图中产生伪影通常被称为高范数标记high-norm tokens这对对象定位任务 [31] 产生不利影响。这些现象表明 ViTs 中存在一个共同的潜在问题只是在不同的监督范式下表现出不同的形式 [1, 14, 34]。在我们的初步探索中我们发现没有单一方法 [5, 36, 44] 能够全面解决这些现象。这个结果表明即使 ViTs 已经被研究了大约五年 [7]我们对它们的理解仍然不完整。鉴于许多问题可能源于一个共同的机制一个统一的解决方案是可取的。在本文中我们进行了一项基于第一性原理的研究——从头开始系统地定义、分析和解决 ViTs 中观察到的不同类型伪影。为了为这些在不同范式下的现象建立一个统一的定义我们引入了块得分Patch Score——块特征与 CLS 标记封装了图像的全局语义之间的相似度——从而评估相对于全局表示的局部语义一致性独立于训练范式。块得分背后的直觉是对于不同监督下的 ViT训练目标旨在将 CLS 特征与监督信号例如标签或文本对齐密集特征中的任何错位都会导致非前景区域的块得分升高如图 1 所示。为了定量评估块得分中的伪影我们提出了点入框Point-in-Box, PiB指标该指标评估得分最高的块是否位于标注的前景区域内。如图 1 和表 1 所示我们发现在不同的监督设置下ViTs 将更高的块得分分配给背景块并且与 ConvNets [11] 相比其 PiB 得分要低得多。详细的实验设置见第 4.1 节。为清晰简洁起见除非另有明确说明下文中术语“伪影”特指那些错误地产生高块得分的语义无关背景标记。基于块得分和 PiB我们对 ViT 的行为进行了深入分析并提出了一个旨在更好地解释这些伪影的假设自然图像本质上包含许多与主要对象无关的背景块。仅凭图像级监督模型缺乏空间指导因此倾向于通过背景证据懒惰聚合来编码全局语义。经验上在预训练的 ViT 中移除前 50% 得分最高的块对 ImageNet 准确率影响微乎其微图 2这证实了这种依赖性。全局依赖性允许 ViT 利用这些无关的背景块作为表示全局语义的捷径。在缺乏块级标注的情况下ViTs 可能在训练初期就采用懒惰聚合方式将少量前景语义扩散到背景中。表 1. 不同监督方法下的点入框PiB得分。我们发现 Register 减少了高范数标记但高范数并非伪影的根本原因。基于这种解释我们通过提出一个直接的解决方案来进一步验证我们的假设以消除这些伪影通过在预训练期间调节背景块的影响我们鼓励 ViTs 关注前景语义。具体来说模型学习估计每个标记的贡献第 5.1 节并选择性地将有信息的块特征整合到 CLS 标记中以增强前景表示。如图 5 所示当这些比例被适当增加时ViTs 会自动将注意力转移到前景对象上使高得分块与前景对齐。一旦这种懒惰聚合被缓解我们的方法——称为 LaSt-ViT (LazyStrike ViT)——就能消除所有监督类型下的块得分伪影。它有效地解决了高范数标记问题和特征错位问题。值得注意的是在应用我们的方法后ViTs 在不同的预训练范式下都表现出改进的涌现语义分割属性emergent semantic segmentation properties[43]。贡献.(1) 我们通过块得分和点入框PiB系统地分析了 ViTs 中伪影的根本原因揭示了一种早期出现并持续存在的背景主导偏差。(2) 我们提出了一个将粗粒度语义监督和全局依赖性与懒惰聚合联系起来的假设——这是一种捷径行为即 ViTs 依赖背景块来编码全局语义而不是关注真正的前景区域。(3) 我们提出了 LaSt-ViT一种简单的、频率感知的选择性聚合方案将 CLS 标记锚定到前景区域。(4) 我们在 12 个基准测试中展示了一致的性能提升包括对象发现、语义/实例分割和开放词汇检测。2. 相关工作文本监督 ViTCLIP 类型模型 [27]中的伪影。视觉-语言对比预训练 [18, 27] 的最新进展使得 CLIP 模型能够产生超越图像级分类的密集预测。MaskCLIP [44] 首次表明CLIP 特征可以通过像素-文本对齐实现零样本语义分割。然而后续研究 [10, 17, 19, 36, 37, 42] 发现尽管 ViTs 在模型容量和分类准确率上超越了 ResNets但在密集对齐任务上表现更差。为了缓解这种错位现有工作要么 (1) 修改最终的注意力层 [10, 17, 19, 36, 38, 42]要么 (2) 引入额外的对齐训练 [3, 37]要么 (3) 采用测试时激活编辑例如在推理期间将高范数异常激活动态移动到未经训练的寄存器标记中 [15]。相比之下我们的方法在预训练期间直接处理问题避免架构更改、事后微调和测试时干预从根本上防止文本监督 ViTs 中懒惰行为的出现。自监督 ViTDINO 类型模型 [1]中的伪影。Register [5] 发现 DINOv2 [25] 在单目深度估计和语义分割方面取得了成功但由于特征图上出现的伪影它失去了 DINO [1] 的对象检测能力。为了解决这个问题引入了额外的标记旨在存储全局特征并减轻这些伪影的影响。在我们对高范数现象的深入分析中我们发现高范数仅仅是后期懒惰行为的一种表现。简单地将高范数标记从特征图移动到寄存器标记并不能完全解决下游任务中的潜在缺陷。因此Vision Transformer 需要的不仅仅是 Registers。3. 预备知识3.1. 网络架构Vision Transformer4. 分析与假设我们引入了两个探针——块得分CLS-块相似度和点入框——来分析 ViTs 中伪影出现的位置和时间第 4.1 节。从空间和时间两个角度第 4.2 节我们发现高块得分集中在背景区域并且这种偏差从训练一开始就出现并持续存在。这些发现表明使用粗粒度语义监督图像级而非块级目标训练并配备强大全局依赖性长程注意力的 ViTs倾向于采用一种懒惰聚合捷径——将前景语义扩散到背景标记中。为了验证这个假设我们隔离了每个因素通过使用更大的块大小来减少背景标记第 4.3 节以及通过基于窗口的注意力来限制注意力范围第 4.4 节。两种干预措施都提高了点入框得分但略微降低了分类准确率表明减少全局依赖性有助于抑制背景偏差但以牺牲整体识别性能为代价。所有分析都在 ImageNet-1k [6, 34] 上进行在文本和自监督预训练 [1, 14, 28] 下也观察到了一致的趋势。进一步的观察——例如高范数标记 [5] 的作用和 DINO-v1 的独特行为——在附录中提供。4.1. 新指标块得分和点入框4.2. 块得分中的伪影问题CLS 标记“看”向哪里实验设置.我们研究了一个在 ImageNet-1k [6] 上训练的 ViT-B/16全监督。我们可视化了归一化的块得分分布并通过在重新评估之前直接在输入图像上屏蔽前 k 个或后 k 个块来进行探针实验。实验结果.实验结果显示在 ImageNet-1k 上的块得分分布和屏蔽探针。 (a) 前景与背景块得分的归一化分布。 (b) 移除前 k 个高得分块高达 70%不会损害准确率甚至可能提高准确率。分布.前景块集中在较低的块得分值而背景块主导了高得分的尾部图 2a。屏蔽探针.移除高得分块不会损害准确率——甚至可能略有提升例如ViT-B/16 提升了 1.2%——即使超过 50% 的块被屏蔽。相比之下移除低得分块会导致准确率急剧下降在 70% 屏蔽时下降高达 60%图 2b。结论在输入图像中屏蔽背景块几乎不影响分类性能然而这些区域显示出的特征响应与编码类别语义的 CLS 标记高度相关这表明前景信息在训练期间已被传播到背景中——这种行为很可能是由自然图像中背景标记相对于前景标记的主导地位驱动的如图 2b 所示超过一半的块对分类无贡献。问题这种现象何时开始实验设置.我们使用相同的超参数和批量大小在 ImageNet-1k [6] 上训练 ViT-B/16 [7] 和 ResNet50 [11]并在整个训练过程中跟踪 top-1 准确率和点入框得分。实验结果.实验结果显示点入框动态.ViT 的点入框得分反映了伪影水平越低表示背景偏差越强在训练过程中保持较低且几乎不变即使分类准确率在提高图 3。与 ResNet 比较.与 ResNet 相比ViT 始终表现出较低的点入框得分揭示了尽管图像级准确率相似但其背景偏差更为明显图 3。结论前景信息向背景的传播从训练一开始就发生。图 3. ImageNet-1k 上的训练动态。左top-1 准确率右点入框得分。随着训练的进行ViT 的分类准确率稳步提高但其点入框得分几乎保持平坦约 \(0.42 \rightarrow 0.44\) 并且在整个训练过程中始终低于 ResNet 的得分。即使在早期迭代中CLS 标记已经主要关注背景块而非前景区域并且这种偏差在整个训练过程中持续存在——产生准确的图像级预测但块级对齐效果较差。这种早期出现表明伪影不是后期阶段的副产品而是 ViT 训练中的内在现象。我们假设在训练开始时CLS 标记寻求最小化图像级损失的最简单路径迅速学习聚合与图像级标签相关的背景标记。结果图像级语义通过背景区域被“短路”导致分类准确率高但块级对齐差——这是模型懒惰聚合行为的标志。接下来我们假设这种行为源于两个相互作用的因素(1) 粗粒度语义监督其中图像级标签无法提供准确的块级监督以及 (2) 全局依赖性其中基于注意力的标记混合允许背景标记吸收前景信息。第 4.3 节和第 4.4 节进一步分离并量化了每个因素的贡献。4.3. 粗粒度语义监督验证实验设置.为了评估粗粒度语义监督的影响我们通过增加嵌入模块 Pemb(⋅) 中使用的块大小来减少背景标记的普遍性。随着块大小的增加生成的标记更少许多小的背景区域被合并到更大的块中从而降低了背景标记的相对比例。具体来说我们在 ImageNet-1k [6] 上使用 28×28 的块大小默认16×16训练 ViT-Base这使背景标记的比例减少了约 10%详见附录。验证实验结果.如图 4 所示增大块大小后点入框从 0.44 增加到 0.52这使背景标记的比例减少了约 10%。块得分图显示高得分区域从背景转向对象区域。然而top-1 准确率从 62% 下降到 55%揭示了分类和定位准确率之间的权衡。图 4. 粗粒度语义监督的影响。增加块大小使背景标记减少 (10%)。效果点入框从 0.44 上升到 0.52高得分块向前景转移。权衡分类准确率下降表明粗粒度语义监督导致了伪影而简单的块粗化损害了识别能力。4.4. ViT 全局依赖性导致的懒惰行为验证实验设置.我们进一步检验 ViT 的全局注意力是否通过允许前景语义传播到背景区域而加剧了懒惰聚合行为。为了逐步限制长程依赖性我们在不同层将全局自注意力替换为基于窗口的注意力 [21]。表 2. 在 ViT-Small 上的窗口注意力消融实验。限制全局依赖性会提高点入框但会降低 top-1 准确率。这表明不受限制的全局注意力放大了懒惰行为因为粗粒度语义监督允许背景标记吸收扩散的语义。验证实验结果.如表 2 所示随着全局注意力的限制点入框得分增加当所有层都采用窗口注意力时达到最高值。然而准确率相应下降这表明虽然全局上下文有利于分类但它也促进了语义向背景块的扩散。结论当视觉变换器在粗粒度语义监督下训练并配备不受限制的全局依赖性时它们倾向于追求最简单的优化路径——将前景语义扩散到大量的背景标记中。这种捷径产生了较高的图像级准确率但导致表示被背景信息主导表明优化全局分类目标可能会损害 ViTs 中的块级语义一致性。5. 方法概述与原理.为了缓解懒惰聚合我们将 CLS 标记聚合重新表述为一个频率感知过程以区分前景块和背景块。在自然图像中前景信号具有更同质的语义意义导致深层特征图中沿通道维度的变化较小而背景通常具有更高的语义多样性因此选择在通道维度上经过低通滤波后保持稳定的标记有可能将 CLS 标记锚定到前景区域。5.1. LaSt-ViT图 5. LaSt-ViT 中的 CLS 标记“看”向哪里对于每张图像投票数分别超过图像内最大投票数的 50%、30% 或 20% 的块从左到右以红色可视化。应用 LaSt-ViT 后高投票块始终对应于前景区域表明 CLS 标记主要聚合前景标记而非背景标记。投票计数.我们将标记块i 的投票计数定义为5.2. 迁移到下游任务在本节中我们提供更多细节并解释每个下游任务的执行方式。无监督对象发现.由于 LazyStrike 引导 CLS 标记关注前景对象我们可以使用块得分实现无监督对象定位。这种扩展独立于训练方法——这通常是早期工作中像 DINO 这样的自监督方法的特权——允许任何训练目标来完成此任务。我们通过应用一个定义为均值得分加一个标准差的阈值来构建掩码。得分高于此阈值的块被分类为前景。[92, 788, 481, 899], [516, 494, 904, 525]零样本开放词汇任务.由于 LazyStrike 确保 CLS 特征从正确的块特征聚合信息并且 CLS 特征本身直接受到学习信号的监督这有效地导致了块特征与监督信号之间的隐式对齐。对于文本监督的 ViTs我们可以通过计算块特征与任意文本特征之间的相似度来获得零样本语义分割结果从而在各种开放词汇任务中实现应用。表 3. LazyStrike 在点入框得分上的评估。6. 实验6.1. 实验设置我们首先验证了块得分中伪影的消除第 6.2 节并在三种训练方法上验证了我们提出的方法全监督第 6.3 节、文本监督第 6.4 节和自监督第 6.5 节并检验了不同监督下 ViT 的多个下游任务包括对象发现 [1, 31]、零样本语义分割 [27, 32, 39]、开放词汇对象检测 [16, 30]、实例分割 [29, 37] 和粗分割 [1]。6.2. 伪影消除特征范数和块得分中伪影的消除.表 3 展示了不同训练方法下的结果表明 LazyStrike 不仅消除了高范数现象还提高了点入框得分。应用 LazyStrike 后ViT 的点入框得分接近 ResNet [11]。图 6 提供了全监督训练 [34] 下特征范数的详细分析显示 LazyStrike 降低了最大特征值从而缓解了高范数现象。6.3. 全监督比较粗分割的出现.遵循 [1]我们在 VOC12 的验证集上评估涌现属性emerging properties这种现象以前只出现在自监督训练中。如表 6 所示我们的方法在不同模型大小和训练方法上持续改进了涌现属性。值得注意的是我们的方法在监督设置下取得了接近 DINO 的性能41.9% 对比 47.7%表明 LazyStrike 促进了涌现属性的出现并且这些属性并非自监督独有。表 4. 在六个语义分割基准上的评估结果mIoU, %%。我们的结果以灰色标记。LazyStrike 在不同类型的 CLIP [27] 和模型大小下持续改进了文本监督下的语义分割结果表明在理解了问题的本质后一个简单的方法可以统一解决不同模型的问题。表 5. 开放词汇基准上的评估结果。我们的结果以灰色标记。LazyStrike 持续提升了开放词汇密集任务的性能表明冻结的 ViT 可以达到与 ConvNet [11] 相当的性能。PCA 的出现.如图 7 所示我们计算了 LaSt-ViT 块特征的 PCA并可视化了前景的前三个分量。LazyStrike 细化了先前纠缠的 PCA 特征有效地区分并突出了显著的前景。6.4. 弱监督比较零样本语义分割基准.表 4 展示了我们提出的方法在六个语义分割基准上与几个基线模型的对比。通过将我们的修改集成到这些模型中获得的改进以蓝色突出显示。我们的方法在所有评估基准上始终优于基线模型显示出显著的提升。例如当应用于具有 ViT-B/16 架构的 CLIP [27] 模型时我们的方法在 Pascal从 11.2% 到 15.2%、Cityscapes从 6.5% 到 12.1%和 VOC从 49.0%到 75.0%上实现了 mIoU 的大幅提升。当扩展到更大的 ViT-L 架构时我们的方法继续提供显著的结果。对于 CLIP 模型VOC 上的 mIoU 从 17.1% 跃升至令人印象深刻的 72.4%表 7. 对象发现 CorLoc。所有模型都采用 ViT-S。以前性能最佳的方法依赖于特征向量计算而 LazyStrike 避免了这种沉重的计算需求。图 7. PCA 分量的可视化。我们计算块特征的 PCA并可视化前景对象的前 3 个分量。使用 LazyStrike标签监督下的 ViT 也能区分前景和背景并分离对象部件增强了特征表示。Cityscapes 上从 2.7% 增加到 12.3%。总之将我们的方法集成到基线模型中在所有基准测试中均带来了显著改进证明了其在不同 CLIP 模型和不同规模模型上的鲁棒性和有效性。开放词汇对象检测和分割基准.如表 5 所示我们选择 F-VLM [16] 和 F-ViT [37] 作为基线。两种方法都使用冻结的 CLIP [32] 作为对象检测和实例分割的骨干网络。在获取感兴趣区域后它们对相应区域的语义得分进行加权以确定对象类别得分。唯一的区别是 F-VLM 使用基于 ConvNet 的骨干网络而 F-ViT 采用基于 ViT 的骨干网络。对于 OV-COCOLaSt-ViT 在 ViT-B 和 ViT-L 的新颖类别上分别比基线提高了 15.8% 和 14.4%。对于 OV-LVIS它在 ViT-B 和 ViT-L 的稀有类别上也分别比基线提高了 11.3% 和 6.6%。6.5. 自监督比较无监督对象发现.我们采用 DINO-seg [1] 和 LOST [31] 作为基线进行比较两者都利用 ViT-S [7] 作为对象发现任务的骨干网络。比较结果见表 7。LaSt-ViT 表现出显著的性能改进。具体来说我们的模型在所有数据集上都取得了最高的 CorLoc 得分超过了 DINO-seg 和 LOST 模型。值得注意的是我们的模型在 VOC 2007 上达到了 64.4% 的 CorLoc 得分在 VOC 2012 上达到了 67.6%在 COCO 上达到了 51.6%分别比性能最佳的 LOST 模型提高了 2.7%、3.6% 和 0.9%。此外我们的方法展示了每秒 55.9 张图像的惊人吞吐量。这表明我们的模型实现了优越的对象发现性能并且运行效率更高使其非常适合实际应用。6.6. 消融研究缓解伪影的其他方法.在表 8 中我们还报告了使用 Maxpool 的结果它自然地减少了背景激活并作为评估伪影缓解的强有力参考。虽然 Maxpool 带来了适度的改进但我们的方法在分类和分割任务上都实现了显著更高的性能表明改进源于更有效的语义聚合而非池化引起的副作用。截断标记的数量.在表 8 中我们通过使用不同数量的 KK 训练 OpenCLIP [14] ViT-B/16 来研究 Top-KK 的影响。使用 LazyStrike 后性能显著提高当选择一半标记时达到峰值。表 9 显示了在标签监督的 ViT-B/32 上进一步的消融研究该模型在 ImageNet-1k 上预训练并报告了分类性能和 CorLoc 结果。7. 结论我们揭示了 Vision Transformers 通常采用一种懒惰聚合行为——由于背景块相对于前景区域具有压倒性的数量优势它们依赖大量的背景块来编码全局语义。为了应对这个问题我们提出了 LaSt-ViT一种频率引导的选择性聚合方法它将 CLS 标记集中在稳定的、与前景相关的特征上。我们的方法有效地消除了各种监督类型下的伪影并在 12 个基准测试中取得了一致的改进为理解 ViT 的内部行为提供了一个更清晰的视角并为未来的研究奠定了坚实的基础。
LaSt-ViT——Vision Transformers Need More Than Registers——惰性消除视觉变换器
一、研究背景与问题视觉变换器ViTs作为通用特征提取器广泛应用于全监督、文本监督如CLIP和自监督如DINO等多种范式下的下游任务。然而近期研究发现ViTs在不同监督模式下均存在密集特征伪影问题标签监督ViT存在“注意力缺陷”文本监督ViT在开放词汇任务中无法准确对齐像素与文本自监督ViT产生“高范数标记”影响对象定位。现有方法如Register、CLIPSelf等均只能部分缓解某一类伪影无法统一解决。这表明学界对ViT内部工作机制的理解仍不完整。二、核心发现伪影源于“懒惰聚合”行为作者通过系统分析首次提出并验证了ViT伪影的统一根本原因——懒惰聚合Lazy Aggregation定义ViT利用大量语义无关的背景块作为捷径来编码全局语义而非真正关注前景对象。驱动因素粗粒度语义监督仅有图像级标签缺乏块级空间指导全局注意力机制允许前景语义扩散到背景标记中。表现特征背景块获得高“块得分”CLS-块相似度该偏差从训练初期即出现并持续存在移除高得分背景块不影响甚至提升分类准确率。三、提出的解决方案LaSt-ViTLazyStrike作者提出一种频率感知的选择性聚合机制核心思想是将CLS标记锚定到前景稳定特征上从而阻断背景捷径。技术路线稳定性得分计算对每个块在通道维度进行一维傅里叶变换 低通滤波比较原始与滤波后特征的差异衡量其稳定性。通道级Top-K池化对每个通道选取最稳定的K个块进行聚合生成新的CLS表示。投票计数统计每个块被选中的次数作为其重要性指标高投票块自然对应于前景区域。该方法直接集成到预训练过程中无需改变网络架构、无需事后微调或测试时干预。四、实验验证与性能提升作者在12个基准测试上进行了广泛验证涵盖三种监督范式监督类型下游任务关键结果全监督粗分割、PCA可视化ViT-B/16在VOC12上达到41.9% mIoU接近DINO47.7%证明涌现属性并非自监督独有文本监督CLIP等零样本语义分割6个数据集、开放词汇检测/分割在VOC上mIoU从49.0%→75.0%26%在COCO检测新颖类别上提升高达15.8%自监督DINO无监督对象发现CorLocVOC07达到64.4%VOC12达67.6%COCO达51.6%超越LOST等SOTA方法伪影消除效果点入框PiB得分从42.7提升至55.112.4接近ResNet水平高范数现象被完全消除图6特征PCA可视化显示前景与背景被清晰区分。五、消融研究与理论验证增大块大小减少背景标记比例→ PiB提升但分类准确率下降 → 验证粗粒度监督的作用限制全局注意力窗口注意力→ PiB提升准确率下降 → 验证全局依赖性的作用与MaxPool等简单池化对比证明性能提升源于语义聚合而非池化副作用Top-K消融表明选择约一半标记K≈N/2效果最佳。六、核心贡献总结首次统一解释了不同监督范式下ViT伪影的共同根源——懒惰聚合提出了两个新评价指标块得分Patch Score和点入框Point-in-Box用于量化伪影程度设计了频率引导的选择性聚合方法LaSt-ViT简单高效无需架构改动在12个多样化基准上取得一致且显著的性能提升覆盖分类、分割、检测、发现等任务揭示了涌现语义分割属性并非自监督独有全监督ViT经本方法处理后同样具备。该工作不仅提供了一个实用性强、通用性高的伪影消除方案更从第一性原理层面深化了我们对ViT内部表征学习机制的理解指出“全局优化目标与局部语义一致性之间的内在冲突”是ViT设计的根本性挑战为未来架构设计和训练策略优化提供了新的理论基准。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示图 1. LazyStrike 提供了一个统一的框架用于分析和缓解 ViT 在不同监督设置下的各种伪影。该图展示了全监督中间和自监督右下的块得分定义为 CLS-块相似度以及全监督下特征的 PCA 投影左。摘要在大规模数据上预训练的视觉变换器ViTs为各种下游任务提供了通用的表征。然而在不同监督范式paradigms和下游任务中ViTs 中的伪影artifacts被广泛观察到。通过对 ViTs 中伪影的系统性分析我们发现其基本机制尚未得到充分阐明。在本文中通过系统性分析我们得出结论这些伪影源于一种“懒惰聚合”lazy aggregation行为ViT 利用语义上不相关的背景块作为捷径shortcuts来表示全局语义这是由全局注意力和粗粒度语义监督驱动的。我们的解决方案选择性地将块特征整合到 CLS 标记中减少了背景主导捷径的影响并在 12 个基准测试中在标签、文本和自监督下持续提升了性能。我们希望这项工作能为理解 ViT 行为提供一个新的视角。1. 引言视觉变换器ViTs[7] 已成为图像识别的事实标准 [6, 13, 22-24, 40]。更重要的是它们作为各种特定视觉任务 [4, 9, 12, 33, 45] 的通用特征提取器充当冻结的基础模型foundation model在大规模数据上预训练后将图像嵌入为特征表示这得益于其在数据和模型规模上的可扩展性。更广泛地说这种通用的 ViT 特征提取器可以适应预训练期间的各种监督方法不同的方法表现出特别适合不同下游任务的特征。具体来说监督方法——例如使用全监督分类标签或文本监督的图像-文本对例如 CLIP [27] 模型训练 ViTs——为开放词汇open-vocabulary任务生成密集特征并作为大型视觉语言模型LVLMs[20] 的视觉编码器。或者自监督方法 [1, 2, 25]特别是仅基于图像训练的 DINO [1] 模型展示了对象和部件发现的潜力使其适用于无监督分割任务 [31]。然而最近的研究揭示了 ViTs 在应用于需要密集特征的下游任务时令人费解的密集特征伪影。例如DINO [43] 证明了标签监督的 ViTs 存在注意力缺陷attention deficit[26]而 CLIPSelf [37] 观察到文本监督的 ViTs 无法产生在开放词汇任务中与文本线索精确对齐的密集图像特征。同时Regiser [5] 揭示了自监督的 ViTs 在注意力图中产生伪影通常被称为高范数标记high-norm tokens这对对象定位任务 [31] 产生不利影响。这些现象表明 ViTs 中存在一个共同的潜在问题只是在不同的监督范式下表现出不同的形式 [1, 14, 34]。在我们的初步探索中我们发现没有单一方法 [5, 36, 44] 能够全面解决这些现象。这个结果表明即使 ViTs 已经被研究了大约五年 [7]我们对它们的理解仍然不完整。鉴于许多问题可能源于一个共同的机制一个统一的解决方案是可取的。在本文中我们进行了一项基于第一性原理的研究——从头开始系统地定义、分析和解决 ViTs 中观察到的不同类型伪影。为了为这些在不同范式下的现象建立一个统一的定义我们引入了块得分Patch Score——块特征与 CLS 标记封装了图像的全局语义之间的相似度——从而评估相对于全局表示的局部语义一致性独立于训练范式。块得分背后的直觉是对于不同监督下的 ViT训练目标旨在将 CLS 特征与监督信号例如标签或文本对齐密集特征中的任何错位都会导致非前景区域的块得分升高如图 1 所示。为了定量评估块得分中的伪影我们提出了点入框Point-in-Box, PiB指标该指标评估得分最高的块是否位于标注的前景区域内。如图 1 和表 1 所示我们发现在不同的监督设置下ViTs 将更高的块得分分配给背景块并且与 ConvNets [11] 相比其 PiB 得分要低得多。详细的实验设置见第 4.1 节。为清晰简洁起见除非另有明确说明下文中术语“伪影”特指那些错误地产生高块得分的语义无关背景标记。基于块得分和 PiB我们对 ViT 的行为进行了深入分析并提出了一个旨在更好地解释这些伪影的假设自然图像本质上包含许多与主要对象无关的背景块。仅凭图像级监督模型缺乏空间指导因此倾向于通过背景证据懒惰聚合来编码全局语义。经验上在预训练的 ViT 中移除前 50% 得分最高的块对 ImageNet 准确率影响微乎其微图 2这证实了这种依赖性。全局依赖性允许 ViT 利用这些无关的背景块作为表示全局语义的捷径。在缺乏块级标注的情况下ViTs 可能在训练初期就采用懒惰聚合方式将少量前景语义扩散到背景中。表 1. 不同监督方法下的点入框PiB得分。我们发现 Register 减少了高范数标记但高范数并非伪影的根本原因。基于这种解释我们通过提出一个直接的解决方案来进一步验证我们的假设以消除这些伪影通过在预训练期间调节背景块的影响我们鼓励 ViTs 关注前景语义。具体来说模型学习估计每个标记的贡献第 5.1 节并选择性地将有信息的块特征整合到 CLS 标记中以增强前景表示。如图 5 所示当这些比例被适当增加时ViTs 会自动将注意力转移到前景对象上使高得分块与前景对齐。一旦这种懒惰聚合被缓解我们的方法——称为 LaSt-ViT (LazyStrike ViT)——就能消除所有监督类型下的块得分伪影。它有效地解决了高范数标记问题和特征错位问题。值得注意的是在应用我们的方法后ViTs 在不同的预训练范式下都表现出改进的涌现语义分割属性emergent semantic segmentation properties[43]。贡献.(1) 我们通过块得分和点入框PiB系统地分析了 ViTs 中伪影的根本原因揭示了一种早期出现并持续存在的背景主导偏差。(2) 我们提出了一个将粗粒度语义监督和全局依赖性与懒惰聚合联系起来的假设——这是一种捷径行为即 ViTs 依赖背景块来编码全局语义而不是关注真正的前景区域。(3) 我们提出了 LaSt-ViT一种简单的、频率感知的选择性聚合方案将 CLS 标记锚定到前景区域。(4) 我们在 12 个基准测试中展示了一致的性能提升包括对象发现、语义/实例分割和开放词汇检测。2. 相关工作文本监督 ViTCLIP 类型模型 [27]中的伪影。视觉-语言对比预训练 [18, 27] 的最新进展使得 CLIP 模型能够产生超越图像级分类的密集预测。MaskCLIP [44] 首次表明CLIP 特征可以通过像素-文本对齐实现零样本语义分割。然而后续研究 [10, 17, 19, 36, 37, 42] 发现尽管 ViTs 在模型容量和分类准确率上超越了 ResNets但在密集对齐任务上表现更差。为了缓解这种错位现有工作要么 (1) 修改最终的注意力层 [10, 17, 19, 36, 38, 42]要么 (2) 引入额外的对齐训练 [3, 37]要么 (3) 采用测试时激活编辑例如在推理期间将高范数异常激活动态移动到未经训练的寄存器标记中 [15]。相比之下我们的方法在预训练期间直接处理问题避免架构更改、事后微调和测试时干预从根本上防止文本监督 ViTs 中懒惰行为的出现。自监督 ViTDINO 类型模型 [1]中的伪影。Register [5] 发现 DINOv2 [25] 在单目深度估计和语义分割方面取得了成功但由于特征图上出现的伪影它失去了 DINO [1] 的对象检测能力。为了解决这个问题引入了额外的标记旨在存储全局特征并减轻这些伪影的影响。在我们对高范数现象的深入分析中我们发现高范数仅仅是后期懒惰行为的一种表现。简单地将高范数标记从特征图移动到寄存器标记并不能完全解决下游任务中的潜在缺陷。因此Vision Transformer 需要的不仅仅是 Registers。3. 预备知识3.1. 网络架构Vision Transformer4. 分析与假设我们引入了两个探针——块得分CLS-块相似度和点入框——来分析 ViTs 中伪影出现的位置和时间第 4.1 节。从空间和时间两个角度第 4.2 节我们发现高块得分集中在背景区域并且这种偏差从训练一开始就出现并持续存在。这些发现表明使用粗粒度语义监督图像级而非块级目标训练并配备强大全局依赖性长程注意力的 ViTs倾向于采用一种懒惰聚合捷径——将前景语义扩散到背景标记中。为了验证这个假设我们隔离了每个因素通过使用更大的块大小来减少背景标记第 4.3 节以及通过基于窗口的注意力来限制注意力范围第 4.4 节。两种干预措施都提高了点入框得分但略微降低了分类准确率表明减少全局依赖性有助于抑制背景偏差但以牺牲整体识别性能为代价。所有分析都在 ImageNet-1k [6, 34] 上进行在文本和自监督预训练 [1, 14, 28] 下也观察到了一致的趋势。进一步的观察——例如高范数标记 [5] 的作用和 DINO-v1 的独特行为——在附录中提供。4.1. 新指标块得分和点入框4.2. 块得分中的伪影问题CLS 标记“看”向哪里实验设置.我们研究了一个在 ImageNet-1k [6] 上训练的 ViT-B/16全监督。我们可视化了归一化的块得分分布并通过在重新评估之前直接在输入图像上屏蔽前 k 个或后 k 个块来进行探针实验。实验结果.实验结果显示在 ImageNet-1k 上的块得分分布和屏蔽探针。 (a) 前景与背景块得分的归一化分布。 (b) 移除前 k 个高得分块高达 70%不会损害准确率甚至可能提高准确率。分布.前景块集中在较低的块得分值而背景块主导了高得分的尾部图 2a。屏蔽探针.移除高得分块不会损害准确率——甚至可能略有提升例如ViT-B/16 提升了 1.2%——即使超过 50% 的块被屏蔽。相比之下移除低得分块会导致准确率急剧下降在 70% 屏蔽时下降高达 60%图 2b。结论在输入图像中屏蔽背景块几乎不影响分类性能然而这些区域显示出的特征响应与编码类别语义的 CLS 标记高度相关这表明前景信息在训练期间已被传播到背景中——这种行为很可能是由自然图像中背景标记相对于前景标记的主导地位驱动的如图 2b 所示超过一半的块对分类无贡献。问题这种现象何时开始实验设置.我们使用相同的超参数和批量大小在 ImageNet-1k [6] 上训练 ViT-B/16 [7] 和 ResNet50 [11]并在整个训练过程中跟踪 top-1 准确率和点入框得分。实验结果.实验结果显示点入框动态.ViT 的点入框得分反映了伪影水平越低表示背景偏差越强在训练过程中保持较低且几乎不变即使分类准确率在提高图 3。与 ResNet 比较.与 ResNet 相比ViT 始终表现出较低的点入框得分揭示了尽管图像级准确率相似但其背景偏差更为明显图 3。结论前景信息向背景的传播从训练一开始就发生。图 3. ImageNet-1k 上的训练动态。左top-1 准确率右点入框得分。随着训练的进行ViT 的分类准确率稳步提高但其点入框得分几乎保持平坦约 \(0.42 \rightarrow 0.44\) 并且在整个训练过程中始终低于 ResNet 的得分。即使在早期迭代中CLS 标记已经主要关注背景块而非前景区域并且这种偏差在整个训练过程中持续存在——产生准确的图像级预测但块级对齐效果较差。这种早期出现表明伪影不是后期阶段的副产品而是 ViT 训练中的内在现象。我们假设在训练开始时CLS 标记寻求最小化图像级损失的最简单路径迅速学习聚合与图像级标签相关的背景标记。结果图像级语义通过背景区域被“短路”导致分类准确率高但块级对齐差——这是模型懒惰聚合行为的标志。接下来我们假设这种行为源于两个相互作用的因素(1) 粗粒度语义监督其中图像级标签无法提供准确的块级监督以及 (2) 全局依赖性其中基于注意力的标记混合允许背景标记吸收前景信息。第 4.3 节和第 4.4 节进一步分离并量化了每个因素的贡献。4.3. 粗粒度语义监督验证实验设置.为了评估粗粒度语义监督的影响我们通过增加嵌入模块 Pemb(⋅) 中使用的块大小来减少背景标记的普遍性。随着块大小的增加生成的标记更少许多小的背景区域被合并到更大的块中从而降低了背景标记的相对比例。具体来说我们在 ImageNet-1k [6] 上使用 28×28 的块大小默认16×16训练 ViT-Base这使背景标记的比例减少了约 10%详见附录。验证实验结果.如图 4 所示增大块大小后点入框从 0.44 增加到 0.52这使背景标记的比例减少了约 10%。块得分图显示高得分区域从背景转向对象区域。然而top-1 准确率从 62% 下降到 55%揭示了分类和定位准确率之间的权衡。图 4. 粗粒度语义监督的影响。增加块大小使背景标记减少 (10%)。效果点入框从 0.44 上升到 0.52高得分块向前景转移。权衡分类准确率下降表明粗粒度语义监督导致了伪影而简单的块粗化损害了识别能力。4.4. ViT 全局依赖性导致的懒惰行为验证实验设置.我们进一步检验 ViT 的全局注意力是否通过允许前景语义传播到背景区域而加剧了懒惰聚合行为。为了逐步限制长程依赖性我们在不同层将全局自注意力替换为基于窗口的注意力 [21]。表 2. 在 ViT-Small 上的窗口注意力消融实验。限制全局依赖性会提高点入框但会降低 top-1 准确率。这表明不受限制的全局注意力放大了懒惰行为因为粗粒度语义监督允许背景标记吸收扩散的语义。验证实验结果.如表 2 所示随着全局注意力的限制点入框得分增加当所有层都采用窗口注意力时达到最高值。然而准确率相应下降这表明虽然全局上下文有利于分类但它也促进了语义向背景块的扩散。结论当视觉变换器在粗粒度语义监督下训练并配备不受限制的全局依赖性时它们倾向于追求最简单的优化路径——将前景语义扩散到大量的背景标记中。这种捷径产生了较高的图像级准确率但导致表示被背景信息主导表明优化全局分类目标可能会损害 ViTs 中的块级语义一致性。5. 方法概述与原理.为了缓解懒惰聚合我们将 CLS 标记聚合重新表述为一个频率感知过程以区分前景块和背景块。在自然图像中前景信号具有更同质的语义意义导致深层特征图中沿通道维度的变化较小而背景通常具有更高的语义多样性因此选择在通道维度上经过低通滤波后保持稳定的标记有可能将 CLS 标记锚定到前景区域。5.1. LaSt-ViT图 5. LaSt-ViT 中的 CLS 标记“看”向哪里对于每张图像投票数分别超过图像内最大投票数的 50%、30% 或 20% 的块从左到右以红色可视化。应用 LaSt-ViT 后高投票块始终对应于前景区域表明 CLS 标记主要聚合前景标记而非背景标记。投票计数.我们将标记块i 的投票计数定义为5.2. 迁移到下游任务在本节中我们提供更多细节并解释每个下游任务的执行方式。无监督对象发现.由于 LazyStrike 引导 CLS 标记关注前景对象我们可以使用块得分实现无监督对象定位。这种扩展独立于训练方法——这通常是早期工作中像 DINO 这样的自监督方法的特权——允许任何训练目标来完成此任务。我们通过应用一个定义为均值得分加一个标准差的阈值来构建掩码。得分高于此阈值的块被分类为前景。[92, 788, 481, 899], [516, 494, 904, 525]零样本开放词汇任务.由于 LazyStrike 确保 CLS 特征从正确的块特征聚合信息并且 CLS 特征本身直接受到学习信号的监督这有效地导致了块特征与监督信号之间的隐式对齐。对于文本监督的 ViTs我们可以通过计算块特征与任意文本特征之间的相似度来获得零样本语义分割结果从而在各种开放词汇任务中实现应用。表 3. LazyStrike 在点入框得分上的评估。6. 实验6.1. 实验设置我们首先验证了块得分中伪影的消除第 6.2 节并在三种训练方法上验证了我们提出的方法全监督第 6.3 节、文本监督第 6.4 节和自监督第 6.5 节并检验了不同监督下 ViT 的多个下游任务包括对象发现 [1, 31]、零样本语义分割 [27, 32, 39]、开放词汇对象检测 [16, 30]、实例分割 [29, 37] 和粗分割 [1]。6.2. 伪影消除特征范数和块得分中伪影的消除.表 3 展示了不同训练方法下的结果表明 LazyStrike 不仅消除了高范数现象还提高了点入框得分。应用 LazyStrike 后ViT 的点入框得分接近 ResNet [11]。图 6 提供了全监督训练 [34] 下特征范数的详细分析显示 LazyStrike 降低了最大特征值从而缓解了高范数现象。6.3. 全监督比较粗分割的出现.遵循 [1]我们在 VOC12 的验证集上评估涌现属性emerging properties这种现象以前只出现在自监督训练中。如表 6 所示我们的方法在不同模型大小和训练方法上持续改进了涌现属性。值得注意的是我们的方法在监督设置下取得了接近 DINO 的性能41.9% 对比 47.7%表明 LazyStrike 促进了涌现属性的出现并且这些属性并非自监督独有。表 4. 在六个语义分割基准上的评估结果mIoU, %%。我们的结果以灰色标记。LazyStrike 在不同类型的 CLIP [27] 和模型大小下持续改进了文本监督下的语义分割结果表明在理解了问题的本质后一个简单的方法可以统一解决不同模型的问题。表 5. 开放词汇基准上的评估结果。我们的结果以灰色标记。LazyStrike 持续提升了开放词汇密集任务的性能表明冻结的 ViT 可以达到与 ConvNet [11] 相当的性能。PCA 的出现.如图 7 所示我们计算了 LaSt-ViT 块特征的 PCA并可视化了前景的前三个分量。LazyStrike 细化了先前纠缠的 PCA 特征有效地区分并突出了显著的前景。6.4. 弱监督比较零样本语义分割基准.表 4 展示了我们提出的方法在六个语义分割基准上与几个基线模型的对比。通过将我们的修改集成到这些模型中获得的改进以蓝色突出显示。我们的方法在所有评估基准上始终优于基线模型显示出显著的提升。例如当应用于具有 ViT-B/16 架构的 CLIP [27] 模型时我们的方法在 Pascal从 11.2% 到 15.2%、Cityscapes从 6.5% 到 12.1%和 VOC从 49.0%到 75.0%上实现了 mIoU 的大幅提升。当扩展到更大的 ViT-L 架构时我们的方法继续提供显著的结果。对于 CLIP 模型VOC 上的 mIoU 从 17.1% 跃升至令人印象深刻的 72.4%表 7. 对象发现 CorLoc。所有模型都采用 ViT-S。以前性能最佳的方法依赖于特征向量计算而 LazyStrike 避免了这种沉重的计算需求。图 7. PCA 分量的可视化。我们计算块特征的 PCA并可视化前景对象的前 3 个分量。使用 LazyStrike标签监督下的 ViT 也能区分前景和背景并分离对象部件增强了特征表示。Cityscapes 上从 2.7% 增加到 12.3%。总之将我们的方法集成到基线模型中在所有基准测试中均带来了显著改进证明了其在不同 CLIP 模型和不同规模模型上的鲁棒性和有效性。开放词汇对象检测和分割基准.如表 5 所示我们选择 F-VLM [16] 和 F-ViT [37] 作为基线。两种方法都使用冻结的 CLIP [32] 作为对象检测和实例分割的骨干网络。在获取感兴趣区域后它们对相应区域的语义得分进行加权以确定对象类别得分。唯一的区别是 F-VLM 使用基于 ConvNet 的骨干网络而 F-ViT 采用基于 ViT 的骨干网络。对于 OV-COCOLaSt-ViT 在 ViT-B 和 ViT-L 的新颖类别上分别比基线提高了 15.8% 和 14.4%。对于 OV-LVIS它在 ViT-B 和 ViT-L 的稀有类别上也分别比基线提高了 11.3% 和 6.6%。6.5. 自监督比较无监督对象发现.我们采用 DINO-seg [1] 和 LOST [31] 作为基线进行比较两者都利用 ViT-S [7] 作为对象发现任务的骨干网络。比较结果见表 7。LaSt-ViT 表现出显著的性能改进。具体来说我们的模型在所有数据集上都取得了最高的 CorLoc 得分超过了 DINO-seg 和 LOST 模型。值得注意的是我们的模型在 VOC 2007 上达到了 64.4% 的 CorLoc 得分在 VOC 2012 上达到了 67.6%在 COCO 上达到了 51.6%分别比性能最佳的 LOST 模型提高了 2.7%、3.6% 和 0.9%。此外我们的方法展示了每秒 55.9 张图像的惊人吞吐量。这表明我们的模型实现了优越的对象发现性能并且运行效率更高使其非常适合实际应用。6.6. 消融研究缓解伪影的其他方法.在表 8 中我们还报告了使用 Maxpool 的结果它自然地减少了背景激活并作为评估伪影缓解的强有力参考。虽然 Maxpool 带来了适度的改进但我们的方法在分类和分割任务上都实现了显著更高的性能表明改进源于更有效的语义聚合而非池化引起的副作用。截断标记的数量.在表 8 中我们通过使用不同数量的 KK 训练 OpenCLIP [14] ViT-B/16 来研究 Top-KK 的影响。使用 LazyStrike 后性能显著提高当选择一半标记时达到峰值。表 9 显示了在标签监督的 ViT-B/32 上进一步的消融研究该模型在 ImageNet-1k 上预训练并报告了分类性能和 CorLoc 结果。7. 结论我们揭示了 Vision Transformers 通常采用一种懒惰聚合行为——由于背景块相对于前景区域具有压倒性的数量优势它们依赖大量的背景块来编码全局语义。为了应对这个问题我们提出了 LaSt-ViT一种频率引导的选择性聚合方法它将 CLS 标记集中在稳定的、与前景相关的特征上。我们的方法有效地消除了各种监督类型下的伪影并在 12 个基准测试中取得了一致的改进为理解 ViT 的内部行为提供了一个更清晰的视角并为未来的研究奠定了坚实的基础。