川大硕士团队新作:V²Drop 重构大模型 Token 压缩路径

川大硕士团队新作:V²Drop 重构大模型 Token 压缩路径 来源机器之心 本文约2000字建议阅读5分钟 本文介绍川大团队提出 V²Drop优化大视觉语言模型推理效率与性能。论文题目Variation-aware Vision Token Dropping for Faster Large Vision-Language Models论文链接https://arxiv.org/abs/2509.01552代码链接https://github.com/xuyang-liu16/V2Drop作者介绍第一作者陈骏杰四川大学硕士二年级与共同一作刘旭洋四川大学硕士三年级深耕高效视觉语言模型。背景与动机随着高分辨率图像理解与长视频处理需求的爆发式增长大型视觉语言模型LVLMs所需处理的视觉 Token 数量急剧膨胀推理效率成为落地部署的核心瓶颈。Token 压缩是缩短序列、提升吞吐的直接手段但现有方法普遍依赖注意力权重来判断 Token 重要性这一路线暗藏两个致命缺陷一是位置偏差问题如图 1 所示该方法倾向于机械地保留序列末尾的 Token无论图像内容如何注意力得分普遍在序列末尾对应图像底部区域形成峰值红色箭头导致关键的前期 Token 被丢弃进而加剧多模态幻觉。二是与高效算子存在根本性的不兼容计算注意力权重与 FlashAttention 等高效机制之间存在本质冲突。相比之下右侧三列绿色边框展示了基于 L2 Norm 变化量评估方法的显著优势 —— 其得分分布均匀、能够精准聚焦于含有关键信息的图像区域如绿色框标注的球衣号码区域且无需显式注意力计算与高效算子天然兼容。图 1注意力引导 vs. 变化量感知的 Token 评估对比核心发现发现 1注意力方法存在系统性末端偏置研究团队在 LLaVA-1.5-7B 和 Qwen2-VL-7B 上对比了 SparseVLM、FastV 与 L2 Norm 变化量评估在相同输入下的 Token 保留行为。注意力方法的保留概率曲线均呈单调递增阶梯形状 —— 末端 Token 保留率高达 80%100%前端仅 10%30%与内容重要性毫无关联。L2 Norm 则呈近似均匀分布天然规避位置偏差。图 2两大模型上视觉 Token 保留位置分布分析 ——L2 Norm 呈现均匀分布注意力方法呈严重末端偏置发现 2变化量高的 Token 天然对应语义关键区域针对两个典型样本百事可乐瓶识别、球衣号码识别L1 Norm、L2 Norm 和余弦相似度三种指标均在答案相关区域出现显著峰值且无论关键区域位于序列中段还是后段均能精准捕捉表明变化量是衡量视觉 Token 重要性的鲁棒内在属性L2 Norm 综合性能最优被 V²Drop 选为默认度量。图 3三种变化量度量指标均精准定位答案相关区域红框验证变化量与语义重要性的强相关性解决方案V²DropV²Drop 在 LLM 推理阶段采用多阶段渐进式剪枝策略三步实现高效无偏 Token 压缩① 变化量计算Variation Computation在每个预定义剪枝层计算每个视觉 Token 与上一层表示的 L2 距离作为重要性得分。额外开销仅为单层注意力计算量的 0.022%可忽略不计。② Token 排序与选择Token Ranking Selection按变化量得分从高到低排序保留 Top-K 个 Token自然过滤惰性 Token无需引入任何位置偏置。③ 渐进式压缩Progressive Dropping在浅层、中层、深层三阶段依次执行剪枝形成 M → Ka → Kb → Kc 渐进压缩路径。消融实验证明渐进式剪枝比一次性剪枝在 POPE 上高 9.3%、MME 上高 5.9%。图 4V²Drop 整体框架理论保证通过一阶 Taylor 展开证明Token 的变化量幅度与其对模型输出的影响正相关从理论上验证了丢弃低变化量 Token 能最小化输出扰动的核心假设。架构的三大属性残差连接、Layer Norm、平滑激活函数共同保证了理论假设的合理性。实验结果1、图像理解LLaVA-1.5-7B Qwen2-VL-7B在图像场景的核心表现上本方法在 LLaVA-1.5-7B 上压缩 66.7% Token保留 192 个时综合性能达 97.6%超越次优方法 PDrop96.0%。此外在 Qwen2-VL-7B 高分辨率场景中66.7% 和 77.8% 两档压缩率下均全面超越 FastV 和 DART尤其在 POPE 幻觉抑制指标上表现突出充分验证了本方法对原生可变分辨率输入的强泛化能力。表 1基于 LLaVA-1.5-7B 的多图像理解基准测试对比表 2基于 Qwen2-VL-7B 的多图像理解基准测试对比2、视频理解LLaVA-OV-7B Qwen2-VL-7B在视频场景中本方法同样表现卓越仅保留 25% 的 Token 时综合性能即达 98.6%超越保留 30% Token 的 DyCoke97.7%以更少 Token 实现更优性能在长视频任务VideoMME-Long上持续领跑有效缓解了 VideoLLM 普遍存在的末帧偏置问题在 Qwen2-VL-7B 场景下仅保留 20% Token 时综合性能达 93.3%其中 MVBench 以 62.1 分大幅领先 DART58.9和 FastV50.9优势尤为突出。表 3基于 Qwen2-VL-7B 的多视频理解基准测试性能对比表 4基于 LLaVA-OV-7B 的多视频理解基准测试性能对比3、效率分析与高效算子完全兼容在效率层面本方法同样带来显著收益图文理解任务LLaVA-1.5-7B中LLM 生成延迟降低 31.5%吞吐量提升至 9.01 items/s↑1.26×峰值显存同步下降 3.3%视频理解任务LLaVA-OV-7B中LLM 生成延迟大幅削减 74.2%吞吐量提升 1.38×峰值显存降低 7.8%。与之形成鲜明对比的是SparseVLM、FastV、PDrop 在视频场景下峰值显存分别暴增 54.8%、39.2% 和 37.8%而本方法无需计算注意力矩阵真正实现了加速与节存的双重收益。表 5图像 / 视频理解任务的效率对比结论V²Drop 为视觉语言模型的推理加速开辟了一条全新路径。研究发现视觉 Token 在 LLM 各层间的变化量与其任务相关性高度吻合且这一规律与具体任务无关task-agnostic。基于这一洞察V²Drop 以变化量为核心评估信号构建了一套轻量、渐进、与高效算子完全兼容的 Token 压缩框架 —— 无需修改模型权重无需访问注意力矩阵即插即用。在图像与视频理解两条赛道上均实现当前最优性能 - 效率权衡。编辑于腾凯校对刘红利关于我们数据派THU作为数据科学类公众号背靠清华大学大数据研究中心分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识努力建设数据人才聚集平台、打造中国大数据最强集团军。新浪微博数据派THU微信视频号数据派THU今日头条数据派THU