小红书 dots 团队提出 Vision-OPD,让多模态大模型“看清细节”!

小红书 dots 团队提出 Vision-OPD,让多模态大模型“看清细节”! 小红书 dots团队提出了Vision-OPDVision On-Policy Distillation。仅用约 6.2K 条全自动合成数据便让 9B 模型在多个细粒度视觉理解基准上取得 SOTA超越 Gemini-3.5-Flash、Gemini-3.1-Pro 和 GPT-5.4 等顶尖闭源模型。多模态大模型Multimodal LLM如今在通用看图说话上已经相当能打但只要问题的答案藏在图里一小块决定性的细节上它们就常常给出一个错误的回答。举个例子“图中人物戴的护耳是什么颜色”这道题人盯着完整大图也未必能一眼答对——那块护耳藏在画面的一小块区域不凑近看根本分辨不清颜色。当下顶尖的多模态大模型同样频频翻车给它完整大图它信誓旦旦答“黑色”而正确答案其实是“绿色”。为突破这一瓶颈小红书 dots团队提出了Vision-OPDVision On-Policy Distillation。仅用约6.2K条全自动合成数据便让 9B 模型在多个细粒度视觉理解基准上取得SOTA超越 Gemini-3.5-Flash、Gemini-3.1-Pro 和 GPT-5.4 等顶尖闭源模型。论文标题Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation论文链接[2605.18740] Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation代码链接GitHub - VisionOPD/Vision-OPD: Vision-OPD is a regional-to-global on-policy self-distillation framework that transfers a models own privileged crop-conditioned perception to its full-image policy, enabling fine-grained visual understanding in a single forward pass without external teachers, labels, or verifiers. · GitHub在V* Bench、ZoomBench、HR-Bench 4K、HR-Bench 8K、MME-RealWorld-EN、MME-RealWorld-CN 六个细粒度视觉理解基准上的平均准确率%。Vision-OPD-9B 以 79.7 总体第一Vision-OPD-4B 也达 77.1。01、动机区域到全局鸿沟模型为什么会在这种细节题上翻车有一个有意思的现象同一个模型看裁剪放大后的局部图回答细粒度问题的准确率明显高于看完整大图。这道坎叫作「区域到全局鸿沟」。还是以前面那道题为例基于 Qwen3.5-9B给完整大图模型被全局场景带偏答“黑色”——错只给裁剪放大后的关键区域决定性证据被凸显出来模型答“绿色”——对。这并不是个例。系统评测显示区域输入的准确率持续高于全局输入约 18~22 个百分点即便是体量大得多的开源模型和闭源模型GLM-4.6V、GPT-5.4、Gemini-3.1-Pro也都表现出同样显著的差距。这说明一个关键事实单纯堆参数规模并不能弥合这道鸿沟。模型的细粒度瓶颈往往不在“认不认得出”而在“盯不盯得住”。那要怎么弥合这道鸿沟最近流行的Thinking-with-Images边想边看方法给模型配上裁剪、放大的视觉工具让它在推理时主动去抠局部确实有效——但代价是反复编码图像、反复调用模型推理开销大幅增加。于是问题来了能不能把“放大关键区域、让证据从背景里凸显出来”这个好处通过训练直接内化进模型让它一次前向就能从整图里用上细粒度证据而不必在推理时动用任何工具02、Vision-OPD让模型当自己的教师既然模型看局部一向比看全局强那么它看裁剪图时的表现就是一份现成的、可以拿来提升全图表现的特权监督信号——用前者去教后者把“放大”的收益内化成单次前向的能力。由此团队提出Vision-OPD一个面向细粒度视觉理解的区域到全局在线自蒸馏框架。2.1 训练框架它的精髓在于从同一个模型里派生出两个“视角不同”的策略裁剪教师Teacher只看那块对准了关键证据的裁剪放大图这是它的特权视角全图学生Student看完整大图。学生先在全图上自己生成回答轨迹在线采样对学生写下的每一段前缀Vision-OPD 分别算出裁剪教师和全图学生的 logits 分布再把两者的散度压到最小。这样一来模型就在学生自己的生成轨迹上把教师的裁剪特权行为迁移给了全图策略——不用外部教师、不用真值标签、不用奖励验证器、推理时也不用任何工具。这套“在线采样 token 级蒸馏”的组合好处有两层在线采样训练前缀就是学生自己写出来的序列训练和推理的状态分布对得上避开了传统离线蒸馏里“前缀对不上、误差越滚越大”的毛病稠密 token 级监督每个 token 都拿到有意义的梯度不像 GRPO 这类强化学习只有稀疏的序列级奖励哪怕一批采样样本恰好全对或全错训练也不会停摆。2.2 数据合成数据从哪来团队用一条全自动流水线从无标注图像里造出三元组 (全图、裁剪图、问题)总共合成约6.2K条对原图做物体识别和分割挑出面积占比很小最可能藏着细粒度证据的区域让模型给每个区域生成一个“光看这块就能答”的问题把区域的边界框叠回原图再加一句空间约束比如“只关注红框里的物体”得到学生输入把这块区域裁剪、放大2×得到教师输入。因为裁剪图是从无标注图像里全自动抽出来的这套方法能适配任意图像语料。03、实验结果Vision-OPD-9B拿下总体第一3.1 与 SOTA 模型对比团队把 Vision-OPD 用在Qwen3.5-4B/9B上在V* Bench、ZoomBench、HR-Bench 4K/8K、MME-RealWorld(EN/CN)等细粒度视觉理解基准上评测。Vision-OPD-9B 拿下 79.68 的平均分在所有对比模型中总体第一• 超过闭源的Gemini-3.5-Flash、Gemini-3.1-Pro• 超过体量大得多的开源模型比如Qwen3.5-397B• 也超过各类Thinking-with-Images智能体模型而 Vision-OPD 只需对图片做一次前向。Vision-OPD-4B 的平均分也有 77.07超过GPT-5.4、Kimi-K2.6说明 Vision-OPD 确实能把细粒度视觉理解的本事有效地“装”进现有模型里。3.2 专精却不偏科更难得的是它专精却不偏科。在非细粒度的视觉任务MMVP、CV-Bench、MMStar、POPE上它保持了原模型的看图与推理能力没有出现专项微调常见的“学了新的、忘了旧的”。3.3 鸿沟在训练中逐渐收敛那么 Vision-OPD 究竟有没有真的缩小这道 「区域到全局鸿沟」训练曲线给出了直接的证据随着训练进行模型的区域到全局鸿沟逐渐缩小。这正印证了 Vision-OPD 让模型学会了直接从全图里识别出“裁剪才看得到”的证据把放大聚焦的本事内化进了一次前向。04、结语Vision-OPD 背后的洞见很简单大模型的细粒度瓶颈往往不在“认不认得出”而在“盯不盯得住”而模型自己在裁剪条件下的特权感知恰好可以拿来监督它的全图行为。它从同一个模型派生出裁剪教师和全图学生在学生的在线采样轨迹上做 token 级自蒸馏不用更强的外部教师、不用真值标签、不用奖励验证器推理时也不用任何工具。仅凭约 6.2K 条全自动合成数据就让一个 9B 模型在多个细粒度视觉理解基准上超过了闭源模型、更大的开源模型以及 Thinking-with-Images 智能体模型同时不丢通用能力。它提供了一条可复现、低成本的细粒度视觉理解训练路径让多模态大模型从“看个大概”走向“看清细节”。