---
title: "2604.09349"
title_zh: "视觉引导的策略优化用于多模态推理"
arxiv_id: "2604.09349"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.09349.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 视觉引导的策略优化用于多模态推理

## 一句话定位

提出 VGPO 框架，通过内在隐藏状态相似性定位视觉激活，并结合双粒度优势重加权策略缓解时序视觉遗忘，提升多模态推理的视觉忠实度。

## 小学生也能听懂

这篇论文像给AI装了个“视觉提醒器”，发现它做数学题看图时会慢慢忘记图像，于是用隐藏状态算出每步对图的关注分，后期自动加强看图，让AI更准地结合图文推理。

## 为什么值得记录

- 揭示了 VLM 在推理过程中存在文本主导和视觉激活稀疏的问题，尤其发现‘时序视觉遗忘’现象：随着推理步数增加，对图像 token 的注意力持续衰减。
- 提出无需外部监督或辅助模型的 Visual Focus Score，利用生成 token 与图像原型之间的隐藏状态余弦相似度精准定位视觉相关 token。
- 设计 Visual Attention Compensation 机制，在后期推理步骤中线性提升视觉期望，有效对抗视觉遗忘。
- 在数学和视觉依赖型多模态推理任务上取得 SOTA 性能，7B 模型表现媲美 72B 模型，验证方法的高效性与可扩展性。

## 核心方法

- Visual Focus Score：基于输入图像 token 的隐藏状态构建视觉原型 μ_v，计算当前生成 token 隐藏状态 h_{i,t} 与 μ_v 的余弦相似度，经缩放得到 [0,1] 区间的视觉聚焦分数 ρ_{i,t}。
- Visual Attention Compensation：引入补偿权重 w_{i,t} = ρ_{i,t} · [1 + G_i(ρ_{i,t}) · β · t/T_i]，其中 G_i(·) 为视觉门控函数，仅在轨迹尾部且 ρ_{i,t} 高于 κ-分位数时激活，β 控制补偿强度，实现后期逐步增强视觉信号。
- Intra-trajectory Re-weighting：对每条轨迹内的 w_{i,t} 进行 Min-Max 归一化并零中心化，得到 ψ_{i,t}，用于放大高视觉激活 token 的优势。
- Inter-trajectory Re-weighting：计算每条轨迹的累计视觉得分 s_i = Σ w_{i,t}，在 rollout 组内归一化并零中心化得到 ϕ_i，优先选择整体视觉 grounding 更强的轨迹。
- Dual-grained Advantage Integration：将标准优势 Â_i 与视觉因子结合，得到最终视觉感知优势 Â_{i,t}^V = Â_i · (1 + ψ_{i,t}) · (1 + ϕ_i)，嵌入 GRPO 框架进行策略优化。

## 关键结果

- 在 Qwen2.5-VL-7B 上，VGPO 相比 DAPO 基线在通用数学推理（Avg-Math）上相对提升 33.2%，在视觉依赖任务（Avg-Vision）上提升 30.0%。
- 在 MathVista、MMK12、LogicVista、Counting 等 12 个基准测试中，VGPO 平均准确率达 66.6%（数学）和 63.3%（视觉），均优于所有 7B 级基线模型。
- 训练动态显示 VGPO 具有更高训练奖励和更稳定的验证准确率，尤其在 32B 模型上显著降低优化方差。
- 消融实验表明，Intra- 和 Inter-trajectory 重加权策略协同作用，缺一不可；线性补偿策略优于阶跃或指数形式。
- 在弱视觉编码器（Qwen2-VL-2B）上仍取得显著相对增益（+11.1% Math, +16.2% Vision），证明方法鲁棒性。

## 局限与风险

- Visual Focus Score 依赖模型自身的隐藏状态质量，若底层视觉编码器存在感知错误（如误识模糊数字），VGPO 可能强化错误视觉 grounding，导致自信的错误答案。
- 高视觉激活是正确推理的必要非充分条件：模型仍需具备正确的领域知识和逻辑推理能力，否则即使‘看准了’也可能因误用定理而出错。
- 未在真实世界噪声数据或跨域泛化场景下充分验证，对遮挡、低分辨率等极端视觉条件的鲁棒性有待进一步研究。

## 适合沉淀的概念

`visual-faithfulness`, `temporal-visual-forgetting`, `visual-focus-score`, `hidden-state-similarity`, `visual-attention-compensation`, `dual-grained-advantage-reweighting`, `intra-trajectory-reweighting`, `inter-trajectory-reweighting`, `policy-optimization`, `multimodal-reasoning`

## 阅读注意

- 重点关注 Figure 2 中的经验分析：文本主导推理、视觉激活稀疏及时序视觉遗忘的量化证据。
- 理解 Visual Focus Score 如何仅用 hidden_states 替代 attention weights，兼顾效率与精度（见 Appendix C）。
- 注意 Late-trajectory Compensation 的设计动机：避免 Full-trajectory 补偿过度强调早期视觉而加剧遗忘（Table 6 和 Table 12）。
- Appendix E 的失败案例分析至关重要：区分‘看错’（感知错误）与‘看懂但推错’（逻辑错误）两种错误类型。
- 对比 VGPO 与 PAPO/VPPO 等方法：VGPO 无需额外前向传播或辅助模型，完全基于内部状态实现视觉引导。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.09349.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论框架、详尽的实验验证（包括消融、鲁棒性、训练动态）、失败案例分析及代码链接，材料充分且自洽。
