---
title: "2604.01840"
title_zh: "并非所有 token 视觉贡献均等：面向大视觉-语言模型的感知 grounding 策略优化"
arxiv_id: "2604.01840"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.01840.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 并非所有 token 视觉贡献均等：面向大视觉-语言模型的感知 grounding 策略优化

## 一句话定位

提出 Token Visual Dependency 概念，并设计 PGPO 方法，在强化学习中实现 token 级别的视觉依赖感知优势重分配，提升多模态推理性能。

## 小学生也能听懂

这篇论文发现大模型做视觉题时，不是每个词都同样需要看图，于是发明了一种新方法，能自动识别哪些词更依赖图像，并重点加强这些词的学习，让模型更会看图答题，成绩平均提高了近19%。

## 为什么值得记录

- 揭示了现有 RLVR 方法在多模态推理中的根本缺陷：均匀分配优势会稀释关键视觉 grounding 步骤的学习信号。
- 首次形式化定义了 Token Visual Dependency，通过 KL 散度量化每个 token 对视觉输入的因果依赖程度。
- 提出的 PGPO 框架在 7 个多模态推理 benchmark 上平均提升 18.7%，显著优于 GRPO、DAPO、VPPO 等基线。
- 理论分析与实验证明 PGPO 能有效降低梯度方差、防止训练崩溃，并作为隐式正则化器增强模型对视觉证据的依赖。

## 核心方法

- 定义 Token Visual Dependency：使用 KL 散度衡量有/无视觉条件下模型预测分布的差异，量化每个 token 的视觉信息增益。
- 构建 Token Visual Dependency Score：对原始 KL 值进行对数压缩和序列内 min-max 归一化，得到 [0,1] 区间的有界分数 I_t。
- 设计阈值门控优势重塑机制：根据 I_t 动态调整每个 token 的优势权重，低依赖 token 被抑制，高依赖 token 被增强。
- 引入质量守恒归一化：确保重分配后的总优势质量与原始 GRPO 一致，维持训练稳定性。
- 将重塑后的 token 级优势 A~_i,t 代入 GRPO 目标函数，实现细粒度策略优化。

## 关键结果

- 在 Qwen2.5-VL-7B 上，PGPO 平均准确率达 54.70%，超越 VPPO (54.08%) 和 DAPO (52.69%)。
- 在 Qwen2.5-VL-3B 上，PGPO 平均准确率达 46.00%，相比基线 DAPO (43.84%) 提升 2.16 点。
- 在 Geo3k、MathVerse_V 等强视觉依赖任务上提升尤为显著，证明其对空间推理的有效性。
- 训练曲线显示 PGPO 收敛更快，且避免了 DAPO 后期出现的训练崩溃问题。
- 生成 token 的平均视觉依赖度 (~S_t) 随训练持续提升，表明模型真正增强了视觉感知能力。

## 局限与风险

- 需额外一次前向传播计算无视觉条件下的分布，带来约 10.6% 的训练时间开销。
- 依赖阈值 τ 和增强系数 β 等超参，需调优以平衡噪声抑制与信号增强。
- 目前仅在 Qwen2.5-VL 系列模型上验证，其他 LVLM 架构的泛化性待进一步检验。

## 适合沉淀的概念

`token-visual-dependency`, `perception-grounded-policy-optimization`, `reinforcement-learning-with-verifiable-rewards`, `credit-assignment`, `multimodal-reasoning`, `advantage-reshaping`, `kl-divergence-visual-grounding`

## 阅读注意

- 重点关注第 3 节对 Token Visual Dependency 的实证分析，其稀疏分布特性是 PGPO 设计动机。
- 注意图 3 的 PGPO 框架概览，理解从 S_t 到最终 A~_i,t 的完整变换流程。
- 表 2 的消融实验揭示了抑制噪声 token 比单纯增强关键 token 更重要。
- 附录 G 和 H 提供了严格的数学证明，说明权重映射的单调性和保序性。
- 案例研究（附录 L）直观展示了 PGPO 如何纠正基线模型在视觉理解上的关键错误。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.01840.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的理论推导、详尽的实验设置、多维度结果分析和消融研究，材料充分且自洽。
