论文
arXiv2604.01840
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级115 分钟

2604.01840

论文导读

提出 Token Visual Dependency 概念,并设计 PGPO 方法,在强化学习中实现 token 级别的视觉依赖感知优势重分配,提升多模态推理性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

并非所有 token 视觉贡献均等:面向大视觉-语言模型的感知 grounding 策略优化

一句话定位

提出 Token Visual Dependency 概念,并设计 PGPO 方法,在强化学习中实现 token 级别的视觉依赖感知优势重分配,提升多模态推理性能。

小学生也能听懂

这篇论文发现大模型做视觉题时,不是每个词都同样需要看图,于是发明了一种新方法,能自动识别哪些词更依赖图像,并重点加强这些词的学习,让模型更会看图答题,成绩平均提高了近19%。

为什么值得记录

  • 揭示了现有 RLVR 方法在多模态推理中的根本缺陷:均匀分配优势会稀释关键视觉 grounding 步骤的学习信号。
  • 首次形式化定义了 Token Visual Dependency,通过 KL 散度量化每个 token 对视觉输入的因果依赖程度。
  • 提出的 PGPO 框架在 7 个多模态推理 benchmark 上平均提升 18.7%,显著优于 GRPO、DAPO、VPPO 等基线。
  • 理论分析与实验证明 PGPO 能有效降低梯度方差、防止训练崩溃,并作为隐式正则化器增强模型对视觉证据的依赖。

核心方法

  • 定义 Token Visual Dependency:使用 KL 散度衡量有/无视觉条件下模型预测分布的差异,量化每个 token 的视觉信息增益。
  • 构建 Token Visual Dependency Score:对原始 KL 值进行对数压缩和序列内 min-max 归一化,得到 [0,1] 区间的有界分数 I_t。
  • 设计阈值门控优势重塑机制:根据 I_t 动态调整每个 token 的优势权重,低依赖 token 被抑制,高依赖 token 被增强。
  • 引入质量守恒归一化:确保重分配后的总优势质量与原始 GRPO 一致,维持训练稳定性。
  • 将重塑后的 token 级优势 A~_i,t 代入 GRPO 目标函数,实现细粒度策略优化。

关键结果

  • 在 Qwen2.5-VL-7B 上,PGPO 平均准确率达 54.70%,超越 VPPO (54.08%) 和 DAPO (52.69%)。
  • 在 Qwen2.5-VL-3B 上,PGPO 平均准确率达 46.00%,相比基线 DAPO (43.84%) 提升 2.16 点。
  • 在 Geo3k、MathVerse_V 等强视觉依赖任务上提升尤为显著,证明其对空间推理的有效性。
  • 训练曲线显示 PGPO 收敛更快,且避免了 DAPO 后期出现的训练崩溃问题。
  • 生成 token 的平均视觉依赖度 (~S_t) 随训练持续提升,表明模型真正增强了视觉感知能力。

局限与风险

  • 需额外一次前向传播计算无视觉条件下的分布,带来约 10.6% 的训练时间开销。
  • 依赖阈值 τ 和增强系数 β 等超参,需调优以平衡噪声抑制与信号增强。
  • 目前仅在 Qwen2.5-VL 系列模型上验证,其他 LVLM 架构的泛化性待进一步检验。

适合沉淀的概念

token-visual-dependency, perception-grounded-policy-optimization, reinforcement-learning-with-verifiable-rewards, credit-assignment, multimodal-reasoning, advantage-reshaping, kl-divergence-visual-grounding

阅读注意

  • 重点关注第 3 节对 Token Visual Dependency 的实证分析,其稀疏分布特性是 PGPO 设计动机。
  • 注意图 3 的 PGPO 框架概览,理解从 S_t 到最终 A~_i,t 的完整变换流程。
  • 表 2 的消融实验揭示了抑制噪声 token 比单纯增强关键 token 更重要。
  • 附录 G 和 H 提供了严格的数学证明,说明权重映射的单调性和保序性。
  • 案例研究(附录 L)直观展示了 PGPO 如何纠正基线模型在视觉理解上的关键错误。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.01840.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的理论推导、详尽的实验设置、多维度结果分析和消融研究,材料充分且自洽。