2604.01840
论文导读
提出 Token Visual Dependency 概念,并设计 PGPO 方法,在强化学习中实现 token 级别的视觉依赖感知优势重分配,提升多模态推理性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
并非所有 token 视觉贡献均等:面向大视觉-语言模型的感知 grounding 策略优化
一句话定位
提出 Token Visual Dependency 概念,并设计 PGPO 方法,在强化学习中实现 token 级别的视觉依赖感知优势重分配,提升多模态推理性能。
小学生也能听懂
这篇论文发现大模型做视觉题时,不是每个词都同样需要看图,于是发明了一种新方法,能自动识别哪些词更依赖图像,并重点加强这些词的学习,让模型更会看图答题,成绩平均提高了近19%。
为什么值得记录
- 揭示了现有 RLVR 方法在多模态推理中的根本缺陷:均匀分配优势会稀释关键视觉 grounding 步骤的学习信号。
- 首次形式化定义了 Token Visual Dependency,通过 KL 散度量化每个 token 对视觉输入的因果依赖程度。
- 提出的 PGPO 框架在 7 个多模态推理 benchmark 上平均提升 18.7%,显著优于 GRPO、DAPO、VPPO 等基线。
- 理论分析与实验证明 PGPO 能有效降低梯度方差、防止训练崩溃,并作为隐式正则化器增强模型对视觉证据的依赖。
核心方法
- 定义 Token Visual Dependency:使用 KL 散度衡量有/无视觉条件下模型预测分布的差异,量化每个 token 的视觉信息增益。
- 构建 Token Visual Dependency Score:对原始 KL 值进行对数压缩和序列内 min-max 归一化,得到 [0,1] 区间的有界分数 I_t。
- 设计阈值门控优势重塑机制:根据 I_t 动态调整每个 token 的优势权重,低依赖 token 被抑制,高依赖 token 被增强。
- 引入质量守恒归一化:确保重分配后的总优势质量与原始 GRPO 一致,维持训练稳定性。
- 将重塑后的 token 级优势 A~_i,t 代入 GRPO 目标函数,实现细粒度策略优化。
关键结果
- 在 Qwen2.5-VL-7B 上,PGPO 平均准确率达 54.70%,超越 VPPO (54.08%) 和 DAPO (52.69%)。
- 在 Qwen2.5-VL-3B 上,PGPO 平均准确率达 46.00%,相比基线 DAPO (43.84%) 提升 2.16 点。
- 在 Geo3k、MathVerse_V 等强视觉依赖任务上提升尤为显著,证明其对空间推理的有效性。
- 训练曲线显示 PGPO 收敛更快,且避免了 DAPO 后期出现的训练崩溃问题。
- 生成 token 的平均视觉依赖度 (~S_t) 随训练持续提升,表明模型真正增强了视觉感知能力。
局限与风险
- 需额外一次前向传播计算无视觉条件下的分布,带来约 10.6% 的训练时间开销。
- 依赖阈值 τ 和增强系数 β 等超参,需调优以平衡噪声抑制与信号增强。
- 目前仅在 Qwen2.5-VL 系列模型上验证,其他 LVLM 架构的泛化性待进一步检验。
适合沉淀的概念
token-visual-dependency, perception-grounded-policy-optimization, reinforcement-learning-with-verifiable-rewards, credit-assignment, multimodal-reasoning, advantage-reshaping, kl-divergence-visual-grounding
阅读注意
- 重点关注第 3 节对 Token Visual Dependency 的实证分析,其稀疏分布特性是 PGPO 设计动机。
- 注意图 3 的 PGPO 框架概览,理解从 S_t 到最终 A~_i,t 的完整变换流程。
- 表 2 的消融实验揭示了抑制噪声 token 比单纯增强关键 token 更重要。
- 附录 G 和 H 提供了严格的数学证明,说明权重映射的单调性和保序性。
- 案例研究(附录 L)直观展示了 PGPO 如何纠正基线模型在视觉理解上的关键错误。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.01840.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的理论推导、详尽的实验设置、多维度结果分析和消融研究,材料充分且自洽。