概念
rl multimodal vision reasoning policy-optimization
创建2026-04-15
更新2026-04-15
阅读量级1 分钟
概念导读

视觉引导的策略优化:让 RL 训练的信号同时考虑视觉证据和语言推理。

  1. 核心方法
  2. 与相关工作的关系
  3. Related

Visually-Guided Policy Optimization

核心方法

视觉引导的策略优化:让 RL 训练的信号同时考虑视觉证据和语言推理。

与相关工作的关系

  • perception-grounded-po 的姐妹工作
  • 侧重于推理过程中的视觉注意力引导
  • 在多模态推理 benchmark 上显著提升