概念导读
视觉引导的策略优化:让 RL 训练的信号同时考虑视觉证据和语言推理。
- 核心方法
- 与相关工作的关系
- Related
Visually-Guided Policy Optimization
核心方法
视觉引导的策略优化:让 RL 训练的信号同时考虑视觉证据和语言推理。
与相关工作的关系
- perception-grounded-po 的姐妹工作
- 侧重于推理过程中的视觉注意力引导
- 在多模态推理 benchmark 上显著提升
视觉引导的策略优化:让 RL 训练的信号同时考虑视觉证据和语言推理。
视觉引导的策略优化:让 RL 训练的信号同时考虑视觉证据和语言推理。