2604.08539
论文导读
提出高斯GRPO(G²RPO)强化学习目标与任务级响应长度和熵塑形机制,构建出在18个多模态基准上超越主流开源与专有模型的高鲁棒性通用视觉推理模型OpenVLThinkerV2。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
OpenVLThinkerV2:面向多领域视觉任务的通用多模态推理模型
一句话定位
提出高斯GRPO(G²RPO)强化学习目标与任务级响应长度和熵塑形机制,构建出在18个多模态基准上超越主流开源与专有模型的高鲁棒性通用视觉推理模型OpenVLThinkerV2。
小学生也能听懂
这篇论文像给AI“大脑”装了个智能调节器,用数学方法让它在看图片、读文档、做数学题等不同任务时,既能仔细观察细节,又能一步步推理,最终在18种测试中表现超过很多厉害模型,包括GPT-5。
为什么值得记录
- 解决了多任务强化学习中因奖励分布差异导致的梯度失衡问题,通过非线性分布匹配提升训练稳定性
- 首次系统性地将响应长度与熵作为任务级调控维度,有效平衡细粒度感知与多步推理能力
- 在MMMU(71.6%)、MathVista(79.5%)等18个基准上刷新开源模型SOTA,并在文档理解与空间推理任务上超越GPT-5与Gemini 2.5 Pro
- 提出的G²RPO方法具有理论保障的离群值鲁棒性与任务间梯度公平性,为多模态RL提供了新范式
核心方法
- 提出Gaussian GRPO(G²RPO):使用一维最优传输(1D Optimal Transport)将每个任务的奖励分布严格映射到标准正态分布N(0,1),替代传统线性标准化
- 实现方式:基于经验累积分布函数(CDF)与标准正态逆CDF(Φ⁻¹)进行分位数映射,公式为Â_i = Φ⁻¹(F_ℛτ(R_i))
- 引入任务级响应长度塑形:为不同任务设定目标长度区间[L_min, L_low, L_high, L_max],通过梯形奖励函数鼓励合理输出长度
- 引入任务级熵塑形:定义最小/最大熵阈值[H_min, H_max],对超出范围的熵施加线性惩罚,防止熵坍缩或爆炸
- 训练流程:基于Qwen3-VL-Instruct-8B初始化,在OneThinker-600k数据集子集上进行单轮GRPO训练,禁用KL正则化并动态过滤低质量样本
关键结果
- 在MMMU上达到71.6%准确率,超过GPT-4o(70.7%);在MathVista上达到79.5%,显著领先
- 文档理解任务中,OCRBench得分911,超越专用模型DeepEyesV2及GPT-5、Gemini 2.5 Pro
- 空间推理任务EmbSpatial得分83.1,为所有对比模型中最高;RoboSpatial达63.2,与空间专家模型相当
- 视觉 grounding 任务在RefCOCO/RefCOCO+/RefCOCOg上分别达到93.4%/88.2%/90.4%,全面超越Grounding DINO等基线
- 消融实验显示:G²RPO带来最大性能跃升,长度塑形贡献次之,二者结合实现最优效果
局限与风险
- 任务级塑形依赖人工设定的超参数(如长度与熵边界),虽声称可直观选择,但仍需领域知识
- 当前实现基于观察趋势设定塑形策略,未实现自动化搜索或自适应调整机制
- 实验仅使用单轮训练,长期训练下的稳定性与泛化能力有待验证
适合沉淀的概念
gaussian-grpo, optimal-transport-in-rl, task-level-response-length-shaping, entropy-regularization, multimodal-reasoning-balance, reward-distribution-matching, openv lthinker-v2, multi-task-rl-for-mllms
阅读注意
- 重点理解G²RPO如何通过CDF映射解决传统GRPO的离群值敏感与任务间尺度不一致问题
- 关注图3与图4中不同任务类型的响应长度与熵动态差异,这是塑形机制的设计动机
- 注意附录A中G²RPO在格式奖励与结构奖励上的稳定性表现,说明其综合优化能力
- 对比表4消融结果,理解各组件对最终性能的独立与协同贡献
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.08539.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的理论推导、算法伪代码、多维度实验结果与消融分析,数据充分且逻辑自洽,具备可复现性与学术严谨性。