论文
arXiv2504.18458
时间2025-04
来源Markdown
页面质量中文卡片
阅读量级132 分钟

2504.18458

论文导读

提出 FAST-GRPO,一种基于问题难度动态调节推理深度与长度的 GRPO 变体,在保持或提升准确率的同时显著减少冗余输出。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

FAST-GRPO:面向大视觉语言模型推理的快慢思维强化学习

一句话定位

提出 FAST-GRPO,一种基于问题难度动态调节推理深度与长度的 GRPO 变体,在保持或提升准确率的同时显著减少冗余输出。

小学生也能听懂

这篇论文教大模型像人一样聪明思考:简单题快速答,难题慢慢想。它用“快慢思维”自动调节答题长度,既更准又快,还省力气,就像考试时不会在简单题上浪费时间。

为什么值得记录

  • 解决了当前 LVLM 慢思维方法普遍存在的过度冗长(overthinking)问题,避免简单问题上性能退化
  • 首次将快慢思维自适应机制引入多模态推理,通过难度感知奖励和 KL 正则化实现动态平衡
  • 在 7 个基准测试中平均准确率提升超 10%,同时 token 使用量比慢思维方法减少 32.7–67.3%
  • 仅需 18K 高质量训练样本,优于依赖大规模蒸馏数据的 SFT-RL 方法

核心方法

  • 基于 GRPO 框架,引入两种互补的问题难度度量:外在难度(模型当前 pass@k 成功率)和内在难度(图像复杂度,结合 GLCM 熵与 ViT 分类熵)
  • 设计难度感知长度奖励 r_t:对简单正确回答鼓励简短输出,对复杂错误回答鼓励深入推理
  • 实现难度感知 KL 正则化系数 β_d,对难题放宽约束以促进探索,对易题加强约束以稳定性能
  • 采用 Slow-to-Fast 课程采样策略,早期聚焦难题训练慢思维,后期转向易题训练快思维
  • 训练数据经严格筛选:从 500K 原始数据中过滤出 18K 规则可验证、闭卷形式的问答对

关键结果

  • 在 Qwen2.5-VL-7B 上,FAST 平均准确率达 59.0%,较基线提升 10.3%;响应长度降至 162.2 tokens,较 R1-OneVision 减少 67.3%
  • 在 MathVista 上达到 73.8% 准确率,超越 GPT-4o(63.8%)等闭源模型
  • 在 Geometry3K 困难样本上响应长度比简单样本长 60%,体现真正的自适应推理能力
  • 消融实验显示:移除数据采样导致准确率下降 3.9 点;移除思维奖励使长度增加 42%

局限与风险

  • 难度估计依赖在线 pass@k 计算,增加训练开销
  • 图像复杂度指标 H_img 与人类判断相关性中等(SRCC=0.49),仍有改进空间
  • 目前仅在数学与科学推理任务验证,泛化至其他视觉任务需进一步测试

适合沉淀的概念

fast-slow-thinking, difficulty-aware-reward, adaptive-reasoning-length, multimodal-question-difficulty, grpo-variant, curriculum-sampling, overthinking-in-lvlms

阅读注意

  • 重点关注 §3 的 pilot experiments,理解为何传统长度奖励在 LVLM 中失效
  • 注意公式 (4) 中 r_t 的分段定义逻辑:仅在正确且简单或错误且困难时激活长度奖励
  • 图 2 和图 3 是核心洞察来源,展示长度-准确率解耦及难度分布的影响
  • 附录 B 提供完整超参数设置,包括 β_min=0.1, β_max=0.5, λ_t=0.3 等

质量说明

  • 采用来源:rawraw/papers/2025/04/2504.18458.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、消融分析、统计显著性检验(见附录图 10 和表 11)、计算资源说明(600 H100 GPU hours)以及代码/模型开源声明,满足可复现性要求。