2504.18458
论文导读
提出 FAST-GRPO,一种基于问题难度动态调节推理深度与长度的 GRPO 变体,在保持或提升准确率的同时显著减少冗余输出。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
FAST-GRPO:面向大视觉语言模型推理的快慢思维强化学习
一句话定位
提出 FAST-GRPO,一种基于问题难度动态调节推理深度与长度的 GRPO 变体,在保持或提升准确率的同时显著减少冗余输出。
小学生也能听懂
这篇论文教大模型像人一样聪明思考:简单题快速答,难题慢慢想。它用“快慢思维”自动调节答题长度,既更准又快,还省力气,就像考试时不会在简单题上浪费时间。
为什么值得记录
- 解决了当前 LVLM 慢思维方法普遍存在的过度冗长(overthinking)问题,避免简单问题上性能退化
- 首次将快慢思维自适应机制引入多模态推理,通过难度感知奖励和 KL 正则化实现动态平衡
- 在 7 个基准测试中平均准确率提升超 10%,同时 token 使用量比慢思维方法减少 32.7–67.3%
- 仅需 18K 高质量训练样本,优于依赖大规模蒸馏数据的 SFT-RL 方法
核心方法
- 基于 GRPO 框架,引入两种互补的问题难度度量:外在难度(模型当前 pass@k 成功率)和内在难度(图像复杂度,结合 GLCM 熵与 ViT 分类熵)
- 设计难度感知长度奖励 r_t:对简单正确回答鼓励简短输出,对复杂错误回答鼓励深入推理
- 实现难度感知 KL 正则化系数 β_d,对难题放宽约束以促进探索,对易题加强约束以稳定性能
- 采用 Slow-to-Fast 课程采样策略,早期聚焦难题训练慢思维,后期转向易题训练快思维
- 训练数据经严格筛选:从 500K 原始数据中过滤出 18K 规则可验证、闭卷形式的问答对
关键结果
- 在 Qwen2.5-VL-7B 上,FAST 平均准确率达 59.0%,较基线提升 10.3%;响应长度降至 162.2 tokens,较 R1-OneVision 减少 67.3%
- 在 MathVista 上达到 73.8% 准确率,超越 GPT-4o(63.8%)等闭源模型
- 在 Geometry3K 困难样本上响应长度比简单样本长 60%,体现真正的自适应推理能力
- 消融实验显示:移除数据采样导致准确率下降 3.9 点;移除思维奖励使长度增加 42%
局限与风险
- 难度估计依赖在线 pass@k 计算,增加训练开销
- 图像复杂度指标 H_img 与人类判断相关性中等(SRCC=0.49),仍有改进空间
- 目前仅在数学与科学推理任务验证,泛化至其他视觉任务需进一步测试
适合沉淀的概念
fast-slow-thinking, difficulty-aware-reward, adaptive-reasoning-length, multimodal-question-difficulty, grpo-variant, curriculum-sampling, overthinking-in-lvlms
阅读注意
- 重点关注 §3 的 pilot experiments,理解为何传统长度奖励在 LVLM 中失效
- 注意公式 (4) 中 r_t 的分段定义逻辑:仅在正确且简单或错误且困难时激活长度奖励
- 图 2 和图 3 是核心洞察来源,展示长度-准确率解耦及难度分布的影响
- 附录 B 提供完整超参数设置,包括 β_min=0.1, β_max=0.5, λ_t=0.3 等
质量说明
- 采用来源:
raw,raw/papers/2025/04/2504.18458.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、消融分析、统计显著性检验(见附录图 10 和表 11)、计算资源说明(600 H100 GPU hours)以及代码/模型开源声明,满足可复现性要求。