---
title: "2504.18458"
title_zh: "FAST-GRPO：面向大视觉语言模型推理的快慢思维强化学习"
arxiv_id: "2504.18458"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2025/04/2504.18458.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# FAST-GRPO：面向大视觉语言模型推理的快慢思维强化学习

## 一句话定位

提出 FAST-GRPO，一种基于问题难度动态调节推理深度与长度的 GRPO 变体，在保持或提升准确率的同时显著减少冗余输出。

## 小学生也能听懂

这篇论文教大模型像人一样聪明思考：简单题快速答，难题慢慢想。它用“快慢思维”自动调节答题长度，既更准又快，还省力气，就像考试时不会在简单题上浪费时间。

## 为什么值得记录

- 解决了当前 LVLM 慢思维方法普遍存在的过度冗长（overthinking）问题，避免简单问题上性能退化
- 首次将快慢思维自适应机制引入多模态推理，通过难度感知奖励和 KL 正则化实现动态平衡
- 在 7 个基准测试中平均准确率提升超 10%，同时 token 使用量比慢思维方法减少 32.7–67.3%
- 仅需 18K 高质量训练样本，优于依赖大规模蒸馏数据的 SFT-RL 方法

## 核心方法

- 基于 GRPO 框架，引入两种互补的问题难度度量：外在难度（模型当前 pass@k 成功率）和内在难度（图像复杂度，结合 GLCM 熵与 ViT 分类熵）
- 设计难度感知长度奖励 r_t：对简单正确回答鼓励简短输出，对复杂错误回答鼓励深入推理
- 实现难度感知 KL 正则化系数 β_d，对难题放宽约束以促进探索，对易题加强约束以稳定性能
- 采用 Slow-to-Fast 课程采样策略，早期聚焦难题训练慢思维，后期转向易题训练快思维
- 训练数据经严格筛选：从 500K 原始数据中过滤出 18K 规则可验证、闭卷形式的问答对

## 关键结果

- 在 Qwen2.5-VL-7B 上，FAST 平均准确率达 59.0%，较基线提升 10.3%；响应长度降至 162.2 tokens，较 R1-OneVision 减少 67.3%
- 在 MathVista 上达到 73.8% 准确率，超越 GPT-4o（63.8%）等闭源模型
- 在 Geometry3K 困难样本上响应长度比简单样本长 60%，体现真正的自适应推理能力
- 消融实验显示：移除数据采样导致准确率下降 3.9 点；移除思维奖励使长度增加 42%

## 局限与风险

- 难度估计依赖在线 pass@k 计算，增加训练开销
- 图像复杂度指标 H_img 与人类判断相关性中等（SRCC=0.49），仍有改进空间
- 目前仅在数学与科学推理任务验证，泛化至其他视觉任务需进一步测试

## 适合沉淀的概念

`fast-slow-thinking`, `difficulty-aware-reward`, `adaptive-reasoning-length`, `multimodal-question-difficulty`, `grpo-variant`, `curriculum-sampling`, `overthinking-in-lvlms`

## 阅读注意

- 重点关注 §3 的 pilot experiments，理解为何传统长度奖励在 LVLM 中失效
- 注意公式 (4) 中 r_t 的分段定义逻辑：仅在正确且简单或错误且困难时激活长度奖励
- 图 2 和图 3 是核心洞察来源，展示长度-准确率解耦及难度分布的影响
- 附录 B 提供完整超参数设置，包括 β_min=0.1, β_max=0.5, λ_t=0.3 等

## 质量说明

- 采用来源：`raw`，`raw/papers/2025/04/2504.18458.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、消融分析、统计显著性检验（见附录图 10 和表 11）、计算资源说明（600 H100 GPU hours）以及代码/模型开源声明，满足可复现性要求。
