论文
arXiv2510.23497
时间2025-10
来源Markdown
页面质量中文卡片
阅读量级71 分钟

VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation

论文导读

提出VOLD框架,结合GRPO强化学习与同策略知识蒸馏,利用纯文本数据将文本大模型的推理能力迁移至视觉语言模型,无需视觉推理训练数据。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

VOLD:通过同策略蒸馏实现从LLM到VLM的推理能力迁移

一句话定位

提出VOLD框架,结合GRPO强化学习与同策略知识蒸馏,利用纯文本数据将文本大模型的推理能力迁移至视觉语言模型,无需视觉推理训练数据。

小学生也能听懂

这篇论文像教机器人用眼睛看题并思考:先用文字题训练它学会推理,再用强化学习让它自己练,同时参考文字老师的思路,最终让它在看图做题时更聪明,不用专门准备看图题目也能考高分。

为什么值得记录

  • 解决了视觉推理训练数据稀缺问题,利用丰富的文本推理资源实现跨模态能力迁移
  • 首次实现文本到视觉的同策略推理迁移,为多模态推理训练提供新范式
  • 在MMMU-Pro、MathVision等多个基准测试上达到SOTA性能,优于使用图像训练的方法
  • 框架设计正交于RL算法演进,可无缝集成更先进的RL方法

核心方法

  • 两阶段训练流程:Stage 1使用教师模型生成的推理轨迹对VLM进行SFT对齐;Stage 2结合GRPO与同策略蒸馏
  • 采用Group Relative Policy Optimization (GRPO) 进行强化学习,避免价值函数计算开销
  • 引入反向KL散度作为同策略蒸馏损失,指导学生模型在其自身轨迹前缀上逼近教师分布
  • 提出奖励引导的KL掩码机制,仅在错误响应上激活蒸馏,避免干扰正确推理路径探索
  • 使用Qwen2.5-VL-3B作为学生模型,Qwen3-8B作为文本教师模型,共享tokenizer确保KL计算有效性
  • 训练数据:SFT阶段使用MoT-Teacher-8B(教师生成的35万条推理轨迹),RL阶段使用orz-57k数学数据集

关键结果

  • 在MathVision上达到28.0%准确率,显著优于VLAA-Thinker(24.4%)和基础模型(21.9%)
  • 在LogicVista上达到45.0%,超越VLM-R1(40.5%)和基础模型(40.3%)
  • 相比仅使用SFT+RL的X-Reasoner,VOLD在MMMU-Pro上提升1.0%(32.0% vs 31.0%),在MathVision上提升3.6%
  • 训练动态显示:VOLD在Geo3K验证集上准确率达0.38,高于GRPO-only的0.32;训练奖励达0.58 vs 0.51
  • 消融实验证明:无教师对齐时,同策略蒸馏无增益;完整VOLD比SFT-only或RL-only性能更高

局限与风险

  • 依赖教师与学生模型共享tokenizer,限制模型选择灵活性
  • 学生模型容量(3B)可能限制其吸收更大教师(如14B)知识的能力,存在收益递减
  • SFT阶段使用未过滤的教师轨迹可能导致初始性能下降,需后续RL补偿
  • 目前仅在数学、逻辑等可验证任务上验证,泛化至其他视觉推理任务待探索

适合沉淀的概念

同策略知识蒸馏, group-relative-policy-optimization, text-to-vision-reasoning-transfer, reward-guided-kl-masking, cold-start-alignment, vision-language-model-reasoning, on-policy-distillation, multimodal-reasoning-benchmarks

阅读注意

  • 重点关注Stage 1的分布对齐必要性:实验显示若使用非教师生成的SFT数据(如原始MoT),蒸馏无效
  • 注意KL掩码机制的设计动机:防止RL发现的正确路径被教师蒸馏干扰
  • 评估时采用零样本设定,无额外图像微调,凸显纯文本训练的有效性
  • 附录B.1显示SFT需至少3000步才能建立有效‘breadcrumb trail’供RL跟随
  • 教师尺寸消融表明8B教师对3B学生已接近最优,更大教师收益有限

质量说明

  • 采用来源:cleanpapers/2025/10/2510.23497.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法细节、实验设置、消融分析和附录实现参数,结果可复现性强。