VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
论文导读
提出VOLD框架,结合GRPO强化学习与同策略知识蒸馏,利用纯文本数据将文本大模型的推理能力迁移至视觉语言模型,无需视觉推理训练数据。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
VOLD:通过同策略蒸馏实现从LLM到VLM的推理能力迁移
一句话定位
提出VOLD框架,结合GRPO强化学习与同策略知识蒸馏,利用纯文本数据将文本大模型的推理能力迁移至视觉语言模型,无需视觉推理训练数据。
小学生也能听懂
这篇论文像教机器人用眼睛看题并思考:先用文字题训练它学会推理,再用强化学习让它自己练,同时参考文字老师的思路,最终让它在看图做题时更聪明,不用专门准备看图题目也能考高分。
为什么值得记录
- 解决了视觉推理训练数据稀缺问题,利用丰富的文本推理资源实现跨模态能力迁移
- 首次实现文本到视觉的同策略推理迁移,为多模态推理训练提供新范式
- 在MMMU-Pro、MathVision等多个基准测试上达到SOTA性能,优于使用图像训练的方法
- 框架设计正交于RL算法演进,可无缝集成更先进的RL方法
核心方法
- 两阶段训练流程:Stage 1使用教师模型生成的推理轨迹对VLM进行SFT对齐;Stage 2结合GRPO与同策略蒸馏
- 采用Group Relative Policy Optimization (GRPO) 进行强化学习,避免价值函数计算开销
- 引入反向KL散度作为同策略蒸馏损失,指导学生模型在其自身轨迹前缀上逼近教师分布
- 提出奖励引导的KL掩码机制,仅在错误响应上激活蒸馏,避免干扰正确推理路径探索
- 使用Qwen2.5-VL-3B作为学生模型,Qwen3-8B作为文本教师模型,共享tokenizer确保KL计算有效性
- 训练数据:SFT阶段使用MoT-Teacher-8B(教师生成的35万条推理轨迹),RL阶段使用orz-57k数学数据集
关键结果
- 在MathVision上达到28.0%准确率,显著优于VLAA-Thinker(24.4%)和基础模型(21.9%)
- 在LogicVista上达到45.0%,超越VLM-R1(40.5%)和基础模型(40.3%)
- 相比仅使用SFT+RL的X-Reasoner,VOLD在MMMU-Pro上提升1.0%(32.0% vs 31.0%),在MathVision上提升3.6%
- 训练动态显示:VOLD在Geo3K验证集上准确率达0.38,高于GRPO-only的0.32;训练奖励达0.58 vs 0.51
- 消融实验证明:无教师对齐时,同策略蒸馏无增益;完整VOLD比SFT-only或RL-only性能更高
局限与风险
- 依赖教师与学生模型共享tokenizer,限制模型选择灵活性
- 学生模型容量(3B)可能限制其吸收更大教师(如14B)知识的能力,存在收益递减
- SFT阶段使用未过滤的教师轨迹可能导致初始性能下降,需后续RL补偿
- 目前仅在数学、逻辑等可验证任务上验证,泛化至其他视觉推理任务待探索
适合沉淀的概念
同策略知识蒸馏, group-relative-policy-optimization, text-to-vision-reasoning-transfer, reward-guided-kl-masking, cold-start-alignment, vision-language-model-reasoning, on-policy-distillation, multimodal-reasoning-benchmarks
阅读注意
- 重点关注Stage 1的分布对齐必要性:实验显示若使用非教师生成的SFT数据(如原始MoT),蒸馏无效
- 注意KL掩码机制的设计动机:防止RL发现的正确路径被教师蒸馏干扰
- 评估时采用零样本设定,无额外图像微调,凸显纯文本训练的有效性
- 附录B.1显示SFT需至少3000步才能建立有效‘breadcrumb trail’供RL跟随
- 教师尺寸消融表明8B教师对3B学生已接近最优,更大教师收益有限
质量说明
- 采用来源:
clean,papers/2025/10/2510.23497.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法细节、实验设置、消融分析和附录实现参数,结果可复现性强。