---
title: "VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation"
title_zh: "VOLD：通过同策略蒸馏实现从LLM到VLM的推理能力迁移"
arxiv_id: "2510.23497"
paper_type: "method"
source_kind: "clean"
raw_path: "raw/papers/2025/10/2510.23497.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# VOLD：通过同策略蒸馏实现从LLM到VLM的推理能力迁移

## 一句话定位

提出VOLD框架，结合GRPO强化学习与同策略知识蒸馏，利用纯文本数据将文本大模型的推理能力迁移至视觉语言模型，无需视觉推理训练数据。

## 小学生也能听懂

这篇论文像教机器人用眼睛看题并思考：先用文字题训练它学会推理，再用强化学习让它自己练，同时参考文字老师的思路，最终让它在看图做题时更聪明，不用专门准备看图题目也能考高分。

## 为什么值得记录

- 解决了视觉推理训练数据稀缺问题，利用丰富的文本推理资源实现跨模态能力迁移
- 首次实现文本到视觉的同策略推理迁移，为多模态推理训练提供新范式
- 在MMMU-Pro、MathVision等多个基准测试上达到SOTA性能，优于使用图像训练的方法
- 框架设计正交于RL算法演进，可无缝集成更先进的RL方法

## 核心方法

- 两阶段训练流程：Stage 1使用教师模型生成的推理轨迹对VLM进行SFT对齐；Stage 2结合GRPO与同策略蒸馏
- 采用Group Relative Policy Optimization (GRPO) 进行强化学习，避免价值函数计算开销
- 引入反向KL散度作为同策略蒸馏损失，指导学生模型在其自身轨迹前缀上逼近教师分布
- 提出奖励引导的KL掩码机制，仅在错误响应上激活蒸馏，避免干扰正确推理路径探索
- 使用Qwen2.5-VL-3B作为学生模型，Qwen3-8B作为文本教师模型，共享tokenizer确保KL计算有效性
- 训练数据：SFT阶段使用MoT-Teacher-8B（教师生成的35万条推理轨迹），RL阶段使用orz-57k数学数据集

## 关键结果

- 在MathVision上达到28.0%准确率，显著优于VLAA-Thinker（24.4%）和基础模型（21.9%）
- 在LogicVista上达到45.0%，超越VLM-R1（40.5%）和基础模型（40.3%）
- 相比仅使用SFT+RL的X-Reasoner，VOLD在MMMU-Pro上提升1.0%（32.0% vs 31.0%），在MathVision上提升3.6%
- 训练动态显示：VOLD在Geo3K验证集上准确率达0.38，高于GRPO-only的0.32；训练奖励达0.58 vs 0.51
- 消融实验证明：无教师对齐时，同策略蒸馏无增益；完整VOLD比SFT-only或RL-only性能更高

## 局限与风险

- 依赖教师与学生模型共享tokenizer，限制模型选择灵活性
- 学生模型容量（3B）可能限制其吸收更大教师（如14B）知识的能力，存在收益递减
- SFT阶段使用未过滤的教师轨迹可能导致初始性能下降，需后续RL补偿
- 目前仅在数学、逻辑等可验证任务上验证，泛化至其他视觉推理任务待探索

## 适合沉淀的概念

`同策略知识蒸馏`, `group-relative-policy-optimization`, `text-to-vision-reasoning-transfer`, `reward-guided-kl-masking`, `cold-start-alignment`, `vision-language-model-reasoning`, `on-policy-distillation`, `multimodal-reasoning-benchmarks`

## 阅读注意

- 重点关注Stage 1的分布对齐必要性：实验显示若使用非教师生成的SFT数据（如原始MoT），蒸馏无效
- 注意KL掩码机制的设计动机：防止RL发现的正确路径被教师蒸馏干扰
- 评估时采用零样本设定，无额外图像微调，凸显纯文本训练的有效性
- 附录B.1显示SFT需至少3000步才能建立有效‘breadcrumb trail’供RL跟随
- 教师尺寸消融表明8B教师对3B学生已接近最优，更大教师收益有限

## 质量说明

- 采用来源：`clean`，`papers/2025/10/2510.23497.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验设置、消融分析和附录实现参数，结果可复现性强。
