---
title: "2604.08065"
title_zh: "基于预测嵌入的多模态潜在推理"
arxiv_id: "2604.08065"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.08065.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 基于预测嵌入的多模态潜在推理

## 一句话定位

提出 Pearl 框架，通过 JEPA 风格的预测嵌入对齐，在潜在空间中学习专家工具使用轨迹，避免推理时显式调用工具，同时支持多步工具调用。

## 小学生也能听懂

这篇论文发明了一种叫Pearl的方法，就像教AI“心里想”工具怎么工作，而不是真的动手操作，这样更快更聪明，还能一步步解决复杂问题，而且不用改原来的模型结构。

## 为什么值得记录

- 解决了显式工具调用带来的高延迟和计算开销问题
- 避免了重建式潜在推理方法中的训练-推理不匹配问题
- 支持多步工具调用序列，突破了现有方法仅支持单步变换的限制
- 模型无关、训练简单，且保持标准 VLM 推理流程
- 实验表明重建式方法主要学习嵌入而非真正模拟图像编辑，为预测嵌入提供了理论支持

## 核心方法

- 将输入视图 ⟨I₀, Q⟩ 和专家轨迹 R = (I₁, T₁, ..., Iₙ, Tₙ) 分别编码为隐藏状态 hₓ 和 h_R
- 使用轻量级预测器（通过添加 [PRED] 特殊 token 实现）从 hₓ 预测轨迹嵌入 ĥ_R
- 采用 JEPA 风格损失 ℒ_JEPA = D(ĥ_R, sg[h_R]) 对齐预测与目标嵌入（D 为 SmoothL1 距离）
- 引入 ℒ_NextLat 正则项，鼓励隐藏状态作为信念状态（belief states），提升序列表示质量
- 保留标准自回归生成损失 ℒ_VLM，确保文本生成能力不变
- 总损失为 ℒ_PEARL = ℒ_VLM + λ[ℒ_JEPA + ℒ_NextLat]，三项互补优化
- 推理时仅需原始图像-问题对，无需工具调用或潜在 token 解码

## 关键结果

- 在 Qwen2.5-VL-7B 上，Pearl 在 LVR 数据（单工具单步）上优于 SFT 基线和 LVR 方法：V* 达 81.5（vs 79.1/80.1），MMVP 达 73.5（vs 65.7/72.0）
- 在 ThinkMorph 数据（多工具类型单步）上，Pearl 显著优于 SFT：V* 提升 31.4 点（73.8 vs 42.4），MMVP 提升 38.6 点（75.3 vs 36.7）
- 在 PixelReasoner 数据（单工具多步）上，Pearl 与显式工具调用系统 PixelReasoner 相当，且在 MMVP（70.0 vs 67.0）、Counting（70.0 vs 66.7）等任务上反超
- 在 3B 和 4B 更小模型上，Pearl 仍保持优势，证明其跨模型规模和架构的泛化能力
- 消融实验显示移除 ℒ_NextLat 导致性能下降（如 V* 从 81.5→80.1），证实信念状态正则化的重要性
- t-SNE 可视化显示 Pearl 能对齐输入与轨迹视图形成连贯聚类，而 SFT 产生碎片化表示

## 局限与风险

- 未显式建模推理过程中的动作序列规划，仅内化整体轨迹效果
- 潜在嵌入不可解释，无法知晓模型具体学到了哪些工具使用知识
- 依赖外部专家轨迹数据，目前缺乏多工具类型+多步调用的开源数据集
- 训练需两次前向传播编码两个视图，计算开销约为标准 SFT 的两倍

## 适合沉淀的概念

`joint-embedding-predictive-architecture`, `latent-reasoning`, `multimodal-tool-use`, `belief-state`, `training-inference-mismatch`, `predictive-embedding`, `vision-language-model`, `self-supervised-finetuning`

## 阅读注意

- 重点关注 Pearl 如何避免重建式方法的 autoregressive latent token 生成机制
- 注意 ℒ_NextLat 的理论动机：使隐藏状态成为过去历史的充分统计量（belief states）
- 比较三种训练设定（LVR/ThinkMorph/PixelReasoner）在不同任务上的表现差异，理解数据 regime 的影响
- 附录中的 t-SNE 图和消融实验是理解方法有效性的关键证据
- 注意 Pearl 在推理时完全退化为标准 VLM，这是其核心优势之一

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.08065.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、多组对比结果、消融分析和可视化证据，方法描述清晰，结论有数据支撑。
