2604.08065
论文导读
提出 Pearl 框架,通过 JEPA 风格的预测嵌入对齐,在潜在空间中学习专家工具使用轨迹,避免推理时显式调用工具,同时支持多步工具调用。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
基于预测嵌入的多模态潜在推理
一句话定位
提出 Pearl 框架,通过 JEPA 风格的预测嵌入对齐,在潜在空间中学习专家工具使用轨迹,避免推理时显式调用工具,同时支持多步工具调用。
小学生也能听懂
这篇论文发明了一种叫Pearl的方法,就像教AI“心里想”工具怎么工作,而不是真的动手操作,这样更快更聪明,还能一步步解决复杂问题,而且不用改原来的模型结构。
为什么值得记录
- 解决了显式工具调用带来的高延迟和计算开销问题
- 避免了重建式潜在推理方法中的训练-推理不匹配问题
- 支持多步工具调用序列,突破了现有方法仅支持单步变换的限制
- 模型无关、训练简单,且保持标准 VLM 推理流程
- 实验表明重建式方法主要学习嵌入而非真正模拟图像编辑,为预测嵌入提供了理论支持
核心方法
- 将输入视图 ⟨I₀, Q⟩ 和专家轨迹 R = (I₁, T₁, ..., Iₙ, Tₙ) 分别编码为隐藏状态 hₓ 和 h_R
- 使用轻量级预测器(通过添加 [PRED] 特殊 token 实现)从 hₓ 预测轨迹嵌入 ĥ_R
- 采用 JEPA 风格损失 ℒ_JEPA = D(ĥ_R, sg[h_R]) 对齐预测与目标嵌入(D 为 SmoothL1 距离)
- 引入 ℒ_NextLat 正则项,鼓励隐藏状态作为信念状态(belief states),提升序列表示质量
- 保留标准自回归生成损失 ℒ_VLM,确保文本生成能力不变
- 总损失为 ℒ_PEARL = ℒ_VLM + λ[ℒ_JEPA + ℒ_NextLat],三项互补优化
- 推理时仅需原始图像-问题对,无需工具调用或潜在 token 解码
关键结果
- 在 Qwen2.5-VL-7B 上,Pearl 在 LVR 数据(单工具单步)上优于 SFT 基线和 LVR 方法:V* 达 81.5(vs 79.1/80.1),MMVP 达 73.5(vs 65.7/72.0)
- 在 ThinkMorph 数据(多工具类型单步)上,Pearl 显著优于 SFT:V* 提升 31.4 点(73.8 vs 42.4),MMVP 提升 38.6 点(75.3 vs 36.7)
- 在 PixelReasoner 数据(单工具多步)上,Pearl 与显式工具调用系统 PixelReasoner 相当,且在 MMVP(70.0 vs 67.0)、Counting(70.0 vs 66.7)等任务上反超
- 在 3B 和 4B 更小模型上,Pearl 仍保持优势,证明其跨模型规模和架构的泛化能力
- 消融实验显示移除 ℒ_NextLat 导致性能下降(如 V* 从 81.5→80.1),证实信念状态正则化的重要性
- t-SNE 可视化显示 Pearl 能对齐输入与轨迹视图形成连贯聚类,而 SFT 产生碎片化表示
局限与风险
- 未显式建模推理过程中的动作序列规划,仅内化整体轨迹效果
- 潜在嵌入不可解释,无法知晓模型具体学到了哪些工具使用知识
- 依赖外部专家轨迹数据,目前缺乏多工具类型+多步调用的开源数据集
- 训练需两次前向传播编码两个视图,计算开销约为标准 SFT 的两倍
适合沉淀的概念
joint-embedding-predictive-architecture, latent-reasoning, multimodal-tool-use, belief-state, training-inference-mismatch, predictive-embedding, vision-language-model, self-supervised-finetuning
阅读注意
- 重点关注 Pearl 如何避免重建式方法的 autoregressive latent token 生成机制
- 注意 ℒ_NextLat 的理论动机:使隐藏状态成为过去历史的充分统计量(belief states)
- 比较三种训练设定(LVR/ThinkMorph/PixelReasoner)在不同任务上的表现差异,理解数据 regime 的影响
- 附录中的 t-SNE 图和消融实验是理解方法有效性的关键证据
- 注意 Pearl 在推理时完全退化为标准 VLM,这是其核心优势之一
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.08065.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、多组对比结果、消融分析和可视化证据,方法描述清晰,结论有数据支撑。