论文
arXiv2604.08065
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级86 分钟

2604.08065

论文导读

提出 Pearl 框架,通过 JEPA 风格的预测嵌入对齐,在潜在空间中学习专家工具使用轨迹,避免推理时显式调用工具,同时支持多步工具调用。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

基于预测嵌入的多模态潜在推理

一句话定位

提出 Pearl 框架,通过 JEPA 风格的预测嵌入对齐,在潜在空间中学习专家工具使用轨迹,避免推理时显式调用工具,同时支持多步工具调用。

小学生也能听懂

这篇论文发明了一种叫Pearl的方法,就像教AI“心里想”工具怎么工作,而不是真的动手操作,这样更快更聪明,还能一步步解决复杂问题,而且不用改原来的模型结构。

为什么值得记录

  • 解决了显式工具调用带来的高延迟和计算开销问题
  • 避免了重建式潜在推理方法中的训练-推理不匹配问题
  • 支持多步工具调用序列,突破了现有方法仅支持单步变换的限制
  • 模型无关、训练简单,且保持标准 VLM 推理流程
  • 实验表明重建式方法主要学习嵌入而非真正模拟图像编辑,为预测嵌入提供了理论支持

核心方法

  • 将输入视图 ⟨I₀, Q⟩ 和专家轨迹 R = (I₁, T₁, ..., Iₙ, Tₙ) 分别编码为隐藏状态 hₓ 和 h_R
  • 使用轻量级预测器(通过添加 [PRED] 特殊 token 实现)从 hₓ 预测轨迹嵌入 ĥ_R
  • 采用 JEPA 风格损失 ℒ_JEPA = D(ĥ_R, sg[h_R]) 对齐预测与目标嵌入(D 为 SmoothL1 距离)
  • 引入 ℒ_NextLat 正则项,鼓励隐藏状态作为信念状态(belief states),提升序列表示质量
  • 保留标准自回归生成损失 ℒ_VLM,确保文本生成能力不变
  • 总损失为 ℒ_PEARL = ℒ_VLM + λ[ℒ_JEPA + ℒ_NextLat],三项互补优化
  • 推理时仅需原始图像-问题对,无需工具调用或潜在 token 解码

关键结果

  • 在 Qwen2.5-VL-7B 上,Pearl 在 LVR 数据(单工具单步)上优于 SFT 基线和 LVR 方法:V* 达 81.5(vs 79.1/80.1),MMVP 达 73.5(vs 65.7/72.0)
  • 在 ThinkMorph 数据(多工具类型单步)上,Pearl 显著优于 SFT:V* 提升 31.4 点(73.8 vs 42.4),MMVP 提升 38.6 点(75.3 vs 36.7)
  • 在 PixelReasoner 数据(单工具多步)上,Pearl 与显式工具调用系统 PixelReasoner 相当,且在 MMVP(70.0 vs 67.0)、Counting(70.0 vs 66.7)等任务上反超
  • 在 3B 和 4B 更小模型上,Pearl 仍保持优势,证明其跨模型规模和架构的泛化能力
  • 消融实验显示移除 ℒ_NextLat 导致性能下降(如 V* 从 81.5→80.1),证实信念状态正则化的重要性
  • t-SNE 可视化显示 Pearl 能对齐输入与轨迹视图形成连贯聚类,而 SFT 产生碎片化表示

局限与风险

  • 未显式建模推理过程中的动作序列规划,仅内化整体轨迹效果
  • 潜在嵌入不可解释,无法知晓模型具体学到了哪些工具使用知识
  • 依赖外部专家轨迹数据,目前缺乏多工具类型+多步调用的开源数据集
  • 训练需两次前向传播编码两个视图,计算开销约为标准 SFT 的两倍

适合沉淀的概念

joint-embedding-predictive-architecture, latent-reasoning, multimodal-tool-use, belief-state, training-inference-mismatch, predictive-embedding, vision-language-model, self-supervised-finetuning

阅读注意

  • 重点关注 Pearl 如何避免重建式方法的 autoregressive latent token 生成机制
  • 注意 ℒ_NextLat 的理论动机:使隐藏状态成为过去历史的充分统计量(belief states)
  • 比较三种训练设定(LVR/ThinkMorph/PixelReasoner)在不同任务上的表现差异,理解数据 regime 的影响
  • 附录中的 t-SNE 图和消融实验是理解方法有效性的关键证据
  • 注意 Pearl 在推理时完全退化为标准 VLM,这是其核心优势之一

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.08065.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、多组对比结果、消融分析和可视化证据,方法描述清晰,结论有数据支撑。