论文
arXiv2605.07937
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级119 分钟

论文导读

通过强制注入实验量化不同信息维度下澄清时机对长程智能体性能的影响,发现目标澄清仅在执行前10%有效,而输入澄清可维持至50%,且当前前沿模型普遍未在最优窗口提问。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

澄清时机的价值:长程智能体何时需要提问?

一句话定位

通过强制注入实验量化不同信息维度下澄清时机对长程智能体性能的影响,发现目标澄清仅在执行前10%有效,而输入澄清可维持至50%,且当前前沿模型普遍未在最优窗口提问。

小学生也能听懂

这篇论文研究AI助手在执行复杂任务时,什么时候问问题最有效。比如,如果任务是做报表但没说清楚格式,早点问可以少走弯路;但如果等到快做完才问,可能已经白做了很多工作。实验发现,关于“目标”的问题必须很早问才管用,而关于“数据在哪”的问题可以稍晚问。但现在的AI助手要么问得太晚,要么根本不问。

为什么值得记录

  • 首次系统测量澄清时机与信息维度的交互效应,挑战“越早越好”的直觉假设
  • 提出强制注入框架,实现跨模型、跨任务的可控澄清时机实验(6,000+次运行)
  • 揭示当前前沿模型(GPT-5.2、Claude Sonnet 4.5等)均未在实证最优窗口提问
  • 为澄清策略设计提供定量依据:目标澄清窗口≤10%,输入澄清窗口≈50%

核心方法

  • 采用强制注入协议:在轨迹的10%、30%、50%、70%、90%处注入真实澄清信息,绕过模型自主提问能力
  • 覆盖84个任务变体、3个基准(MCP-Atlas、TheAgentCompany、SWE-Bench Pro)、4个前沿模型
  • 定义四个信息维度:目标(goal)、输入(input)、约束(constraint)、上下文(context)
  • 使用pass@3(三次尝试至少成功一次)作为主要指标,辅以浪费计算量、无返回点分析
  • 通过自然提问协议(300次会话)评估模型实际提问行为

关键结果

  • 目标澄清价值在10%轨迹后急剧下降:pass@3从0.78(10%注入)降至0.39(70%注入),接近无澄清基线(0.40)
  • 输入澄清价值缓慢衰减:在50%前仍有效(pass@3 0.36 vs 基线0.33),70%后失效
  • 约束澄清仅在存在oracle gap时有效(如SWE-Bench Pro),且延迟导致收益递减(0.81→0.68)
  • 跨模型Kendall τ相关性显示时序模式具任务内禀性(同任务覆盖模型间τ=0.78–0.87)
  • 自然提问行为严重偏离最优:GPT-5.2平均43%提问(对目标太晚),Gemini 3 Flash从不提问

局限与风险

  • SWE-Bench Pro样本量较小(n=12–31/单元),部分结果受采样变异影响
  • 强制注入消息可能比原始提示更显式,导致局部性能反超oracle(非统计显著)
  • 未建模澄清成本(如延迟、用户负担),仅衡量收益侧
  • DeepSeek V3.2仅在一个基准测试,限制跨模型比较完整性

适合沉淀的概念

value-of-information-theory, clarification-timing, long-horizon-agents, forced-injection-protocol, trajectory-commitment, point-of-no-return, information-dimensions, agent-benchmarks

阅读注意

  • 重点关注图3(MCP-Atlas VOI曲线)和图5(自然提问时机叠加)
  • 注意区分‘无澄清基线’与‘oracle上限’,理解注入条件的相对增益
  • 表3的Kendall τ揭示时序效应是任务特性而非模型artifact
  • 附录A.6的定性轨迹分析帮助理解机制(如输入探索的补偿作用)
  • SWE-Bench Pro的oracle>NC反转需结合小样本和注入消息显式性解释

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.07937.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设计、统计检验、消融分析和可复现细节(包括API参数、成本、数据发布计划),结果稳健且局限透明。