论文
arXiv2605.05242
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级162 分钟

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

论文导读

提出直接语料交互(DCI)作为代理搜索的新检索范式,绕过传统检索器,使用终端工具直接操作原始语料,在多个基准上显著提升性能并降低成本。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

超越语义相似性:通过直接语料交互重新思考代理搜索中的检索

一句话定位

提出直接语料交互(DCI)作为代理搜索的新检索范式,绕过传统检索器,使用终端工具直接操作原始语料,在多个基准上显著提升性能并降低成本。

小学生也能听懂

这篇论文提出了一种新方法,让AI代理像人一样直接用命令行工具(如grep、find)在文件中搜索信息,而不是依赖预先建立的搜索引擎。这种方法更灵活,能发现更多隐藏线索,在复杂问答和文档排序任务中表现更好。

为什么值得记录

  • 挑战了传统检索范式:证明固定top-k检索接口已成为高级代理的瓶颈
  • 提出'检索接口分辨率'新概念:强调细粒度访问能力对代理推理的重要性
  • 在BrowseComp-Plus上实现11%准确率提升和29.4%成本下降
  • 在multi-hop QA上平均准确率达83.0,超越最强基线30.7点
  • 在IR排序上平均NDCG@10达68.5,超越最佳基线21.5点

核心方法

  • 定义直接语料交互(DCI)范式:代理通过终端工具(grep、find、bash等)直接操作原始语料
  • 实现两个DCI代理:轻量级DCI-Agent-Lite(基于Pi+GPT-5.4 nano)和强能力DCI-Agent-CC(基于Claude Code+Sonnet 4.6)
  • 设计运行时上下文管理策略:包括截断(L1-L2)、压缩(L3)和摘要(L4)四个级别
  • 提出轨迹级评估指标:覆盖率(coverage)衡量是否找到相关文档,定位度(localization)衡量在文档内精确定位证据的能力
  • 在BrowseComp-Plus、multi-hop QA和IR排序三类基准上进行端到端评估
  • 进行控制消融实验:分析搜索模式、证据使用、语料规模等因素的影响

关键结果

  • BrowseComp-Plus:DCI-Agent-CC准确率80.0%,比Qwen3-Embedding-8B检索器高11.0点,成本降低29.4%
  • Multi-hop QA:DCI-Agent-CC平均准确率83.0,比最强检索代理ASearcher-Local-14B高30.7点
  • IR排序:DCI-Agent-CC平均NDCG@10为68.5,比最强基线ReasonRank-32B高21.5点
  • DCI-Agent-Lite(轻量版)在所有基准上也持续优于传统检索方法
  • 轨迹分析显示DCI优势主要来自将已发现证据转化为更精细的局部搜索和验证步骤
  • 即使在高度受限的工具配置下,DCI仍能保持优势

局限与风险

  • 依赖强大的语言模型:DCI效果随代理能力增强而提升,对弱模型可能不适用
  • 上下文管理挑战:长期搜索中需要精心设计截断、压缩和摘要策略
  • 语料格式敏感性:对非结构化或异构语料的处理效果可能受限
  • 计算成本权衡:虽然API成本降低,但可能需要更多token进行细粒度搜索
  • 评估指标局限:现有覆盖率/定位度指标可能无法完全捕捉DCI的优势

适合沉淀的概念

direct-corpus-interaction, retrieval-interface-resolution, agentic-search, terminal-based-retrieval, context-management, trajectory-analysis, multi-hop-qa, browsecomp-plus

阅读注意

  • 重点关注DCI与传统检索范式的根本区别:不是更好的检索器,而是更好的接口设计
  • 注意两个DCI实现(Lite vs CC)的对比,理解运行时支持对性能的影响
  • 仔细分析轨迹级指标(coverage/localization)的设计动机和计算方式
  • 关注消融实验结果,特别是当检索器已找到黄金文档时DCI仍具优势的现象
  • 考虑DCI在现实代理工作空间(如本地、异构、持续演化的语料)中的应用潜力

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.05242.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含详细的方法描述、实验设置、结果分析和消融研究。提供了具体的数据对比和实现细节,结论有充分证据支持。