Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction
论文导读
提出直接语料交互(DCI)作为代理搜索的新检索范式,绕过传统检索器,使用终端工具直接操作原始语料,在多个基准上显著提升性能并降低成本。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
超越语义相似性:通过直接语料交互重新思考代理搜索中的检索
一句话定位
提出直接语料交互(DCI)作为代理搜索的新检索范式,绕过传统检索器,使用终端工具直接操作原始语料,在多个基准上显著提升性能并降低成本。
小学生也能听懂
这篇论文提出了一种新方法,让AI代理像人一样直接用命令行工具(如grep、find)在文件中搜索信息,而不是依赖预先建立的搜索引擎。这种方法更灵活,能发现更多隐藏线索,在复杂问答和文档排序任务中表现更好。
为什么值得记录
- 挑战了传统检索范式:证明固定top-k检索接口已成为高级代理的瓶颈
- 提出'检索接口分辨率'新概念:强调细粒度访问能力对代理推理的重要性
- 在BrowseComp-Plus上实现11%准确率提升和29.4%成本下降
- 在multi-hop QA上平均准确率达83.0,超越最强基线30.7点
- 在IR排序上平均NDCG@10达68.5,超越最佳基线21.5点
核心方法
- 定义直接语料交互(DCI)范式:代理通过终端工具(grep、find、bash等)直接操作原始语料
- 实现两个DCI代理:轻量级DCI-Agent-Lite(基于Pi+GPT-5.4 nano)和强能力DCI-Agent-CC(基于Claude Code+Sonnet 4.6)
- 设计运行时上下文管理策略:包括截断(L1-L2)、压缩(L3)和摘要(L4)四个级别
- 提出轨迹级评估指标:覆盖率(coverage)衡量是否找到相关文档,定位度(localization)衡量在文档内精确定位证据的能力
- 在BrowseComp-Plus、multi-hop QA和IR排序三类基准上进行端到端评估
- 进行控制消融实验:分析搜索模式、证据使用、语料规模等因素的影响
关键结果
- BrowseComp-Plus:DCI-Agent-CC准确率80.0%,比Qwen3-Embedding-8B检索器高11.0点,成本降低29.4%
- Multi-hop QA:DCI-Agent-CC平均准确率83.0,比最强检索代理ASearcher-Local-14B高30.7点
- IR排序:DCI-Agent-CC平均NDCG@10为68.5,比最强基线ReasonRank-32B高21.5点
- DCI-Agent-Lite(轻量版)在所有基准上也持续优于传统检索方法
- 轨迹分析显示DCI优势主要来自将已发现证据转化为更精细的局部搜索和验证步骤
- 即使在高度受限的工具配置下,DCI仍能保持优势
局限与风险
- 依赖强大的语言模型:DCI效果随代理能力增强而提升,对弱模型可能不适用
- 上下文管理挑战:长期搜索中需要精心设计截断、压缩和摘要策略
- 语料格式敏感性:对非结构化或异构语料的处理效果可能受限
- 计算成本权衡:虽然API成本降低,但可能需要更多token进行细粒度搜索
- 评估指标局限:现有覆盖率/定位度指标可能无法完全捕捉DCI的优势
适合沉淀的概念
direct-corpus-interaction, retrieval-interface-resolution, agentic-search, terminal-based-retrieval, context-management, trajectory-analysis, multi-hop-qa, browsecomp-plus
阅读注意
- 重点关注DCI与传统检索范式的根本区别:不是更好的检索器,而是更好的接口设计
- 注意两个DCI实现(Lite vs CC)的对比,理解运行时支持对性能的影响
- 仔细分析轨迹级指标(coverage/localization)的设计动机和计算方式
- 关注消融实验结果,特别是当检索器已找到黄金文档时DCI仍具优势的现象
- 考虑DCI在现实代理工作空间(如本地、异构、持续演化的语料)中的应用潜力
质量说明
- 采用来源:
raw,raw/papers/2026/05/2605.05242.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含详细的方法描述、实验设置、结果分析和消融研究。提供了具体的数据对比和实现细节,结论有充分证据支持。