---
title: "Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction"
title_zh: "超越语义相似性：通过直接语料交互重新思考代理搜索中的检索"
arxiv_id: "2605.05242"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.05242.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 超越语义相似性：通过直接语料交互重新思考代理搜索中的检索

## 一句话定位

提出直接语料交互（DCI）作为代理搜索的新检索范式，绕过传统检索器，使用终端工具直接操作原始语料，在多个基准上显著提升性能并降低成本。

## 小学生也能听懂

这篇论文提出了一种新方法，让AI代理像人一样直接用命令行工具（如grep、find）在文件中搜索信息，而不是依赖预先建立的搜索引擎。这种方法更灵活，能发现更多隐藏线索，在复杂问答和文档排序任务中表现更好。

## 为什么值得记录

- 挑战了传统检索范式：证明固定top-k检索接口已成为高级代理的瓶颈
- 提出'检索接口分辨率'新概念：强调细粒度访问能力对代理推理的重要性
- 在BrowseComp-Plus上实现11%准确率提升和29.4%成本下降
- 在multi-hop QA上平均准确率达83.0，超越最强基线30.7点
- 在IR排序上平均NDCG@10达68.5，超越最佳基线21.5点

## 核心方法

- 定义直接语料交互（DCI）范式：代理通过终端工具（grep、find、bash等）直接操作原始语料
- 实现两个DCI代理：轻量级DCI-Agent-Lite（基于Pi+GPT-5.4 nano）和强能力DCI-Agent-CC（基于Claude Code+Sonnet 4.6）
- 设计运行时上下文管理策略：包括截断（L1-L2）、压缩（L3）和摘要（L4）四个级别
- 提出轨迹级评估指标：覆盖率（coverage）衡量是否找到相关文档，定位度（localization）衡量在文档内精确定位证据的能力
- 在BrowseComp-Plus、multi-hop QA和IR排序三类基准上进行端到端评估
- 进行控制消融实验：分析搜索模式、证据使用、语料规模等因素的影响

## 关键结果

- BrowseComp-Plus：DCI-Agent-CC准确率80.0%，比Qwen3-Embedding-8B检索器高11.0点，成本降低29.4%
- Multi-hop QA：DCI-Agent-CC平均准确率83.0，比最强检索代理ASearcher-Local-14B高30.7点
- IR排序：DCI-Agent-CC平均NDCG@10为68.5，比最强基线ReasonRank-32B高21.5点
- DCI-Agent-Lite（轻量版）在所有基准上也持续优于传统检索方法
- 轨迹分析显示DCI优势主要来自将已发现证据转化为更精细的局部搜索和验证步骤
- 即使在高度受限的工具配置下，DCI仍能保持优势

## 局限与风险

- 依赖强大的语言模型：DCI效果随代理能力增强而提升，对弱模型可能不适用
- 上下文管理挑战：长期搜索中需要精心设计截断、压缩和摘要策略
- 语料格式敏感性：对非结构化或异构语料的处理效果可能受限
- 计算成本权衡：虽然API成本降低，但可能需要更多token进行细粒度搜索
- 评估指标局限：现有覆盖率/定位度指标可能无法完全捕捉DCI的优势

## 适合沉淀的概念

`direct-corpus-interaction`, `retrieval-interface-resolution`, `agentic-search`, `terminal-based-retrieval`, `context-management`, `trajectory-analysis`, `multi-hop-qa`, `browsecomp-plus`

## 阅读注意

- 重点关注DCI与传统检索范式的根本区别：不是更好的检索器，而是更好的接口设计
- 注意两个DCI实现（Lite vs CC）的对比，理解运行时支持对性能的影响
- 仔细分析轨迹级指标（coverage/localization）的设计动机和计算方式
- 关注消融实验结果，特别是当检索器已找到黄金文档时DCI仍具优势的现象
- 考虑DCI在现实代理工作空间（如本地、异构、持续演化的语料）中的应用潜力

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.05242.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含详细的方法描述、实验设置、结果分析和消融研究。提供了具体的数据对比和实现细节，结论有充分证据支持。
