---
title: ""
title_zh: "推理时反馈增强工具调用代理"
arxiv_id: "2604.27233"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.27233.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 推理时反馈增强工具调用代理

## 一句话定位

提出一种推理时反馈机制，通过独立评审代理在工具调用执行前评估并修正主代理的决策，提升工具调用准确率而不需重新训练模型。

## 小学生也能听懂

就像一个学生做题前先让老师检查草稿，这个系统让主AI在调用工具前先请另一个AI‘老师’检查一下是否正确。如果错了就改，对了就直接执行。这样能减少错误，尤其是避免执行后无法挽回的操作。

## 为什么值得记录

- 首次在推理阶段将评估嵌入执行循环，实现主动纠错而非事后恢复
- 提出Helpfulness-Harmfulness指标量化反馈的收益与风险，为评审代理设计提供依据
- 在BFCL和τ²-Bench上分别提升5.5%和7.1%，验证方法有效性
- 支持模块化部署，无需修改现有工具调用流水线即可增强可靠性

## 核心方法

- 采用双代理架构：主执行代理（GPT-4o）生成工具调用，评审代理（o3-mini/GPT-5 mini）在调用前评估
- 支持三种反馈机制：渐进式反馈（rN）、N选1选择（sN）、N选1评分（gN）
- 引入Helpfulness-Harmfulness指标：帮助性 = 修正错误的比例，危害性 = 破坏正确响应的比例
- 使用GEPA算法自动优化评审代理提示词，基于失败案例迭代改进
- 评审代理仅接收上下文和工具文档，不接触外部知识，确保判断客观

## 关键结果

- BFCL不可检测类别准确率从84.9%提升至90.4%（+5.5%）
- τ²-Bench多轮任务平均通过率从48.7%提升至55.8%（+7.1%）
- o3-mini作为评审代理时，帮助性达36.8%，危害性仅11.7%，收益风险比3.1:1
- GEPA优化提示词带来额外+1.5%（相关性）和+2.8%（不可检测）提升
- 渐进式反馈机制在不可检测任务上显著优于Best-of-N方法（+4~5%）

## 局限与风险

- 单轮场景下延迟增加6.2倍（1.27s → 7.87s），可能不适用于实时高吞吐应用
- 评审代理仍可能引入新错误，尤其在跨基准迁移时（如BFCL提示用于τ²-Bench会失效）
- 自动化提示优化目前仅应用于BFCL，τ²-Bench仍需手动调优
- 依赖闭源商业模型（GPT-4o、o3-mini等），开源替代方案效果未验证

## 适合沉淀的概念

`inference-time-feedback`, `tool-calling-agent`, `helpfulness-harmfulness-metric`, `progressive-feedback`, `best-of-n-selection`, `automated-prompt-optimization`, `multi-agent-architecture`, `bfcl-benchmark`, `tau2-bench`

## 阅读注意

- 重点关注Helpfulness-Harmfulness指标的定义和计算方式，这是评估反馈质量的核心
- 注意评审代理与主代理的职责分离设计，避免自我反馈的上下文管理难题
- GEPA优化后的提示词长度增长4.5倍，说明复杂任务需要更精细的指令设计
- 延迟分析显示多轮场景下开销相对更低（2.4x vs 6.2x），影响部署策略选择

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.27233.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、多基准结果和详细附录，包括提示词示例和延迟数据，信息充分可复现。
