---
title: "2601.18282"
title_zh: "思维增强函数调用：通过内嵌推理提升LLM参数准确性"
arxiv_id: "2601.18282"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/01/2601.18282.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 思维增强函数调用：通过内嵌推理提升LLM参数准确性

## 一句话定位

提出Think-Augmented Function Calling (TAFC)框架，通过在函数签名中引入显式推理参数，提升大语言模型在复杂多参数函数调用中的准确性与可解释性。

## 小学生也能听懂

这篇论文教AI在调用工具前先“想一想”，就像做数学题先写步骤一样。它在函数里加了个“思考”框，让AI说出为什么选这个参数，这样出错更少，尤其对复杂任务和小模型帮助更大，而且不用改原有系统。

## 为什么值得记录

- 解决了现有函数调用缺乏参数级推理透明度的关键问题，尤其适用于多参数、参数间存在依赖关系的复杂API调用场景
- 无需修改LLM架构或破坏现有API兼容性，可直接部署于主流代理框架（如ReAct）
- 在ToolBench基准测试中，TAFC在多个开源与闭源模型上均显著提升Pass Rate（最高+2.5%）和Win Rate（最高+3.1%）
- 通过结构化推理输出增强了AI代理行为的可调试性与人类对齐能力

## 核心方法

- 在函数签名中引入通用'think'参数，强制模型在生成参数前输出推理过程，形成因果链：P(think|x,C) → P(P|x,C,think)
- 对复杂参数（基于依赖度、类型复杂度、约束严格性评分）自动触发参数级细粒度推理，将参数表示为{think_i: r_i, value_i: v_i}元组
- 采用动态描述优化机制，包括离散prompt调优（使用元LLM迭代优化think参数描述）和连续token嵌入学习（H_think ∈ R^{L×d}）
- 提出推理引导的工具描述优化（reasoning-guided tool description optimization），通过语义、逻辑、动作三重损失函数（L_align = λ1L_sem + λ2L_logic + λ3L_action）对齐生成推理与人类期望
- 实现无缝集成：自动注册增强函数 f'_registered = f_original ∪ {think: str, optional: true}，并通过过滤函数F提取纯参数值执行原函数
- 构建推理轨迹仓库H_t用于持续改进，记录(x_t, f_t, r_t, θ_t, outcome_t)五元组

## 关键结果

- 在ToolBench的I1/I2/I3三类任务上，TAFC平均提升Pass Rate 1.6–2.5%，Win Rate 2.1–3.1%，小模型（如Llama-3.1-8B）获益更显著
- 参数质量评估显示TAFC胜率达69.6%（平均），尤其在小型模型上表现突出（Llama-3.1-8B达76.1%），错误遗漏减少38%
- 复杂任务（I3-Inst）相对提升更大，表明结构化推理对跨域工具协同更具价值
- GPT-4o + TAFC达到59.2%平均Pass Rate和71.4% Win Rate；Claude-3.5-Sonnet + TAFC达60.3%/72.2%
- Qwen2.5-72B + TAFC缩小与专有模型差距，Pass Rate达49.0%

## 局限与风险

- 对简单单参数函数可能引入过度推理，导致18.2%情况下标准FC仍优于TAFC
- 依赖外部LLM（如GPT-4o）作为judge进行Win Rate评估，可能存在偏差
- 复杂度评分ψ依赖启发式权重（α1,α2,α3），需针对具体工具集调优
- 未报告推理开销（延迟/Token成本）的具体数据，影响实际部署评估

## 适合沉淀的概念

`function-calling`, `reasoning-transparency`, `parameter-interdependency`, `tool-use`, `chain-of-thought`, `react-framework`, `toolbench`, `dynamic-prompt-optimization`

## 阅读注意

- 关注公式(2)和(5)中联合概率的分解方式，体现‘先推理后参数’的因果结构
- 注意复杂度评分ψ的设计：dep, type, constraint三项归一化后加权，阈值τ=0.6触发细粒度推理
- Table 2中‘Tie’比例较低（~12%），说明LLM judge能有效区分参数质量差异
- Section 2.5强调向后兼容性：think参数设为optional，执行时由F过滤，确保不影响原有API

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/01/2601.18282.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述清晰，实验覆盖多模型多任务，数据详实（含标准差），消融与对比充分，结论有支撑。
