---
title: "2412.07017"
title_zh: "AsyncLM：异步 LLM 函数调用系统"
arxiv_id: "2412.07017"
paper_type: "system"
source_kind: "raw"
raw_path: "raw/papers/2024/12/2412.07017.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# AsyncLM：异步 LLM 函数调用系统

## 一句话定位

提出 AsyncLM 系统，通过中断机制和 CML 语言实现 LLM 与函数执行器的异步交互，提升任务完成效率。

## 小学生也能听懂

这篇论文发明了一个叫AsyncLM的系统，就像让大脑一边想问题一边查资料，不用等查完再想，通过特殊信号和规则让大模型边生成答案边调用工具，速度提升1.6到5.4倍。

## 为什么值得记录

- 当前 LLM 函数调用为同步模式，阻塞推理过程，资源利用率低
- AsyncLM 支持函数调用与 token 生成并发执行，减少端到端延迟
- 引入中断机制和领域专用语言 CML，解决异步协调与上下文恢复问题
- 在 Berkeley 函数调用基准测试中实现 1.6–5.4 倍加速
- 无需预知函数依赖图即可实现自动并行化

## 核心方法

- 设计 Context Markup Language (CML)，使用 [CALL]、[INTR]、[TRAP] 等控制块表示函数调用与中断
- 实现中断管理器，在函数执行完成后向 LLM 的 token 流中注入中断信息
- 采用关键段（critical section）机制防止中断破坏正在生成的函数调用语法
- 提出陷阱（trap）机制，允许 LLM 主动暂停生成以等待依赖结果
- 基于最长处理时间优先（LPT）策略训练 LLM 决策函数调用顺序
- 构建模拟训练数据集，注入随机执行时间和中断事件用于微调
- 在 Llama-3.2 上微调，并在 GPT-4o 上通过上下文学习验证可行性

## 关键结果

- 在 BFCL 基准测试中，AsyncLM 相比同步顺序调用提速 1.6–5.4 倍
- 相比同步并行调用，仍可实现最高 2.1 倍加速
- 在本地部署（Llama-3.2）和云端（GPT-4o）均有效
- 函数调用准确率与同步方法持平，未因异步机制下降
- 理论分析证明 LPT 调度策略在异步模式下最优

## 局限与风险

- 中断注入依赖对 LLM 推理过程的低级访问，难以直接应用于封闭 API
- CML 语法需模型学习，增加训练复杂度
- 当前实现假设函数执行时间可估计，实际中可能不准
- 多任务并行时中断频率高，可能影响生成稳定性

## 适合沉淀的概念

`asynchronous-function-calling`, `interrupt-mechanism`, `context-markup-language-cml`, `llm-serving-system`, `function-calling-optimization`, `kv-cache-management`, `lpt-scheduling`, `berkeley-function-calling-leaderboard`

## 阅读注意

- 关注 CML 的语法设计与中断/陷阱的语义定义
- 注意关键段机制如何避免中断破坏生成中的函数调用
- 理解 LPT 策略为何能最大化生成与执行的重叠
- 比较 Async 与 Async-Naive 实现方式的差异及性能差距
- 查看实验中对‘作弊表’的使用以消除准确性偏差

## 质量说明

- 采用来源：`raw`，`raw/papers/2024/12/2412.07017.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的方法设计、实现细节、实验设置与理论分析，数据充分，结构清晰，具备可复现性。
