---
title: "Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses"
title_zh: "Agentic Harness Engineering：基于可观测性的编码智能体 Harness 自动演化"
arxiv_id: "2604.25850"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.25850.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Agentic Harness Engineering：基于可观测性的编码智能体 Harness 自动演化

## 一句话定位

提出 Agentic Harness Engineering (AHE)，一个基于三层可观测性（组件、经验、决策）的闭环系统，用于自动演化编码智能体的 harness，无需人工干预即可提升任务成功率并实现跨基准和模型迁移。

## 小学生也能听懂

这篇论文像教机器人自己修代码工具包：它造了个“智能教练”，通过观察机器人写代码时的动作、错误和决定，自动调整工具、提示和记忆，让机器人越写越好，还能把学到的经验搬到别的机器人身上用。

## 为什么值得记录

- Harness 设计对编码智能体性能有显著影响，但当前依赖手动调优，难以跟上基础模型快速迭代
- AHE 首次实现全组件（prompt、工具、中间件、记忆等）联合自动演化，突破以往仅优化单一组件的局限
- 通过可观测性驱动的设计，将每次编辑转化为可验证的契约，避免盲目试错，提升演化稳定性
- 实验证明 AHE 在 Terminal-Bench 2 上 pass@1 从 69.7% 提升至 77.0%，超越人类设计和现有自演化基线
- 演化后的 harness 可零样本迁移至 SWE-bench-verified 和多个不同家族的基础模型，显示其编码的是通用工程经验而非过拟合

## 核心方法

- 构建 NexAU 解耦 harness 框架，将七类可编辑组件（系统提示、工具描述、工具实现、中间件、技能、子代理配置、长期记忆）暴露为独立文件，实现组件级可观测性与原子化回滚
- 引入 Agent Debugger 框架，将海量轨迹 token 蒸馏为分层证据语料库（每任务分析报告 + 基准级概览），支持 drill-down 式根因分析，实现经验可观测性
- 设计 Evolve Agent，基于证据语料库进行 harness 编辑，并通过变更清单（change manifest）记录每次编辑的预测修复与潜在回归，实现决策可观测性
- 建立闭环迭代流程：运行 → 清理 → 归因（验证上一轮预测）→ 蒸馏 → 编辑 → 提交，每轮自动回退未达预期效果的编辑
- 采用最小种子 harness（仅含 shell 工具）启动演化，确保所有增益均来自 AHE 自身迭代
- 通过 k≥2 次 rollout 提供任务级通过率信号，增强比较诊断稳定性

## 关键结果

- 在 Terminal-Bench 2 上，10 轮 AHE 迭代将 pass@1 从种子 69.7% 提升至 77.0%，优于人类设计的 Codex-CLI (71.9%) 和自演化基线 ACE (68.9%)、TF-GRPO (72.3%)
- AHE 在 SWE-bench-verified 上实现最高聚合成功率 (75.6%)，且比 ACE 节省 32% token，证明其结构编码优于 prompt-only 方法
- 跨模型迁移测试中，AHE harness 在 deepseek-v4-flash (+10.1pp)、qwen-3.6-plus (+6.3pp)、gemini-3.1-flash-lite-preview (+5.1pp) 上均带来显著增益，表明其对非饱和模型更具价值
- 组件消融显示：工具 (+3.3pp)、中间件 (+2.2pp)、长期记忆 (+5.6pp) 单独引入即带来增益，而仅替换系统提示导致 -2.3pp 回归，说明 factual 结构可迁移而 prose 策略不可
- 归因分析表明：演化代理对修复的预测精度达 33.7%，召回率 51.4%，显著高于随机基线；但对回归的预测能力弱（精度 11.8%，召回 11.1%），揭示‘回归盲区’是关键改进方向

## 局限与风险

- 评估范围限于 Terminal-Bench 2 和 SWE-bench-verified，未覆盖更广泛的编程语言、仓库级部署或人机协同场景
- 演化过程针对 GPT-5.4 high 推理设置调优，跨模型迁移结果受 step budget 和 timeout 耦合影响，存在非单调性（如 xhigh 推理下增益下降）
- 虽通过工作空间隔离和变更清单实现基础治理，但缺乏长期 harness 清理机制和强 misuse 防护，尚属研究原型

## 适合沉淀的概念

`agentic-harness-engineering`, `observability-driven-evolution`, `decoupled-harness-architecture`, `layered-trajectory-evidence`, `change-manifest`, `self-attribution-loop`, `component-ablation`, `cross-model-transfer`

## 阅读注意

- 重点关注第 3 节中三个可观测性支柱的具体实现机制，尤其是 NexAU 框架如何解耦组件以及 Agent Debugger 如何蒸馏轨迹
- 第 4.4.1 节的组件消融实验揭示了 harness 增益的实际来源，挑战了‘prompt 主导’的传统认知
- 图 4 和附录 D 展示了自归因的可靠性差异，是研究自改进系统的重要洞见
- 附录 C 的四个案例研究（db-wal-recovery, path-tracing, mcmc-sampling-stan, configure-git-webserver）具体展示了 harness 变更如何修复特定失败模式
- 注意 AHE 与 ACE/TF-GRPO 的根本区别：前者演化完整 harness，后者仅优化 prompt 或轨迹分布

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.25850.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法、实验、消融、案例和附录，数据详实，结构清晰，结论有充分支撑。
