Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
论文导读
提出 Agentic Harness Engineering (AHE),一个基于三层可观测性(组件、经验、决策)的闭环系统,用于自动演化编码智能体的 harness,无需人工干预即可提升任务成功率并实现跨基准和模型迁移。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Agentic Harness Engineering:基于可观测性的编码智能体 Harness 自动演化
一句话定位
提出 Agentic Harness Engineering (AHE),一个基于三层可观测性(组件、经验、决策)的闭环系统,用于自动演化编码智能体的 harness,无需人工干预即可提升任务成功率并实现跨基准和模型迁移。
小学生也能听懂
这篇论文像教机器人自己修代码工具包:它造了个“智能教练”,通过观察机器人写代码时的动作、错误和决定,自动调整工具、提示和记忆,让机器人越写越好,还能把学到的经验搬到别的机器人身上用。
为什么值得记录
- Harness 设计对编码智能体性能有显著影响,但当前依赖手动调优,难以跟上基础模型快速迭代
- AHE 首次实现全组件(prompt、工具、中间件、记忆等)联合自动演化,突破以往仅优化单一组件的局限
- 通过可观测性驱动的设计,将每次编辑转化为可验证的契约,避免盲目试错,提升演化稳定性
- 实验证明 AHE 在 Terminal-Bench 2 上 pass@1 从 69.7% 提升至 77.0%,超越人类设计和现有自演化基线
- 演化后的 harness 可零样本迁移至 SWE-bench-verified 和多个不同家族的基础模型,显示其编码的是通用工程经验而非过拟合
核心方法
- 构建 NexAU 解耦 harness 框架,将七类可编辑组件(系统提示、工具描述、工具实现、中间件、技能、子代理配置、长期记忆)暴露为独立文件,实现组件级可观测性与原子化回滚
- 引入 Agent Debugger 框架,将海量轨迹 token 蒸馏为分层证据语料库(每任务分析报告 + 基准级概览),支持 drill-down 式根因分析,实现经验可观测性
- 设计 Evolve Agent,基于证据语料库进行 harness 编辑,并通过变更清单(change manifest)记录每次编辑的预测修复与潜在回归,实现决策可观测性
- 建立闭环迭代流程:运行 → 清理 → 归因(验证上一轮预测)→ 蒸馏 → 编辑 → 提交,每轮自动回退未达预期效果的编辑
- 采用最小种子 harness(仅含 shell 工具)启动演化,确保所有增益均来自 AHE 自身迭代
- 通过 k≥2 次 rollout 提供任务级通过率信号,增强比较诊断稳定性
关键结果
- 在 Terminal-Bench 2 上,10 轮 AHE 迭代将 pass@1 从种子 69.7% 提升至 77.0%,优于人类设计的 Codex-CLI (71.9%) 和自演化基线 ACE (68.9%)、TF-GRPO (72.3%)
- AHE 在 SWE-bench-verified 上实现最高聚合成功率 (75.6%),且比 ACE 节省 32% token,证明其结构编码优于 prompt-only 方法
- 跨模型迁移测试中,AHE harness 在 deepseek-v4-flash (+10.1pp)、qwen-3.6-plus (+6.3pp)、gemini-3.1-flash-lite-preview (+5.1pp) 上均带来显著增益,表明其对非饱和模型更具价值
- 组件消融显示:工具 (+3.3pp)、中间件 (+2.2pp)、长期记忆 (+5.6pp) 单独引入即带来增益,而仅替换系统提示导致 -2.3pp 回归,说明 factual 结构可迁移而 prose 策略不可
- 归因分析表明:演化代理对修复的预测精度达 33.7%,召回率 51.4%,显著高于随机基线;但对回归的预测能力弱(精度 11.8%,召回 11.1%),揭示‘回归盲区’是关键改进方向
局限与风险
- 评估范围限于 Terminal-Bench 2 和 SWE-bench-verified,未覆盖更广泛的编程语言、仓库级部署或人机协同场景
- 演化过程针对 GPT-5.4 high 推理设置调优,跨模型迁移结果受 step budget 和 timeout 耦合影响,存在非单调性(如 xhigh 推理下增益下降)
- 虽通过工作空间隔离和变更清单实现基础治理,但缺乏长期 harness 清理机制和强 misuse 防护,尚属研究原型
适合沉淀的概念
agentic-harness-engineering, observability-driven-evolution, decoupled-harness-architecture, layered-trajectory-evidence, change-manifest, self-attribution-loop, component-ablation, cross-model-transfer
阅读注意
- 重点关注第 3 节中三个可观测性支柱的具体实现机制,尤其是 NexAU 框架如何解耦组件以及 Agent Debugger 如何蒸馏轨迹
- 第 4.4.1 节的组件消融实验揭示了 harness 增益的实际来源,挑战了‘prompt 主导’的传统认知
- 图 4 和附录 D 展示了自归因的可靠性差异,是研究自改进系统的重要洞见
- 附录 C 的四个案例研究(db-wal-recovery, path-tracing, mcmc-sampling-stan, configure-git-webserver)具体展示了 harness 变更如何修复特定失败模式
- 注意 AHE 与 ACE/TF-GRPO 的根本区别:前者演化完整 harness,后者仅优化 prompt 或轨迹分布
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.25850.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法、实验、消融、案例和附录,数据详实,结构清晰,结论有充分支撑。