论文
arXiv2604.00824
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级81 分钟

2604.00824

论文导读

提出 STITCH 框架,通过粗到细的轨迹筛选机制,在减少训练数据量的同时提升智能体在代码修复任务中的表现,验证了“少即是多”范式在代理任务中的有效性。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

更少即是更多:面向智能体、推理与代码 LLM 的高效训练框架

一句话定位

提出 STITCH 框架,通过粗到细的轨迹筛选机制,在减少训练数据量的同时提升智能体在代码修复任务中的表现,验证了“少即是多”范式在代理任务中的有效性。

小学生也能听懂

这篇论文发明了一个叫STITCH的方法,像“淘金”一样从大量代码练习中挑出最有用的少量例子来训练AI,结果AI学得更好、更快,还能修好更多真实代码问题,证明“少而精”比“多而杂”更有效。

为什么值得记录

  • 解决了传统代码智能体训练中数据构建成本高、效率低的问题
  • 首次将“少即是多”假设从纯数学推理扩展至代码与智能体任务,并在多语言、多模型规模下验证其普适性
  • 提出的 STITCH 方法在 SWE-bench Verified 上实现高达 63.16% 的相对性能提升
  • 在低资源语言 ArkTS 上仅用不到 1K 条高质量轨迹即显著提升编译通过率(+43.34%)

核心方法

  • 构建端到端训练流水线 SandForge,支持从 GitHub 真实问题构造可执行任务,并统一执行、评估与数据留存
  • 提出 STITCH 两阶段轨迹筛选机制:宏观层面使用逻辑回归模型基于自动发现的智能体特征进行预筛选;微观层面采用 LLM 作为评判器,结合滑动记忆机制的 Map-Reduce 范式进行语义分段与质量评分
  • 设计启发式安全分割点(safe-split)策略,避免在动作-观察边界处切断上下文,保持语义连贯性
  • 引入特征提取代理(Feature Extraction Agent),自动发现四类关键特征:代码产出、工具使用、效率和错误恢复能力
  • 通过二元分类任务拟合各特征权重,实现数据驱动的质量评估模型
  • 支持多语言(Python/Java/ArkTS)与多模型规模(30B–355B)训练,适配不同智能体架构(如 MSWE-agent、CodeArts-Agent)

关键结果

  • 在 SWE-bench Verified 上,STITCH 训练模型相比基线模型最高提升 63.16% 相对性能
  • 在 Multi-SWE-bench (Java) 上,MiniMax-M2.5-STITCH 达到 43.75% 解决率,使用 CodeArts Agent 框架进一步提升 16.67%,达到开源模型 SOTA 水平
  • 在 HarmonyOS (ArkTS) 上,GLM-4.7-STITCH 仅用约 1K 条训练轨迹,将编译通过率从 42.77% 提升至 61.31%(+18.54pp),预览通过率提升至 44.05%(+12.51pp)
  • 分析显示训练后模型显著减少对 any 类型的使用,更好地遵守 ArkTS 静态类型约束
  • 案例研究表明,训练后模型不仅生成可编译代码,还能输出视觉更优、布局合理的 UI 界面

局限与风险

  • STITCH 在超大规模模型(>200B)上的提升幅度相对有限,可能因这些模型已接近性能饱和
  • 微观语义分析依赖 LLM 评判器,存在一定计算开销与潜在偏见风险
  • ArkTS 实验中依赖人工设计的两阶段验证流程(编译 + 多模态预览),自动化程度有待提高
  • 未与强化学习等其它训练范式进行深度融合,仅聚焦于监督微调场景

适合沉淀的概念

less-is-more-hypothesis, agentic-abilities, trajectory-curation, sliding-memory-mechanism, map-reduce-evaluation, safe-split-points, feature-extraction-agent, code-agent-training, swe-bench, arkts-type-constraints

阅读注意

  • 重点关注 STITCH 如何结合统计模型与 LLM 评判器实现高效轨迹过滤
  • 注意 SandForge 框架如何将一次执行同时用于评估与数据构造,体现‘执行即数据’的设计理念
  • 观察不同模型规模下 STITCH 的效果差异,理解‘少即是多’的适用范围边界
  • ArkTS 实验部分展示了方法在低资源语言上的泛化能力,是验证语言无关性的关键证据

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.00824.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、多维度结果与案例分析,方法描述清晰,数据充分,具备可复现性基础。