---
title: "2604.00824"
title_zh: "更少即是更多：面向智能体、推理与代码 LLM 的高效训练框架"
arxiv_id: "2604.00824"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.00824.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# 更少即是更多：面向智能体、推理与代码 LLM 的高效训练框架

## 一句话定位

提出 STITCH 框架，通过粗到细的轨迹筛选机制，在减少训练数据量的同时提升智能体在代码修复任务中的表现，验证了“少即是多”范式在代理任务中的有效性。

## 小学生也能听懂

这篇论文发明了一个叫STITCH的方法，像“淘金”一样从大量代码练习中挑出最有用的少量例子来训练AI，结果AI学得更好、更快，还能修好更多真实代码问题，证明“少而精”比“多而杂”更有效。

## 为什么值得记录

- 解决了传统代码智能体训练中数据构建成本高、效率低的问题
- 首次将“少即是多”假设从纯数学推理扩展至代码与智能体任务，并在多语言、多模型规模下验证其普适性
- 提出的 STITCH 方法在 SWE-bench Verified 上实现高达 63.16% 的相对性能提升
- 在低资源语言 ArkTS 上仅用不到 1K 条高质量轨迹即显著提升编译通过率（+43.34%）

## 核心方法

- 构建端到端训练流水线 SandForge，支持从 GitHub 真实问题构造可执行任务，并统一执行、评估与数据留存
- 提出 STITCH 两阶段轨迹筛选机制：宏观层面使用逻辑回归模型基于自动发现的智能体特征进行预筛选；微观层面采用 LLM 作为评判器，结合滑动记忆机制的 Map-Reduce 范式进行语义分段与质量评分
- 设计启发式安全分割点（safe-split）策略，避免在动作-观察边界处切断上下文，保持语义连贯性
- 引入特征提取代理（Feature Extraction Agent），自动发现四类关键特征：代码产出、工具使用、效率和错误恢复能力
- 通过二元分类任务拟合各特征权重，实现数据驱动的质量评估模型
- 支持多语言（Python/Java/ArkTS）与多模型规模（30B–355B）训练，适配不同智能体架构（如 MSWE-agent、CodeArts-Agent）

## 关键结果

- 在 SWE-bench Verified 上，STITCH 训练模型相比基线模型最高提升 63.16% 相对性能
- 在 Multi-SWE-bench (Java) 上，MiniMax-M2.5-STITCH 达到 43.75% 解决率，使用 CodeArts Agent 框架进一步提升 16.67%，达到开源模型 SOTA 水平
- 在 HarmonyOS (ArkTS) 上，GLM-4.7-STITCH 仅用约 1K 条训练轨迹，将编译通过率从 42.77% 提升至 61.31%（+18.54pp），预览通过率提升至 44.05%（+12.51pp）
- 分析显示训练后模型显著减少对 any 类型的使用，更好地遵守 ArkTS 静态类型约束
- 案例研究表明，训练后模型不仅生成可编译代码，还能输出视觉更优、布局合理的 UI 界面

## 局限与风险

- STITCH 在超大规模模型（>200B）上的提升幅度相对有限，可能因这些模型已接近性能饱和
- 微观语义分析依赖 LLM 评判器，存在一定计算开销与潜在偏见风险
- ArkTS 实验中依赖人工设计的两阶段验证流程（编译 + 多模态预览），自动化程度有待提高
- 未与强化学习等其它训练范式进行深度融合，仅聚焦于监督微调场景

## 适合沉淀的概念

`less-is-more-hypothesis`, `agentic-abilities`, `trajectory-curation`, `sliding-memory-mechanism`, `map-reduce-evaluation`, `safe-split-points`, `feature-extraction-agent`, `code-agent-training`, `swe-bench`, `arkts-type-constraints`

## 阅读注意

- 重点关注 STITCH 如何结合统计模型与 LLM 评判器实现高效轨迹过滤
- 注意 SandForge 框架如何将一次执行同时用于评估与数据构造，体现‘执行即数据’的设计理念
- 观察不同模型规模下 STITCH 的效果差异，理解‘少即是多’的适用范围边界
- ArkTS 实验部分展示了方法在低资源语言上的泛化能力，是验证语言无关性的关键证据

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.00824.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、多维度结果与案例分析，方法描述清晰，数据充分，具备可复现性基础。
