---
title: ""
title_zh: "HeavySkill：将深度思考作为智能体框架的内在技能"
arxiv_id: "2605.02396"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/05/2605.02396.md"
generated: "2026-05-12"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# HeavySkill：将深度思考作为智能体框架的内在技能

## 一句话定位

提出 HeavySkill，将复杂推理任务中的“深度思考”抽象为可复用的两阶段技能（并行推理 + 顺序审议），并通过实验验证其在 STEM 和通用任务中优于传统 BoN 策略，且可通过强化学习进一步优化。

## 小学生也能听懂

这篇论文教大模型像人类团队一样思考：先让多个‘小脑子’同时独立解题，再把它们的答案交给一个‘总结员’分析，找出最合理的答案。这种方法比只选多数答案更好，还能通过训练让模型越来越聪明。

## 为什么值得记录

- 首次系统性地将 agentic harness 中的 orchestration 机制抽象为 LLM 的内在技能（inner skill），提升可解释性和可复用性
- 提出训练无关的两阶段框架（并行推理 + 顺序审议），在多个 STEM 基准上显著优于 Mean@K、Vote@K 等基线
- 发现强模型在顺序审议中可逼近甚至超越 Pass@K 上限，表明审议过程能合成新解而非仅选择已有答案
- 验证了 RLVR 可同时优化推理广度（并行生成）与深度（审议），为自进化 LLM 提供路径

## 核心方法

- 将深度思考分解为两个独立阶段：并行推理生成 K 条轨迹，顺序审议模型基于序列化记忆缓存进行综合判断
- 引入序列化记忆缓存机制，对轨迹剪枝并打乱顺序以避免位置偏差，作为审议阶段的输入上下文
- 支持迭代审议，允许模型基于前轮输出反复修正推理结果
- 将整个流程封装为可读技能文件（HeavySkill），包含激活条件、并行协议、审议提示和输出约束，可在不同 harness 中即插即用
- 默认使用相同模型执行两阶段，但实验证明跨模型协作同样有效
- 设计 Heavy-Mean@K 和 Heavy-Pass@K 指标评估审议后性能

## 关键结果

- 在 AIME25、HMMT25-Feb 等 STEM 任务上，HM@4 平均比 M@K 高 3-10%，且强模型（如 GPT-5-Thinking）可达 96.7% 以上准确率
- Heavy-Pass@K 在 50% 实验中超过原始 Pass@K，表明审议能生成原本未出现的正确答案
- 在 LiveCodeBench 和 IFEval 等客观任务上，HM@4 显著优于 M@K（如 GPT-OSS-20B 从 69.7% → 85.5%）
- 在 Arena-Hard 等主观任务上增益有限，说明审议对偏好对齐类任务效果较弱
- 消融实验显示轨迹多样性与质量是关键，Max-Answer-Num 选择策略最优；审议阶段更依赖模型的综合分析能力而非原始推理能力

## 局限与风险

- 审议阶段性能受记忆缓存长度限制，长上下文可能导致截断或训练不稳定（如 K=16 时熵崩溃）
- 当前技能依赖前沿 LLM 的上下文学习能力，在弱模型上可能失效
- 未探索不同任务类型的最佳 K 值与迭代次数，超参敏感
- RLVR 优化仍处于初步阶段，需进一步解决训练稳定性问题

## 适合沉淀的概念

`heavy-thinking`, `agentic-harness`, `parallel-reasoning`, `sequential-deliberation`, `test-time-scaling`, `reinforcement-learning-from-verifiable-rewards`, `inner-skill`, `memory-cache`

## 阅读注意

- 关注图 1 的两阶段架构图和图 7 的审议提示设计，这是理解 HeavySkill 核心的关键
- 注意表 1 中 HP@4 > P@K 的现象，这是审议能‘创造’新解的重要证据
- 图 3 显示弱模型作审议者仍可提升性能，说明该技能具有模型无关性
- 附录 B 的 RLVR 实验表明未来可通过训练进一步释放潜力，但需注意序列长度限制

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/05/2605.02396.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、多维度结果和深入分析，包含消融实验与跨模型验证，数据充分且结论有支撑。
