论文
arXiv2605.02396
时间2026-05
来源Markdown
页面质量中文卡片
阅读量级88 分钟

论文导读

提出 HeavySkill,将复杂推理任务中的“深度思考”抽象为可复用的两阶段技能(并行推理 + 顺序审议),并通过实验验证其在 STEM 和通用任务中优于传统 BoN 策略,且可通过强化学习进一步优化。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

HeavySkill:将深度思考作为智能体框架的内在技能

一句话定位

提出 HeavySkill,将复杂推理任务中的“深度思考”抽象为可复用的两阶段技能(并行推理 + 顺序审议),并通过实验验证其在 STEM 和通用任务中优于传统 BoN 策略,且可通过强化学习进一步优化。

小学生也能听懂

这篇论文教大模型像人类团队一样思考:先让多个‘小脑子’同时独立解题,再把它们的答案交给一个‘总结员’分析,找出最合理的答案。这种方法比只选多数答案更好,还能通过训练让模型越来越聪明。

为什么值得记录

  • 首次系统性地将 agentic harness 中的 orchestration 机制抽象为 LLM 的内在技能(inner skill),提升可解释性和可复用性
  • 提出训练无关的两阶段框架(并行推理 + 顺序审议),在多个 STEM 基准上显著优于 Mean@K、Vote@K 等基线
  • 发现强模型在顺序审议中可逼近甚至超越 Pass@K 上限,表明审议过程能合成新解而非仅选择已有答案
  • 验证了 RLVR 可同时优化推理广度(并行生成)与深度(审议),为自进化 LLM 提供路径

核心方法

  • 将深度思考分解为两个独立阶段:并行推理生成 K 条轨迹,顺序审议模型基于序列化记忆缓存进行综合判断
  • 引入序列化记忆缓存机制,对轨迹剪枝并打乱顺序以避免位置偏差,作为审议阶段的输入上下文
  • 支持迭代审议,允许模型基于前轮输出反复修正推理结果
  • 将整个流程封装为可读技能文件(HeavySkill),包含激活条件、并行协议、审议提示和输出约束,可在不同 harness 中即插即用
  • 默认使用相同模型执行两阶段,但实验证明跨模型协作同样有效
  • 设计 Heavy-Mean@K 和 Heavy-Pass@K 指标评估审议后性能

关键结果

  • 在 AIME25、HMMT25-Feb 等 STEM 任务上,HM@4 平均比 M@K 高 3-10%,且强模型(如 GPT-5-Thinking)可达 96.7% 以上准确率
  • Heavy-Pass@K 在 50% 实验中超过原始 Pass@K,表明审议能生成原本未出现的正确答案
  • 在 LiveCodeBench 和 IFEval 等客观任务上,HM@4 显著优于 M@K(如 GPT-OSS-20B 从 69.7% → 85.5%)
  • 在 Arena-Hard 等主观任务上增益有限,说明审议对偏好对齐类任务效果较弱
  • 消融实验显示轨迹多样性与质量是关键,Max-Answer-Num 选择策略最优;审议阶段更依赖模型的综合分析能力而非原始推理能力

局限与风险

  • 审议阶段性能受记忆缓存长度限制,长上下文可能导致截断或训练不稳定(如 K=16 时熵崩溃)
  • 当前技能依赖前沿 LLM 的上下文学习能力,在弱模型上可能失效
  • 未探索不同任务类型的最佳 K 值与迭代次数,超参敏感
  • RLVR 优化仍处于初步阶段,需进一步解决训练稳定性问题

适合沉淀的概念

heavy-thinking, agentic-harness, parallel-reasoning, sequential-deliberation, test-time-scaling, reinforcement-learning-from-verifiable-rewards, inner-skill, memory-cache

阅读注意

  • 关注图 1 的两阶段架构图和图 7 的审议提示设计,这是理解 HeavySkill 核心的关键
  • 注意表 1 中 HP@4 > P@K 的现象,这是审议能‘创造’新解的重要证据
  • 图 3 显示弱模型作审议者仍可提升性能,说明该技能具有模型无关性
  • 附录 B 的 RLVR 实验表明未来可通过训练进一步释放潜力,但需注意序列长度限制

质量说明

  • 采用来源:rawraw/papers/2026/05/2605.02396.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、多维度结果和深入分析,包含消融实验与跨模型验证,数据充分且结论有支撑。