论文导读
提出 HeavySkill,将复杂推理任务中的“深度思考”抽象为可复用的两阶段技能(并行推理 + 顺序审议),并通过实验验证其在 STEM 和通用任务中优于传统 BoN 策略,且可通过强化学习进一步优化。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
HeavySkill:将深度思考作为智能体框架的内在技能
一句话定位
提出 HeavySkill,将复杂推理任务中的“深度思考”抽象为可复用的两阶段技能(并行推理 + 顺序审议),并通过实验验证其在 STEM 和通用任务中优于传统 BoN 策略,且可通过强化学习进一步优化。
小学生也能听懂
这篇论文教大模型像人类团队一样思考:先让多个‘小脑子’同时独立解题,再把它们的答案交给一个‘总结员’分析,找出最合理的答案。这种方法比只选多数答案更好,还能通过训练让模型越来越聪明。
为什么值得记录
- 首次系统性地将 agentic harness 中的 orchestration 机制抽象为 LLM 的内在技能(inner skill),提升可解释性和可复用性
- 提出训练无关的两阶段框架(并行推理 + 顺序审议),在多个 STEM 基准上显著优于 Mean@K、Vote@K 等基线
- 发现强模型在顺序审议中可逼近甚至超越 Pass@K 上限,表明审议过程能合成新解而非仅选择已有答案
- 验证了 RLVR 可同时优化推理广度(并行生成)与深度(审议),为自进化 LLM 提供路径
核心方法
- 将深度思考分解为两个独立阶段:并行推理生成 K 条轨迹,顺序审议模型基于序列化记忆缓存进行综合判断
- 引入序列化记忆缓存机制,对轨迹剪枝并打乱顺序以避免位置偏差,作为审议阶段的输入上下文
- 支持迭代审议,允许模型基于前轮输出反复修正推理结果
- 将整个流程封装为可读技能文件(HeavySkill),包含激活条件、并行协议、审议提示和输出约束,可在不同 harness 中即插即用
- 默认使用相同模型执行两阶段,但实验证明跨模型协作同样有效
- 设计 Heavy-Mean@K 和 Heavy-Pass@K 指标评估审议后性能
关键结果
- 在 AIME25、HMMT25-Feb 等 STEM 任务上,HM@4 平均比 M@K 高 3-10%,且强模型(如 GPT-5-Thinking)可达 96.7% 以上准确率
- Heavy-Pass@K 在 50% 实验中超过原始 Pass@K,表明审议能生成原本未出现的正确答案
- 在 LiveCodeBench 和 IFEval 等客观任务上,HM@4 显著优于 M@K(如 GPT-OSS-20B 从 69.7% → 85.5%)
- 在 Arena-Hard 等主观任务上增益有限,说明审议对偏好对齐类任务效果较弱
- 消融实验显示轨迹多样性与质量是关键,Max-Answer-Num 选择策略最优;审议阶段更依赖模型的综合分析能力而非原始推理能力
局限与风险
- 审议阶段性能受记忆缓存长度限制,长上下文可能导致截断或训练不稳定(如 K=16 时熵崩溃)
- 当前技能依赖前沿 LLM 的上下文学习能力,在弱模型上可能失效
- 未探索不同任务类型的最佳 K 值与迭代次数,超参敏感
- RLVR 优化仍处于初步阶段,需进一步解决训练稳定性问题
适合沉淀的概念
heavy-thinking, agentic-harness, parallel-reasoning, sequential-deliberation, test-time-scaling, reinforcement-learning-from-verifiable-rewards, inner-skill, memory-cache
阅读注意
- 关注图 1 的两阶段架构图和图 7 的审议提示设计,这是理解 HeavySkill 核心的关键
- 注意表 1 中 HP@4 > P@K 的现象,这是审议能‘创造’新解的重要证据
- 图 3 显示弱模型作审议者仍可提升性能,说明该技能具有模型无关性
- 附录 B 的 RLVR 实验表明未来可通过训练进一步释放潜力,但需注意序列长度限制
质量说明
- 采用来源:
raw,raw/papers/2026/05/2605.02396.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、多维度结果和深入分析,包含消融实验与跨模型验证,数据充分且结论有支撑。