论文
arXiv2604.11510
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级45 分钟

2604.11510

论文导读

提出Policy Split框架,通过在同一模型内划分正常模式与高通量模式,并引入双模式熵正则化,在保持准确率的同时有效提升LLM强化学习中的探索能力。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Policy Split:基于双模式熵正则化的LLM强化学习探索激励方法

一句话定位

提出Policy Split框架,通过在同一模型内划分正常模式与高通量模式,并引入双模式熵正则化,在保持准确率的同时有效提升LLM强化学习中的探索能力。

小学生也能听懂

这篇论文像给AI大脑装了两个“小分身”:一个认真答题,一个大胆尝试新想法,通过互相学习让AI既聪明又有创意,还能避免乱答或重复。

为什么值得记录

  • 解决了传统熵引导RL中探索与利用之间的根本冲突:单纯提高熵可能导致输出退化或准确率下降
  • 在低熵大推理模型(LRM)的持续训练中成功恢复熵值,避免熵崩溃问题
  • 在多个通用任务(数学、科学、艺术)和创造性写作任务上均显著优于现有基线方法
  • 验证了通过提示控制实现可泛化的双模式行为分离的可行性

核心方法

  • 将策略划分为两个共享参数但目标不同的模式:正常模式(无系统提示)优化任务正确性;高通量模式(带专用系统提示)鼓励探索
  • 设计双模式优势函数:正常模式使用标准GRPO优势;高通量模式在优势中加入熵项和与正常模式的KL散度项,并采用截断机制防止信号反转
  • 引入回滚共享机制(rollout sharing),使两种模式能互相学习对方生成的有效响应,增强协同训练效果
  • 整体训练目标为联合优化两个模式的PPO-like损失函数,每组采样包含来自两种模式的响应

关键结果

  • 在Qwen3-1.7B/4B/8B上平均准确率分别提升0.70、1.75、1.21个百分点,且所有改进均通过p<0.01显著性检验
  • 高通量模式下的平均熵值显著高于所有基线,例如Qwen3-8B上达到0.88 bits,比原始模型提高近一倍
  • 在创造性写作任务中,高通量模式在N-gram多样性(52.08 vs 49.62)、自BLEU多样性(65.34 vs 60.34)及LLM评判指标(如Creativity: 62.50 vs 57.69)上全面领先

局限与风险

  • 高通量模式虽提升探索性,但会带来一定准确率损失(如Qwen3-8B上-2.44%),需权衡使用场景
  • 依赖特定系统提示实现模式切换,提示设计对性能有显著影响,通用性有待进一步验证
  • 实验仅基于Qwen3系列模型,在其他架构上的迁移效果尚未验证

适合沉淀的概念

policy-split, dual-mode-entropy-regularization, entropy-guided-reinforcement-learning, large-reasoning-models, rollout-sharing, mode-switching-via-prompting, kl-divergence-in-rl, creative-text-generation

阅读注意

  • 注意区分‘Entropy Regularization’与‘Entropy Advantage’两种基线方法:前者直接最大化熵,后者将熵作为优势偏移项
  • 公式(3)中的clip操作是关键稳定机制,防止熵优势改变原始奖励信号的方向
  • 回滚共享机制(Equation 10)允许跨模式学习,但训练时仍按模式类型分配对应损失函数
  • 高通量模式提示词经过精心设计,强调‘非典型思维路径’和‘多角度探索’,而非简单增加随机性

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.11510.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文提供了完整的实验设置、基线实现细节、超参数配置及多维度评估结果,包含消融实验和显著性检验,材料充分可信。