2604.11510
论文导读
提出Policy Split框架,通过在同一模型内划分正常模式与高通量模式,并引入双模式熵正则化,在保持准确率的同时有效提升LLM强化学习中的探索能力。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Policy Split:基于双模式熵正则化的LLM强化学习探索激励方法
一句话定位
提出Policy Split框架,通过在同一模型内划分正常模式与高通量模式,并引入双模式熵正则化,在保持准确率的同时有效提升LLM强化学习中的探索能力。
小学生也能听懂
这篇论文像给AI大脑装了两个“小分身”:一个认真答题,一个大胆尝试新想法,通过互相学习让AI既聪明又有创意,还能避免乱答或重复。
为什么值得记录
- 解决了传统熵引导RL中探索与利用之间的根本冲突:单纯提高熵可能导致输出退化或准确率下降
- 在低熵大推理模型(LRM)的持续训练中成功恢复熵值,避免熵崩溃问题
- 在多个通用任务(数学、科学、艺术)和创造性写作任务上均显著优于现有基线方法
- 验证了通过提示控制实现可泛化的双模式行为分离的可行性
核心方法
- 将策略划分为两个共享参数但目标不同的模式:正常模式(无系统提示)优化任务正确性;高通量模式(带专用系统提示)鼓励探索
- 设计双模式优势函数:正常模式使用标准GRPO优势;高通量模式在优势中加入熵项和与正常模式的KL散度项,并采用截断机制防止信号反转
- 引入回滚共享机制(rollout sharing),使两种模式能互相学习对方生成的有效响应,增强协同训练效果
- 整体训练目标为联合优化两个模式的PPO-like损失函数,每组采样包含来自两种模式的响应
关键结果
- 在Qwen3-1.7B/4B/8B上平均准确率分别提升0.70、1.75、1.21个百分点,且所有改进均通过p<0.01显著性检验
- 高通量模式下的平均熵值显著高于所有基线,例如Qwen3-8B上达到0.88 bits,比原始模型提高近一倍
- 在创造性写作任务中,高通量模式在N-gram多样性(52.08 vs 49.62)、自BLEU多样性(65.34 vs 60.34)及LLM评判指标(如Creativity: 62.50 vs 57.69)上全面领先
局限与风险
- 高通量模式虽提升探索性,但会带来一定准确率损失(如Qwen3-8B上-2.44%),需权衡使用场景
- 依赖特定系统提示实现模式切换,提示设计对性能有显著影响,通用性有待进一步验证
- 实验仅基于Qwen3系列模型,在其他架构上的迁移效果尚未验证
适合沉淀的概念
policy-split, dual-mode-entropy-regularization, entropy-guided-reinforcement-learning, large-reasoning-models, rollout-sharing, mode-switching-via-prompting, kl-divergence-in-rl, creative-text-generation
阅读注意
- 注意区分‘Entropy Regularization’与‘Entropy Advantage’两种基线方法:前者直接最大化熵,后者将熵作为优势偏移项
- 公式(3)中的clip操作是关键稳定机制,防止熵优势改变原始奖励信号的方向
- 回滚共享机制(Equation 10)允许跨模式学习,但训练时仍按模式类型分配对应损失函数
- 高通量模式提示词经过精心设计,强调‘非典型思维路径’和‘多角度探索’,而非简单增加随机性
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.11510.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、基线实现细节、超参数配置及多维度评估结果,包含消融实验和显著性检验,材料充分可信。