---
title: "2604.11510"
title_zh: "Policy Split：基于双模式熵正则化的LLM强化学习探索激励方法"
arxiv_id: "2604.11510"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.11510.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Policy Split：基于双模式熵正则化的LLM强化学习探索激励方法

## 一句话定位

提出Policy Split框架，通过在同一模型内划分正常模式与高通量模式，并引入双模式熵正则化，在保持准确率的同时有效提升LLM强化学习中的探索能力。

## 小学生也能听懂

这篇论文像给AI大脑装了两个“小分身”：一个认真答题，一个大胆尝试新想法，通过互相学习让AI既聪明又有创意，还能避免乱答或重复。

## 为什么值得记录

- 解决了传统熵引导RL中探索与利用之间的根本冲突：单纯提高熵可能导致输出退化或准确率下降
- 在低熵大推理模型（LRM）的持续训练中成功恢复熵值，避免熵崩溃问题
- 在多个通用任务（数学、科学、艺术）和创造性写作任务上均显著优于现有基线方法
- 验证了通过提示控制实现可泛化的双模式行为分离的可行性

## 核心方法

- 将策略划分为两个共享参数但目标不同的模式：正常模式（无系统提示）优化任务正确性；高通量模式（带专用系统提示）鼓励探索
- 设计双模式优势函数：正常模式使用标准GRPO优势；高通量模式在优势中加入熵项和与正常模式的KL散度项，并采用截断机制防止信号反转
- 引入回滚共享机制（rollout sharing），使两种模式能互相学习对方生成的有效响应，增强协同训练效果
- 整体训练目标为联合优化两个模式的PPO-like损失函数，每组采样包含来自两种模式的响应

## 关键结果

- 在Qwen3-1.7B/4B/8B上平均准确率分别提升0.70、1.75、1.21个百分点，且所有改进均通过p<0.01显著性检验
- 高通量模式下的平均熵值显著高于所有基线，例如Qwen3-8B上达到0.88 bits，比原始模型提高近一倍
- 在创造性写作任务中，高通量模式在N-gram多样性（52.08 vs 49.62）、自BLEU多样性（65.34 vs 60.34）及LLM评判指标（如Creativity: 62.50 vs 57.69）上全面领先

## 局限与风险

- 高通量模式虽提升探索性，但会带来一定准确率损失（如Qwen3-8B上-2.44%），需权衡使用场景
- 依赖特定系统提示实现模式切换，提示设计对性能有显著影响，通用性有待进一步验证
- 实验仅基于Qwen3系列模型，在其他架构上的迁移效果尚未验证

## 适合沉淀的概念

`policy-split`, `dual-mode-entropy-regularization`, `entropy-guided-reinforcement-learning`, `large-reasoning-models`, `rollout-sharing`, `mode-switching-via-prompting`, `kl-divergence-in-rl`, `creative-text-generation`

## 阅读注意

- 注意区分‘Entropy Regularization’与‘Entropy Advantage’两种基线方法：前者直接最大化熵，后者将熵作为优势偏移项
- 公式(3)中的clip操作是关键稳定机制，防止熵优势改变原始奖励信号的方向
- 回滚共享机制（Equation 10）允许跨模式学习，但训练时仍按模式类型分配对应损失函数
- 高通量模式提示词经过精心设计，强调‘非典型思维路径’和‘多角度探索’，而非简单增加随机性

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.11510.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的实验设置、基线实现细节、超参数配置及多维度评估结果，包含消融实验和显著性检验，材料充分可信。
