概念
rl exploration dual-mode policy-optimization
创建2026-04-15
更新2026-04-15
阅读量级1 分钟
概念导读

LLM RL 训练中引入双模式探索策略,分离 exploit 和 explore 的优化路径。

  1. 核心
  2. Related

Policy Split: Dual-Mode Exploration in LLM RL

核心

LLM RL 训练中引入双模式探索策略,分离 exploit 和 explore 的优化路径。