概念导读
LLM RL 训练中引入双模式探索策略,分离 exploit 和 explore 的优化路径。
- 核心
- Related
Policy Split: Dual-Mode Exploration in LLM RL
核心
LLM RL 训练中引入双模式探索策略,分离 exploit 和 explore 的优化路径。
LLM RL 训练中引入双模式探索策略,分离 exploit 和 explore 的优化路径。
LLM RL 训练中引入双模式探索策略,分离 exploit 和 explore 的优化路径。