On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
论文导读
通过控制任务构造,系统研究时域长度对LLM智能体训练动态的影响,提出时域缩减作为提升长时程任务训练稳定性和泛化能力的关键原则。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
长时程任务中LLM训练的实证研究与时域长度影响分析
一句话定位
通过控制任务构造,系统研究时域长度对LLM智能体训练动态的影响,提出时域缩减作为提升长时程任务训练稳定性和泛化能力的关键原则。
小学生也能听懂
这篇论文像教机器人玩拼图和推箱子游戏,发现任务越长越难学,于是把长任务拆成小块或用“快捷键”简化步骤,结果发现先练短任务再挑战长的效果更好,还能举一反三。
为什么值得记录
- 首次将时域长度从环境约束提升为影响LLM训练动态的核心因素,揭示其独立于推理复杂度的瓶颈作用
- 提出并验证‘时域缩减’(horizon reduction)作为解决长时程任务训练不稳定的通用原则,涵盖宏动作与子目标分解两种机制
- 发现‘时域泛化’现象:在短时域上训练的模型可有效泛化至更长的未见时域,为课程学习提供理论支持
- 在Sudoku、Rush Hour和WebShop等多个环境中验证结论的鲁棒性,涵盖不同模型规模与优化器设置
核心方法
- 构建受控任务套件:在Sudoku和Rush Hour中,通过筛选仅包含基础解题技巧的实例,实现目标距离(goal distance)与推理复杂度的解耦
- 采用SFT+RL两阶段训练:先基于专家轨迹进行监督微调,再使用改进的REINFORCE算法进行强化学习
- 设计双组件奖励函数:轨迹级回报(trajectory-level return)与步骤级惩罚(step-level format/validity reward),并进行批归一化以稳定训练
- 引入重要性采样稳定off-policy训练:结合序列级截断重要性采样(Seq-TIS)与几何平均掩码重要性采样(Geo-MIS)
- 实现两种时域缩减策略:宏动作(允许单步执行多个原子动作)和子目标分解(将全局目标拆解为可验证的中间子任务)
关键结果
- RL在长时域任务(L3-L4)上出现严重训练不稳定与性能崩溃,而短时域(L1-L2)训练稳定,证明时域长度本身是独立瓶颈
- 宏动作策略在Sudoku和Rush Hour上均显著提升训练稳定性与最终性能,在L3-L4设置下避免崩溃并实现持续改进
- 子目标分解在密集奖励设置下有效缓解长时域训练失败,验证过程奖励(process reward)的有效性
- 时域泛化现象显著:在L1-L2训练的模型可泛化至L5-L7(未见更长时域),宏动作策略的泛化能力优于原子动作
- 课程学习(curriculum learning)结合时域泛化在Rush Hour上取得最佳效果,短时域预训练后迁移至长时域性能提升明显
局限与风险
- 实验主要基于文本游戏环境(Sudoku, Rush Hour),虽扩展至WebShop,但在真实世界复杂感知与交互任务中的普适性仍需验证
- 模型规模限于1.7B与4B,更大规模模型是否天然缓解时域瓶颈尚不明确
- 时域泛化不伴随解题技巧泛化:模型无法泛化至需要新推理原语(如高级数独技巧)的任务,表明RL主要重组已有能力而非学习新能力
适合沉淀的概念
horizon-length-bottleneck, horizon-reduction, macro-actions, subgoal-decomposition, horizon-generalization, credit-assignment-challenge, token-level-gradient-dynamics, off-policy-rl-stabilization
阅读注意
- 重点关注图2与图3:展示RL在长短时域下的训练动态差异及时域缩减的效果
- 注意表1的数据集划分逻辑:L1-L4为训练集,L5-L7用于测试时域泛化
- 理解图4的消融实验设计:通过限制宏动作策略仅执行单步,隔离‘有效时域’变量的影响
- 附录D.1的token-level梯度分析解释了负优势导致训练不稳定的内在机制
- 图12揭示了时域泛化与技巧泛化的分离现象,是理解LLM能力边界的关键
质量说明
- 采用来源:
raw,raw/papers/2026/05/2605.02572.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的实验设置、消融研究、多环境验证与深入分析,数据详实,结论有充分支撑。附录包含实现细节与额外分析,材料完整可靠。