论文
arXiv2604.12378
时间2026-04
来源Markdown
页面质量中文卡片
阅读量级105 分钟

Reason XL : Shifting LLM Reasoning Language Without Sacrificing Performance

论文导读

提出首个大规模多语言对齐推理语料库 ReasonXL,并通过两阶段训练(SFT + RLVR)实现 LLM 推理语言从英语到目标语言的迁移,同时保持或提升任务性能。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

Reason XL:在不牺牲性能的前提下转移大语言模型的推理语言

一句话定位

提出首个大规模多语言对齐推理语料库 ReasonXL,并通过两阶段训练(SFT + RLVR)实现 LLM 推理语言从英语到目标语言的迁移,同时保持或提升任务性能。

小学生也能听懂

这篇论文像教一个只会用英语思考的机器人学会用德语、法语等语言思考数学题,他们先准备了大量多语言题目(ReasonXL),再分两步训练:先让它模仿用目标语言解题,再用奖励机制纠正错误,最终机器人能用新语言思考且解题能力不降反升,还发现大脑前几层决定用哪种语言。

为什么值得记录

  • 解决了当前 LLM 在非英语场景下仍默认使用英语进行中间推理的问题,提升了非英语用户的可理解性与信任度;
  • 构建了首个包含五种欧洲语言、每语言超200万对齐样本的大规模并行推理语料库 ReasonXL,填补了多语言推理数据稀缺的空白;
  • 首次实证表明,通过监督微调加可验证奖励强化学习(RLVR),可在不牺牲性能甚至提升性能的情况下,将模型推理语言完全切换至目标语言;
  • 机制性分析揭示了语言身份在模型中的编码方式:早期层(6–8层)构成语言路由瓶颈,决定输出语言,而上层负责内容层面的适应。

核心方法

  • 构建 ReasonXL 数据集:从10个现有资源中采样并翻译,使用 Qwen3-32B 进行高质量翻译,保留数学符号与推理结构,每语言约90亿 token,共五语言(英、德、法、意、西);
  • 采用两阶段训练流程:第一阶段为监督微调(SFT),在目标语言数据上训练 SmolLM3-3B 模型,强制其生成目标语言推理轨迹;第二阶段为 Dr. GRPO 强化学习,恢复因语言切换导致的性能损失;
  • 设计复合奖励函数:包括准确性奖励(基于答案正确性)、语言奖励(FastText 判断推理与输出是否为目标语言)、格式奖励(鼓励 和 \boxed{} 结构)、重复惩罚(防止生成退化)及西班牙语自然度奖励(抑制异常标点);
  • 评估涵盖三类任务:科学任务(MGSM、MT-Math100、GPQA Diamond)、非科学任务(Global MMLU Lite、Belebele、Include)和英语通用知识任务(MMLU、PIQA 等),以衡量性能保持与知识漂移;
  • 进行机制性解释分析:通过权重变化(Frobenius 范数)和激活漂移(余弦相似度)分析模型内部变化,并结合单层激活补丁实验验证因果作用。

关键结果

  • SFT 成功将模型推理语言切换至目标语言(%TL = 100%),但导致科学任务性能平均下降5–10点;
  • GRPO 阶段有效恢复性能,最终模型在德语、意大利语等语言上平均性能超过基线,且完全保持目标语言合规性;
  • 通用知识任务在英语上仅轻微下降(0.6–3.2点),表明模型事实知识未受显著影响;
  • 跨语言迁移结果显示,适配某一语言后,其他语言性能总体保持或略有提升,中文表现尤为突出,而英语性能普遍下降,体现主要权衡;
  • 机制分析发现:权重更新集中在上层,但激活补丁实验显示第6–8层是语言选择的因果瓶颈,说明语言身份由早期层决定,内容优化发生在上层。

局限与风险

  • 实验仅基于 SmolLM3-3B 模型和五种欧洲语言,推广至更大模型或 typologically distant 语言尚待验证;
  • 翻译虽由强模型完成,但未经过人工校验,可能存在‘翻译腔’影响训练动态;
  • RL 奖励函数相对简单,未纳入推理连贯性或事实 grounding 等更细粒度信号;
  • 未探索混合语言课程或参数高效微调策略,优化空间仍大。

适合沉淀的概念

multilingual-reasoning, reasoning-language-adaptation, supervised-fine-tuning, reinforcement-learning-with-verifiable-rewards, activation-patching, language-routing-bottleneck, cross-lingual-transfer, mechanistic-interpretability

阅读注意

  • 关注 ReasonXL 数据集构建流程,特别是 Propella-1 标注与多阶段过滤机制如何保障数据质量与多样性;
  • 注意两阶段训练中 SFT 与 GRPO 的具体超参数设置,尤其是奖励权重在不同语言间的差异(如西班牙语特有自然度奖励);
  • 机制分析部分重点理解图1与图2:权重变化集中于上层,但激活漂移与补丁实验揭示早期层(6–8)才是语言选择的关键;
  • 评估协议细节:所有模型使用相同 vLLM 配置,科学任务取5次平均,通用知识取3次,注意系统提示仅在最终模型使用;
  • 附录提供了丰富实现细节,如翻译 prompt、采样比例、奖励计算逻辑,对复现至关重要。

质量说明

  • 采用来源:rawraw/papers/2026/04/2604.12378.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文材料完整,包含方法、实验、分析、附录及详细实现参数,数据与训练流程透明,结果可验证性强。