Reason XL : Shifting LLM Reasoning Language Without Sacrificing Performance
论文导读
提出首个大规模多语言对齐推理语料库 ReasonXL,并通过两阶段训练(SFT + RLVR)实现 LLM 推理语言从英语到目标语言的迁移,同时保持或提升任务性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Reason XL:在不牺牲性能的前提下转移大语言模型的推理语言
一句话定位
提出首个大规模多语言对齐推理语料库 ReasonXL,并通过两阶段训练(SFT + RLVR)实现 LLM 推理语言从英语到目标语言的迁移,同时保持或提升任务性能。
小学生也能听懂
这篇论文像教一个只会用英语思考的机器人学会用德语、法语等语言思考数学题,他们先准备了大量多语言题目(ReasonXL),再分两步训练:先让它模仿用目标语言解题,再用奖励机制纠正错误,最终机器人能用新语言思考且解题能力不降反升,还发现大脑前几层决定用哪种语言。
为什么值得记录
- 解决了当前 LLM 在非英语场景下仍默认使用英语进行中间推理的问题,提升了非英语用户的可理解性与信任度;
- 构建了首个包含五种欧洲语言、每语言超200万对齐样本的大规模并行推理语料库 ReasonXL,填补了多语言推理数据稀缺的空白;
- 首次实证表明,通过监督微调加可验证奖励强化学习(RLVR),可在不牺牲性能甚至提升性能的情况下,将模型推理语言完全切换至目标语言;
- 机制性分析揭示了语言身份在模型中的编码方式:早期层(6–8层)构成语言路由瓶颈,决定输出语言,而上层负责内容层面的适应。
核心方法
- 构建 ReasonXL 数据集:从10个现有资源中采样并翻译,使用 Qwen3-32B 进行高质量翻译,保留数学符号与推理结构,每语言约90亿 token,共五语言(英、德、法、意、西);
- 采用两阶段训练流程:第一阶段为监督微调(SFT),在目标语言数据上训练 SmolLM3-3B 模型,强制其生成目标语言推理轨迹;第二阶段为 Dr. GRPO 强化学习,恢复因语言切换导致的性能损失;
- 设计复合奖励函数:包括准确性奖励(基于答案正确性)、语言奖励(FastText 判断推理与输出是否为目标语言)、格式奖励(鼓励
和 \boxed{} 结构)、重复惩罚(防止生成退化)及西班牙语自然度奖励(抑制异常标点); - 评估涵盖三类任务:科学任务(MGSM、MT-Math100、GPQA Diamond)、非科学任务(Global MMLU Lite、Belebele、Include)和英语通用知识任务(MMLU、PIQA 等),以衡量性能保持与知识漂移;
- 进行机制性解释分析:通过权重变化(Frobenius 范数)和激活漂移(余弦相似度)分析模型内部变化,并结合单层激活补丁实验验证因果作用。
关键结果
- SFT 成功将模型推理语言切换至目标语言(%TL = 100%),但导致科学任务性能平均下降5–10点;
- GRPO 阶段有效恢复性能,最终模型在德语、意大利语等语言上平均性能超过基线,且完全保持目标语言合规性;
- 通用知识任务在英语上仅轻微下降(0.6–3.2点),表明模型事实知识未受显著影响;
- 跨语言迁移结果显示,适配某一语言后,其他语言性能总体保持或略有提升,中文表现尤为突出,而英语性能普遍下降,体现主要权衡;
- 机制分析发现:权重更新集中在上层,但激活补丁实验显示第6–8层是语言选择的因果瓶颈,说明语言身份由早期层决定,内容优化发生在上层。
局限与风险
- 实验仅基于 SmolLM3-3B 模型和五种欧洲语言,推广至更大模型或 typologically distant 语言尚待验证;
- 翻译虽由强模型完成,但未经过人工校验,可能存在‘翻译腔’影响训练动态;
- RL 奖励函数相对简单,未纳入推理连贯性或事实 grounding 等更细粒度信号;
- 未探索混合语言课程或参数高效微调策略,优化空间仍大。
适合沉淀的概念
multilingual-reasoning, reasoning-language-adaptation, supervised-fine-tuning, reinforcement-learning-with-verifiable-rewards, activation-patching, language-routing-bottleneck, cross-lingual-transfer, mechanistic-interpretability
阅读注意
- 关注 ReasonXL 数据集构建流程,特别是 Propella-1 标注与多阶段过滤机制如何保障数据质量与多样性;
- 注意两阶段训练中 SFT 与 GRPO 的具体超参数设置,尤其是奖励权重在不同语言间的差异(如西班牙语特有自然度奖励);
- 机制分析部分重点理解图1与图2:权重变化集中于上层,但激活漂移与补丁实验揭示早期层(6–8)才是语言选择的关键;
- 评估协议细节:所有模型使用相同 vLLM 配置,科学任务取5次平均,通用知识取3次,注意系统提示仅在最终模型使用;
- 附录提供了丰富实现细节,如翻译 prompt、采样比例、奖励计算逻辑,对复现至关重要。
质量说明
- 采用来源:
raw,raw/papers/2026/04/2604.12378.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文材料完整,包含方法、实验、分析、附录及详细实现参数,数据与训练流程透明,结果可验证性强。