---
title: "Reason XL : Shifting LLM Reasoning Language Without Sacrificing Performance"
title_zh: "Reason XL：在不牺牲性能的前提下转移大语言模型的推理语言"
arxiv_id: "2604.12378"
paper_type: "method"
source_kind: "raw"
raw_path: "raw/papers/2026/04/2604.12378.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Reason XL：在不牺牲性能的前提下转移大语言模型的推理语言

## 一句话定位

提出首个大规模多语言对齐推理语料库 ReasonXL，并通过两阶段训练（SFT + RLVR）实现 LLM 推理语言从英语到目标语言的迁移，同时保持或提升任务性能。

## 小学生也能听懂

这篇论文像教一个只会用英语思考的机器人学会用德语、法语等语言思考数学题，他们先准备了大量多语言题目（ReasonXL），再分两步训练：先让它模仿用目标语言解题，再用奖励机制纠正错误，最终机器人能用新语言思考且解题能力不降反升，还发现大脑前几层决定用哪种语言。

## 为什么值得记录

- 解决了当前 LLM 在非英语场景下仍默认使用英语进行中间推理的问题，提升了非英语用户的可理解性与信任度；
- 构建了首个包含五种欧洲语言、每语言超200万对齐样本的大规模并行推理语料库 ReasonXL，填补了多语言推理数据稀缺的空白；
- 首次实证表明，通过监督微调加可验证奖励强化学习（RLVR），可在不牺牲性能甚至提升性能的情况下，将模型推理语言完全切换至目标语言；
- 机制性分析揭示了语言身份在模型中的编码方式：早期层（6–8层）构成语言路由瓶颈，决定输出语言，而上层负责内容层面的适应。

## 核心方法

- 构建 ReasonXL 数据集：从10个现有资源中采样并翻译，使用 Qwen3-32B 进行高质量翻译，保留数学符号与推理结构，每语言约90亿 token，共五语言（英、德、法、意、西）；
- 采用两阶段训练流程：第一阶段为监督微调（SFT），在目标语言数据上训练 SmolLM3-3B 模型，强制其生成目标语言推理轨迹；第二阶段为 Dr. GRPO 强化学习，恢复因语言切换导致的性能损失；
- 设计复合奖励函数：包括准确性奖励（基于答案正确性）、语言奖励（FastText 判断推理与输出是否为目标语言）、格式奖励（鼓励 <think> 和 \boxed{} 结构）、重复惩罚（防止生成退化）及西班牙语自然度奖励（抑制异常标点）；
- 评估涵盖三类任务：科学任务（MGSM、MT-Math100、GPQA Diamond）、非科学任务（Global MMLU Lite、Belebele、Include）和英语通用知识任务（MMLU、PIQA 等），以衡量性能保持与知识漂移；
- 进行机制性解释分析：通过权重变化（Frobenius 范数）和激活漂移（余弦相似度）分析模型内部变化，并结合单层激活补丁实验验证因果作用。

## 关键结果

- SFT 成功将模型推理语言切换至目标语言（%TL = 100%），但导致科学任务性能平均下降5–10点；
- GRPO 阶段有效恢复性能，最终模型在德语、意大利语等语言上平均性能超过基线，且完全保持目标语言合规性；
- 通用知识任务在英语上仅轻微下降（0.6–3.2点），表明模型事实知识未受显著影响；
- 跨语言迁移结果显示，适配某一语言后，其他语言性能总体保持或略有提升，中文表现尤为突出，而英语性能普遍下降，体现主要权衡；
- 机制分析发现：权重更新集中在上层，但激活补丁实验显示第6–8层是语言选择的因果瓶颈，说明语言身份由早期层决定，内容优化发生在上层。

## 局限与风险

- 实验仅基于 SmolLM3-3B 模型和五种欧洲语言，推广至更大模型或 typologically distant 语言尚待验证；
- 翻译虽由强模型完成，但未经过人工校验，可能存在‘翻译腔’影响训练动态；
- RL 奖励函数相对简单，未纳入推理连贯性或事实 grounding 等更细粒度信号；
- 未探索混合语言课程或参数高效微调策略，优化空间仍大。

## 适合沉淀的概念

`multilingual-reasoning`, `reasoning-language-adaptation`, `supervised-fine-tuning`, `reinforcement-learning-with-verifiable-rewards`, `activation-patching`, `language-routing-bottleneck`, `cross-lingual-transfer`, `mechanistic-interpretability`

## 阅读注意

- 关注 ReasonXL 数据集构建流程，特别是 Propella-1 标注与多阶段过滤机制如何保障数据质量与多样性；
- 注意两阶段训练中 SFT 与 GRPO 的具体超参数设置，尤其是奖励权重在不同语言间的差异（如西班牙语特有自然度奖励）；
- 机制分析部分重点理解图1与图2：权重变化集中于上层，但激活漂移与补丁实验揭示早期层（6–8）才是语言选择的关键；
- 评估协议细节：所有模型使用相同 vLLM 配置，科学任务取5次平均，通用知识取3次，注意系统提示仅在最终模型使用；
- 附录提供了丰富实现细节，如翻译 prompt、采样比例、奖励计算逻辑，对复现至关重要。

## 质量说明

- 采用来源：`raw`，`raw/papers/2026/04/2604.12378.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法、实验、分析、附录及详细实现参数，数据与训练流程透明，结果可验证性强。
