---
title: "Introducing LongCat-Flash-Thinking: A Technical Report"
title_zh: "LongCat-Flash-Thinking：一种高效开源推理模型技术报告"
arxiv_id: "2509.18883"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2025/09/2509.18883.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LongCat-Flash-Thinking：一种高效开源推理模型技术报告

## 一句话定位

提出 LongCat-Flash-Thinking，一个 5600 亿参数 MoE 架构的开源推理模型，通过长链思维冷启动训练与大规模强化学习，在数学、代码、形式化证明和智能体推理等任务上实现 SOTA 性能，并显著提升 token 效率。

## 小学生也能听懂

这篇论文造了一个叫 LongCat-Flash-Thinking 的超级聪明机器人，它像有5600亿个小助手分工合作，先通过大量数学题和编程题“热身”，再用强化学习训练，最后在解数学题、写代码、证明定理和用工具方面都变得特别厉害，还省了很多计算步骤。

## 为什么值得记录

- 首个在形式化定理证明（MiniF2F-Test pass@1 达 67.6%）和智能体工具使用（AIME-25 上 token 消耗降低 64.5%）同时取得领先性能的开源模型
- 提出领域并行 RL 训练与融合方法，解耦 STEM、代码、智能体任务优化，实现近帕累托最优的多领域专家集成
- 构建工业级异步 RL 框架 DORA，支持数万个加速器稳定训练，吞吐量超同步方法三倍以上

## 核心方法

- 采用两阶段训练流程：先进行长链思维冷启动训练（含中期课程学习与推理导向 SFT），再进入大规模强化学习
- 冷启动阶段：在中期训练中注入高比例推理密集型数据（如竞赛级数学、编程题），提升模型内在推理潜力；SFT 阶段引入通用、形式化、智能体三类推理数据
- 形式化推理增强：构建自动形式化器将自然语言数学题转为 Lean4 语句，并通过迭代证明合成生成已验证证明轨迹
- 智能体推理优化：设计双路径评估 pipeline 筛选真正需要工具辅助的 query（工具必要性 v_x = s_{w/.tool} - s_{w/o.tool}），并自动生成高质量工具调用轨迹
- RL 阶段采用领域并行策略：分别对 STEM、代码、智能体任务独立优化，再融合为统一模型，最后进行通用对齐
- 开发 DORA 异步 rollout 系统：支持多版本策略权重共存、KV-cache 重用与弹性角色共置，解决长尾生成与设备空闲问题
- 算法层面改进 GRPO：引入带替换在线过滤、陈旧性控制与不完整信号掩码，提升训练稳定性

## 关键结果

- 在 MATH500 上达到 99.2% 准确率，在 AIME-25 上优于 OpenAI-o3，在 ARC-AGI 上以 50.3% 超越所有对比模型
- MiniF2F-Test 形式化证明 pass@1 达 67.6%，领先 DeepSeek V3.1 达 18 个百分点
- 启用工具后，AIME-25 平均 token 消耗从 19,653 降至 6,965（减少 64.5%），准确率保持不变
- LiveCodeBench 编码得分 79.4%，超越所有开源模型，接近 GPT-5（80.6%）
- 安全拒绝能力全面领先：Harmful 类别达 93.7%，Criminal 达 97.1%，Misinformation 达 93.0%

## 局限与风险

- 未公开具体训练数据构成与采样比例细节，仅以图表形式展示 SFT 数据分布
- DORA 系统依赖 PyTorch RPC 与定制调度器，复现需大规模分布式基础设施
- 形式化证明依赖外部 Lean4 服务器验证，闭环生成流程对基础设施要求高
- 领域并行训练虽提升稳定性，但增加模型融合复杂度，可能引入能力冲突风险

## 适合沉淀的概念

`long-cot-cold-start-training`, `domain-parallel-reinforcement-learning`, `dora-asynchronous-rollout-system`, `formal-reasoning-with-lean4`, `agentic-tool-use-query-selection`, `iterative-proof-synthesis`, `moe-reasoning-model`, `group-relative-policy-optimization-grpo`

## 阅读注意

- 重点关注 2.2.2 节的形式化推理 pipeline 与 2.2.3 节的智能体 query 筛选机制，二者为数据构造核心创新
- 图 5 和图 6 展示 DORA 系统的异步 rollout 与负载均衡机制，是理解其效率优势的关键
- 表 2 提供全面 benchmark 对比，注意 LongCat-Flash-Thinking 在激活参数仅 27B 情况下的性能表现
- 附录 A.1 和 A.2 补充了数据过滤与难度评估细节，有助于复现数据 pipeline

## 质量说明

- 采用来源：`clean`，`papers/2025/09/2509.18883.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文结构完整，方法描述清晰，实验充分，数据与系统细节披露合理，具备可复现性与技术深度
