Introducing LongCat-Flash-Thinking: A Technical Report
论文导读
提出 LongCat-Flash-Thinking,一个 5600 亿参数 MoE 架构的开源推理模型,通过长链思维冷启动训练与大规模强化学习,在数学、代码、形式化证明和智能体推理等任务上实现 SOTA 性能,并显著提升 token 效率。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
LongCat-Flash-Thinking:一种高效开源推理模型技术报告
一句话定位
提出 LongCat-Flash-Thinking,一个 5600 亿参数 MoE 架构的开源推理模型,通过长链思维冷启动训练与大规模强化学习,在数学、代码、形式化证明和智能体推理等任务上实现 SOTA 性能,并显著提升 token 效率。
小学生也能听懂
这篇论文造了一个叫 LongCat-Flash-Thinking 的超级聪明机器人,它像有5600亿个小助手分工合作,先通过大量数学题和编程题“热身”,再用强化学习训练,最后在解数学题、写代码、证明定理和用工具方面都变得特别厉害,还省了很多计算步骤。
为什么值得记录
- 首个在形式化定理证明(MiniF2F-Test pass@1 达 67.6%)和智能体工具使用(AIME-25 上 token 消耗降低 64.5%)同时取得领先性能的开源模型
- 提出领域并行 RL 训练与融合方法,解耦 STEM、代码、智能体任务优化,实现近帕累托最优的多领域专家集成
- 构建工业级异步 RL 框架 DORA,支持数万个加速器稳定训练,吞吐量超同步方法三倍以上
核心方法
- 采用两阶段训练流程:先进行长链思维冷启动训练(含中期课程学习与推理导向 SFT),再进入大规模强化学习
- 冷启动阶段:在中期训练中注入高比例推理密集型数据(如竞赛级数学、编程题),提升模型内在推理潜力;SFT 阶段引入通用、形式化、智能体三类推理数据
- 形式化推理增强:构建自动形式化器将自然语言数学题转为 Lean4 语句,并通过迭代证明合成生成已验证证明轨迹
- 智能体推理优化:设计双路径评估 pipeline 筛选真正需要工具辅助的 query(工具必要性 v_x = s_{w/.tool} - s_{w/o.tool}),并自动生成高质量工具调用轨迹
- RL 阶段采用领域并行策略:分别对 STEM、代码、智能体任务独立优化,再融合为统一模型,最后进行通用对齐
- 开发 DORA 异步 rollout 系统:支持多版本策略权重共存、KV-cache 重用与弹性角色共置,解决长尾生成与设备空闲问题
- 算法层面改进 GRPO:引入带替换在线过滤、陈旧性控制与不完整信号掩码,提升训练稳定性
关键结果
- 在 MATH500 上达到 99.2% 准确率,在 AIME-25 上优于 OpenAI-o3,在 ARC-AGI 上以 50.3% 超越所有对比模型
- MiniF2F-Test 形式化证明 pass@1 达 67.6%,领先 DeepSeek V3.1 达 18 个百分点
- 启用工具后,AIME-25 平均 token 消耗从 19,653 降至 6,965(减少 64.5%),准确率保持不变
- LiveCodeBench 编码得分 79.4%,超越所有开源模型,接近 GPT-5(80.6%)
- 安全拒绝能力全面领先:Harmful 类别达 93.7%,Criminal 达 97.1%,Misinformation 达 93.0%
局限与风险
- 未公开具体训练数据构成与采样比例细节,仅以图表形式展示 SFT 数据分布
- DORA 系统依赖 PyTorch RPC 与定制调度器,复现需大规模分布式基础设施
- 形式化证明依赖外部 Lean4 服务器验证,闭环生成流程对基础设施要求高
- 领域并行训练虽提升稳定性,但增加模型融合复杂度,可能引入能力冲突风险
适合沉淀的概念
long-cot-cold-start-training, domain-parallel-reinforcement-learning, dora-asynchronous-rollout-system, formal-reasoning-with-lean4, agentic-tool-use-query-selection, iterative-proof-synthesis, moe-reasoning-model, group-relative-policy-optimization-grpo
阅读注意
- 重点关注 2.2.2 节的形式化推理 pipeline 与 2.2.3 节的智能体 query 筛选机制,二者为数据构造核心创新
- 图 5 和图 6 展示 DORA 系统的异步 rollout 与负载均衡机制,是理解其效率优势的关键
- 表 2 提供全面 benchmark 对比,注意 LongCat-Flash-Thinking 在激活参数仅 27B 情况下的性能表现
- 附录 A.1 和 A.2 补充了数据过滤与难度评估细节,有助于复现数据 pipeline
质量说明
- 采用来源:
clean,papers/2025/09/2509.18883.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文结构完整,方法描述清晰,实验充分,数据与系统细节披露合理,具备可复现性与技术深度