论文
arXiv2509.18883
时间2025-09
来源Markdown
页面质量中文卡片
阅读量级104 分钟

Introducing LongCat-Flash-Thinking: A Technical Report

论文导读

提出 LongCat-Flash-Thinking,一个 5600 亿参数 MoE 架构的开源推理模型,通过长链思维冷启动训练与大规模强化学习,在数学、代码、形式化证明和智能体推理等任务上实现 SOTA 性能,并显著提升 token 效率。

  1. 一句话定位
  2. 小学生也能听懂
  3. 为什么值得记录
  4. 核心方法
  5. 关键结果
  6. 局限与风险
  7. 适合沉淀的概念
  8. 阅读注意

LongCat-Flash-Thinking:一种高效开源推理模型技术报告

一句话定位

提出 LongCat-Flash-Thinking,一个 5600 亿参数 MoE 架构的开源推理模型,通过长链思维冷启动训练与大规模强化学习,在数学、代码、形式化证明和智能体推理等任务上实现 SOTA 性能,并显著提升 token 效率。

小学生也能听懂

这篇论文造了一个叫 LongCat-Flash-Thinking 的超级聪明机器人,它像有5600亿个小助手分工合作,先通过大量数学题和编程题“热身”,再用强化学习训练,最后在解数学题、写代码、证明定理和用工具方面都变得特别厉害,还省了很多计算步骤。

为什么值得记录

  • 首个在形式化定理证明(MiniF2F-Test pass@1 达 67.6%)和智能体工具使用(AIME-25 上 token 消耗降低 64.5%)同时取得领先性能的开源模型
  • 提出领域并行 RL 训练与融合方法,解耦 STEM、代码、智能体任务优化,实现近帕累托最优的多领域专家集成
  • 构建工业级异步 RL 框架 DORA,支持数万个加速器稳定训练,吞吐量超同步方法三倍以上

核心方法

  • 采用两阶段训练流程:先进行长链思维冷启动训练(含中期课程学习与推理导向 SFT),再进入大规模强化学习
  • 冷启动阶段:在中期训练中注入高比例推理密集型数据(如竞赛级数学、编程题),提升模型内在推理潜力;SFT 阶段引入通用、形式化、智能体三类推理数据
  • 形式化推理增强:构建自动形式化器将自然语言数学题转为 Lean4 语句,并通过迭代证明合成生成已验证证明轨迹
  • 智能体推理优化:设计双路径评估 pipeline 筛选真正需要工具辅助的 query(工具必要性 v_x = s_{w/.tool} - s_{w/o.tool}),并自动生成高质量工具调用轨迹
  • RL 阶段采用领域并行策略:分别对 STEM、代码、智能体任务独立优化,再融合为统一模型,最后进行通用对齐
  • 开发 DORA 异步 rollout 系统:支持多版本策略权重共存、KV-cache 重用与弹性角色共置,解决长尾生成与设备空闲问题
  • 算法层面改进 GRPO:引入带替换在线过滤、陈旧性控制与不完整信号掩码,提升训练稳定性

关键结果

  • 在 MATH500 上达到 99.2% 准确率,在 AIME-25 上优于 OpenAI-o3,在 ARC-AGI 上以 50.3% 超越所有对比模型
  • MiniF2F-Test 形式化证明 pass@1 达 67.6%,领先 DeepSeek V3.1 达 18 个百分点
  • 启用工具后,AIME-25 平均 token 消耗从 19,653 降至 6,965(减少 64.5%),准确率保持不变
  • LiveCodeBench 编码得分 79.4%,超越所有开源模型,接近 GPT-5(80.6%)
  • 安全拒绝能力全面领先:Harmful 类别达 93.7%,Criminal 达 97.1%,Misinformation 达 93.0%

局限与风险

  • 未公开具体训练数据构成与采样比例细节,仅以图表形式展示 SFT 数据分布
  • DORA 系统依赖 PyTorch RPC 与定制调度器,复现需大规模分布式基础设施
  • 形式化证明依赖外部 Lean4 服务器验证,闭环生成流程对基础设施要求高
  • 领域并行训练虽提升稳定性,但增加模型融合复杂度,可能引入能力冲突风险

适合沉淀的概念

long-cot-cold-start-training, domain-parallel-reinforcement-learning, dora-asynchronous-rollout-system, formal-reasoning-with-lean4, agentic-tool-use-query-selection, iterative-proof-synthesis, moe-reasoning-model, group-relative-policy-optimization-grpo

阅读注意

  • 重点关注 2.2.2 节的形式化推理 pipeline 与 2.2.3 节的智能体 query 筛选机制,二者为数据构造核心创新
  • 图 5 和图 6 展示 DORA 系统的异步 rollout 与负载均衡机制,是理解其效率优势的关键
  • 表 2 提供全面 benchmark 对比,注意 LongCat-Flash-Thinking 在激活参数仅 27B 情况下的性能表现
  • 附录 A.1 和 A.2 补充了数据过滤与难度评估细节,有助于复现数据 pipeline

质量说明

  • 采用来源:cleanpapers/2025/09/2509.18883.md
  • 生成模型:LongCat-Flash-Chat
  • 源材料判断:论文结构完整,方法描述清晰,实验充分,数据与系统细节披露合理,具备可复现性与技术深度