---
title: "LongCat-Flash Technical Report"
title_zh: "LongCat-Flash 技术报告"
arxiv_id: "2509.01322"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2025/09/2509.01322.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LongCat-Flash 技术报告

## 一句话定位

提出 LongCat-Flash，一个 560B 参数的 MoE 模型，通过零计算专家和捷径连接 MoE 架构实现高效训练与推理，并在代理任务上表现优异。

## 小学生也能听懂

这篇论文造了一个叫LongCat-Flash的大模型，像搭积木一样用很多“小专家”合作工作，聪明地只叫醒需要的专家，省下力气；还加快速度、稳训练，最后又快又省地学会了推理和干活，成绩很好。

## 为什么值得记录

- 提出零计算专家机制，实现动态计算资源分配，提升 MoE 模型效率
- 引入 Shortcut-connected MoE 架构，显著扩大计算-通信重叠窗口，提高训练和推理吞吐量
- 开发超参数迁移与模型增长初始化策略，支持大规模模型稳定训练
- 构建多阶段训练流程，增强模型在推理、编码和代理任务上的能力
- 实现 20T tokens 预训练在 30 天内完成，推理成本低至 $0.7/百万输出 token

## 核心方法

- 采用零计算专家（Zero-Computation Experts）机制，在 MoE 层中引入无计算开销的专家，结合 PID 控制器调节专家偏置，实现每 token 动态激活 18.6B–31.3B 参数（平均 27B）
- 使用 Shortcut-connected MoE（ScMoE）架构，通过跨层捷径重排执行流水线，使前一层 FFN 计算与当前 MoE 层的通信并行，提升系统效率
- 设计方差对齐机制：对 MLA 模块引入尺度校正因子 α_q 和 α_kv，解决低秩分解导致的方差失衡；对细粒度专家初始化引入补偿因子 γ = m，抵消门控稀释和维度缩减带来的方差损失
- 采用超参数迁移策略，基于小模型代理实验推导大模型最优初始化方差和学习率，遵循 Adam LR Full Align 规则进行宽度缩放
- 使用模型增长初始化（Model Growth），通过层堆叠将半尺度预训练模型扩展为目标规模，提升收敛速度和最终性能
- 实施多阶段训练：通用预训练 → 推理与编码增强 → 长上下文扩展至 128k，配合严格去污染流程
- 后训练阶段聚焦代理能力，构建多智能体合成框架生成高难度任务，涵盖信息处理、工具复杂度与用户交互三维度

## 关键结果

- 预训练 560B 模型于 20T tokens 上在 30 天内完成，训练可用性达 98.48%，无人工干预故障恢复
- 在 H800 上实现 >100 tokens/s 的推理吞吐量，输出成本为 $0.7/百万 token
- 基准测试表现：ArenaHard-V2 得分 86.5，TerminalBench 得分 39.5，τ²-Bench 得分 67.7，与 DeepSeek-V3.1 和 Kimi-K2 相当
- 在新构建的 Meeseeks 和 VitaBench 基准上表现优异，尤其在真实业务场景任务中超越其他模型
- MTP 头接受率 >90%，提升推理效率
- 动态路由分析显示模型能根据上下文重要性分配计算资源，浅层侧重词内语义，深层侧重预测复杂度

## 局限与风险

- 零计算专家机制依赖 PID 控制器调节，小批量训练时需降低更新频率以维持稳定性
- 模型增长初始化对前驱模型优化程度敏感，过度优化可能损害目标模型 token 效率
- ScMoE 架构虽提升效率，但其性能增益依赖于底层通信库（如 NCCL）和硬件拓扑优化
- 动态计算分配导致激活参数数波动（标准差较高），可能影响部署时的资源预留策略

## 适合沉淀的概念

`zero-computation-experts`, `shortcut-connected-moe`, `variance-alignment`, `hyperparameter-transfer`, `model-growth-initialization`, `multi-token-prediction`, `dynamic-routing`, `agentic-capability`

## 阅读注意

- 关注零计算专家如何通过 PID 控制器实现计算预算控制，以及其在不同语言/任务上的分配差异
- 理解 ScMoE 如何通过重排执行顺序实现计算-通信重叠，对比传统 MoE 与共享专家架构的瓶颈
- 注意方差对齐设计在 MLA 和细粒度专家中的具体实现方式及其对可扩展性的意义
- 分析多阶段训练流程中数据策略与能力增强的对应关系，特别是合成数据在代理任务中的作用
- 评估部分需区分通用能力与代理专项基准，注意新构建基准（Meeseeks, VitaBench）的设计动机

## 质量说明

- 采用来源：`clean`，`papers/2025/09/2509.01322.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，涵盖架构、训练策略、基础设施、推理优化与评估，技术细节充分，实验数据详实，具备可复现性与工程参考价值。
