---
title: "LongCat-Flash-Thinking-2601 Technical Report"
title_zh: "LongCat-Flash-Thinking-2601 技术报告"
arxiv_id: "2601.16725"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2026/01/2601.16725.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# LongCat-Flash-Thinking-2601 技术报告

## 一句话定位

提出 LongCat-Flash-Thinking-2601，一个 560B 参数的 MoE 推理模型，通过环境扩展、噪声鲁棒训练和 Heavy Thinking 模式实现领先的代理推理能力。

## 小学生也能听懂

这篇论文造了一个叫LongCat的大模型，它像有5600亿个“小帮手”分工合作，通过模拟真实环境、抗噪音训练和“深度思考”模式，让AI能像人一样一步步解决复杂任务，在多个测试中表现最好。

## 为什么值得记录

- 在多个代理基准测试中达到开源模型最优性能，包括 BrowseComp (73.1%)、RWSearch (77.7%) 和 τ²-Bench (88.2%)
- 提出可扩展的环境构建框架，支持超过 20 个领域的 32,000 个并发环境训练
- 引入 Heavy Thinking 模式，通过并行推理路径探索和迭代优化实现测试时计算扩展
- 系统分析真实世界噪声并设计渐进式课程学习策略，显著提升模型在噪声环境下的鲁棒性

## 核心方法

- 采用混合数据合成策略：文本驱动合成（从教程等提取隐式流程）与环境接地合成（基于可执行工具链生成轨迹）
- 设计规划导向的数据增强方法，将线性轨迹转化为多步决策过程以强化规划能力
- 扩展异步强化学习框架 DORA，支持大规模多环境训练（>10,000 环境）与 PD 解耦 CPU 交换机制
- 构建自动化环境扩展流水线：基于工具依赖图进行 BFS 式可控扩展，确保数据库一致性与可验证性
- 引入滑动窗口困惑度（sliding-window PPL）指导 K-Center-Greedy 数据选择，优化冷启动策略
- 实现 Heavy Thinking 模式：分解问题为互补阶段，联合扩展推理宽度与深度，并通过额外 RL 阶段强化中间结果聚合

## 关键结果

- 在 BrowseComp 上达到 73.1% Pass@1，RWSearch 上 77.7%，τ²-Bench 上 88.2%，VitaBench 上 29.3%
- 通过 80K token 上下文摘要阈值优化，BrowseComp 准确率从 63.86% 提升至峰值 66.58%
- 在数学推理（AIME 2025）、代码（LiveCodeBench）和通用 QA（Humanity's Last Exam）基准上保持竞争力
- 噪声注入训练使模型在真实世界复杂工具交互中表现出强泛化能力

## 局限与风险

- Heavy Thinking 模式显著增加推理延迟，需权衡响应速度与性能
- 环境构建依赖人工定义领域 schema，自动化程度仍有提升空间
- 未公开完整训练细节与超参数，复现存在一定门槛

## 适合沉淀的概念

`agentic-reasoning`, `environment-scaling`, `heavy-thinking-mode`, `asynchronous-rl`, `noise-robust-training`, `planning-oriented-data-augmentation`, `tool-dependency-graph`, `sliding-window-ppl`

## 阅读注意

- 重点关注第 3 节中环境构建与 RL 基础设施的协同设计
- 附录 A 提供了基于小模型预测大模型最优超参数的方法，具有工程参考价值
- Heavy Thinking 模式与 OpenAI o1、Kimi K2 等测试时扩展方法形成对比，强调并行轨迹探索
- 图 2 显示增强版 mid-training 显著提升 τ²-Bench 上的 pass@k 曲线

## 质量说明

- 采用来源：`clean`，`papers/2026/01/2601.16725.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文材料完整，包含方法细节、实验结果与附录分析，数据充分支持结论。
