---
title: "Qwen3 Technical Report"
title_zh: "Qwen3 技术报告"
arxiv_id: "2505.09388"
paper_type: "model"
source_kind: "clean"
raw_path: "raw/papers/2025/05/2505.09388.md"
generated: "2026-05-11"
model: "LongCat-Flash-Chat"
quality: "ok"
---

# Qwen3 技术报告

## 一句话定位

Qwen3 是一系列支持动态推理模式切换与多语言能力的大规模语言模型，涵盖 0.6B 到 235B 参数规模，采用 MoE 与稠密架构，在代码、数学、智能体任务上达到 SOTA 性能。

## 小学生也能听懂

这篇论文造了一个叫Qwen3的聪明机器人，它能像人一样“思考”或“不思考”来回答问题，还能说119种语言，做数学题和写代码特别厉害，而且用更少的零件（参数）做到了比别的大机器人还强。

## 为什么值得记录

- 首次在单一模型中统一‘思考模式’与‘非思考模式’，无需切换模型即可适配不同任务需求
- 引入‘思考预算’机制，用户可动态控制推理深度以平衡延迟与性能
- 预训练数据扩展至 36 万亿 token，支持 119 种语言，显著提升跨语言理解能力
- MoE 架构设计高效，Qwen3-235B-A22B 仅激活 22B 参数即可超越更大规模模型
- 通过强到弱蒸馏大幅降低小模型训练成本，性能优于同等规模模型

## 核心方法

- 采用三阶段预训练：通用知识（30T token）→ 推理增强（5T 高质量 STEM/代码数据）→ 长上下文扩展（32K 上下文，RoPE 频率提升至 1e6）
- 后训练四阶段流程：长链思维冷启动 → 推理强化学习（GRPO）→ 思维/非思维模式融合 SFT → 通用领域 RL
- 使用 Qwen2.5-VL 提取 PDF 文本，结合 Qwen2.5-Math/Coder 合成高质量训练数据
- MoE 模型采用细粒度专家分割（128 专家，每 token 激活 8 个），无共享专家，引入全局负载均衡损失
- 设计专用 chat template，通过 /think 和 /no_think 标志实现模式切换，默认启用思考模式
- 思考预算机制：在推理中强制截断思考过程并插入停止指令，实现计算资源可控分配
- 小模型采用强到弱蒸馏策略，利用大模型 logits 进行知识迁移，训练效率提升 10 倍

## 关键结果

- Qwen3-235B-A22B-Base 在 15 项基准测试中 14 项超越 DeepSeek-V3，总参数量少 2/3，激活参数少 1/3
- Qwen3-32B-Base 在 MMLU-Pro（65.54）、SuperGPQA（39.78）等指标上显著优于 Qwen2.5-32B，且接近 Qwen2.5-72B 性能
- Qwen3-8B/4B/1.7B 在 STEM 和代码任务上普遍超越更大规模的 Qwen2.5 模型（如 Qwen3-8B > Qwen2.5-14B）
- 后训练模型在 AIME'24 上达 85.7，LiveCodeBench v5 达 70.7，CodeForces 分数 2056，BFCL v3 达 70.8
- 增加思考预算 token 数量可稳定提升任务性能，验证推理时扩展有效性

## 局限与风险

- 未提供完整训练超参数细节（如学习率调度、batch size 具体数值）
- 思考预算机制依赖人工设定阈值，缺乏自适应策略
- 蒸馏方法虽高效，但未与纯 RL 方法进行公平对比实验
- 多语言能力评估集中于 MGSM、MMMLU 等有限基准，缺乏低资源语言深入分析

## 适合沉淀的概念

`thinking-mode-fusion`, `thinking-budget-control`, `strong-to-weak-distillation`, `long-context-pretraining`, `moe-architecture`, `chat-template-design`, `reinforcement-learning-grpo`, `multilingual-pretraining`

## 阅读注意

- 关注 MoE 模型中专家数量与激活策略对推理效率的影响
- 注意三阶段预训练中数据混合比例的变化及其对最终性能的作用
- 思考模式融合阶段的 SFT 数据构造方式（拒绝采样 + 多样性任务覆盖）是关键创新点
- chat template 中 /think 与 /no_think 标志的设计直接影响模式切换的可靠性
- 强到弱蒸馏在小模型上的成功表明知识迁移比独立训练更高效

## 质量说明

- 采用来源：`clean`，`papers/2025/05/2505.09388.md`
- 生成模型：`LongCat-Flash-Chat`
- 源材料判断：论文提供了完整的架构、训练流程、实验结果与分析，数据详实，方法描述清晰，具备可复现性基础。
