Qwen3 Technical Report
论文导读
Qwen3 是一系列支持动态推理模式切换与多语言能力的大规模语言模型,涵盖 0.6B 到 235B 参数规模,采用 MoE 与稠密架构,在代码、数学、智能体任务上达到 SOTA 性能。
- 一句话定位
- 小学生也能听懂
- 为什么值得记录
- 核心方法
- 关键结果
- 局限与风险
- 适合沉淀的概念
- 阅读注意
Qwen3 技术报告
一句话定位
Qwen3 是一系列支持动态推理模式切换与多语言能力的大规模语言模型,涵盖 0.6B 到 235B 参数规模,采用 MoE 与稠密架构,在代码、数学、智能体任务上达到 SOTA 性能。
小学生也能听懂
这篇论文造了一个叫Qwen3的聪明机器人,它能像人一样“思考”或“不思考”来回答问题,还能说119种语言,做数学题和写代码特别厉害,而且用更少的零件(参数)做到了比别的大机器人还强。
为什么值得记录
- 首次在单一模型中统一‘思考模式’与‘非思考模式’,无需切换模型即可适配不同任务需求
- 引入‘思考预算’机制,用户可动态控制推理深度以平衡延迟与性能
- 预训练数据扩展至 36 万亿 token,支持 119 种语言,显著提升跨语言理解能力
- MoE 架构设计高效,Qwen3-235B-A22B 仅激活 22B 参数即可超越更大规模模型
- 通过强到弱蒸馏大幅降低小模型训练成本,性能优于同等规模模型
核心方法
- 采用三阶段预训练:通用知识(30T token)→ 推理增强(5T 高质量 STEM/代码数据)→ 长上下文扩展(32K 上下文,RoPE 频率提升至 1e6)
- 后训练四阶段流程:长链思维冷启动 → 推理强化学习(GRPO)→ 思维/非思维模式融合 SFT → 通用领域 RL
- 使用 Qwen2.5-VL 提取 PDF 文本,结合 Qwen2.5-Math/Coder 合成高质量训练数据
- MoE 模型采用细粒度专家分割(128 专家,每 token 激活 8 个),无共享专家,引入全局负载均衡损失
- 设计专用 chat template,通过 /think 和 /no_think 标志实现模式切换,默认启用思考模式
- 思考预算机制:在推理中强制截断思考过程并插入停止指令,实现计算资源可控分配
- 小模型采用强到弱蒸馏策略,利用大模型 logits 进行知识迁移,训练效率提升 10 倍
关键结果
- Qwen3-235B-A22B-Base 在 15 项基准测试中 14 项超越 DeepSeek-V3,总参数量少 2/3,激活参数少 1/3
- Qwen3-32B-Base 在 MMLU-Pro(65.54)、SuperGPQA(39.78)等指标上显著优于 Qwen2.5-32B,且接近 Qwen2.5-72B 性能
- Qwen3-8B/4B/1.7B 在 STEM 和代码任务上普遍超越更大规模的 Qwen2.5 模型(如 Qwen3-8B > Qwen2.5-14B)
- 后训练模型在 AIME'24 上达 85.7,LiveCodeBench v5 达 70.7,CodeForces 分数 2056,BFCL v3 达 70.8
- 增加思考预算 token 数量可稳定提升任务性能,验证推理时扩展有效性
局限与风险
- 未提供完整训练超参数细节(如学习率调度、batch size 具体数值)
- 思考预算机制依赖人工设定阈值,缺乏自适应策略
- 蒸馏方法虽高效,但未与纯 RL 方法进行公平对比实验
- 多语言能力评估集中于 MGSM、MMMLU 等有限基准,缺乏低资源语言深入分析
适合沉淀的概念
thinking-mode-fusion, thinking-budget-control, strong-to-weak-distillation, long-context-pretraining, moe-architecture, chat-template-design, reinforcement-learning-grpo, multilingual-pretraining
阅读注意
- 关注 MoE 模型中专家数量与激活策略对推理效率的影响
- 注意三阶段预训练中数据混合比例的变化及其对最终性能的作用
- 思考模式融合阶段的 SFT 数据构造方式(拒绝采样 + 多样性任务覆盖)是关键创新点
- chat template 中 /think 与 /no_think 标志的设计直接影响模式切换的可靠性
- 强到弱蒸馏在小模型上的成功表明知识迁移比独立训练更高效
质量说明
- 采用来源:
clean,papers/2025/05/2505.09388.md - 生成模型:
LongCat-Flash-Chat - 源材料判断:论文提供了完整的架构、训练流程、实验结果与分析,数据详实,方法描述清晰,具备可复现性基础。