Qwen3 技术报告解读:三阶段预训练与思考模式统一

解读 Qwen3 的技术报告:通用、质量提升与长上下文三阶段预训练共约 36T token 的数据配比与学习率策略,以及长思维链冷启动、推理强化学习、思考模式融合与通用强化学习组成的四阶段后训练管线。

Qwen3 技术报告摘要

论文:Qwen3 Technical Report
团队:Qwen Team (阿里)
时间:2025.05(arXiv:2505.09388)
页数:35页


1. 预训练 Recipe

训练策略

项目详情
模型系列6个Dense (0.6B/1.7B/4B/8B/14B/32B) + 2个MoE (30B-A3B, 235B-A22B)
旗舰Qwen3-235B-A22B: 235B总参, 22B激活, 128experts with 8 activated
架构GQA + SwiGLU + RoPE + RMSNorm (pre-norm)
与Qwen2.5区别去除QKV-bias,引入 QK-Norm 保证稳定训练
MoE设计沿用Qwen2.5-MoE的fine-grained expert segmentation,128total experts, 8 activated
训练阶段三阶段预训练
Scaling Law基于三阶段分别建立 scaling law 预测最优 LR和 batch size

三阶段预训练

Stage 1: General Stage

  • 大规模通用语料预训练
  • 序列长度 4096 tokens
  • 原文未详述具体token数(仅提到总量约 36T,见下方数据部分推断)

Stage 2: Quality Improvement Stage

  • 约 5T更高质量 tokens
  • 序列长度 4096
  • 加速 learning rate decay

Stage 3: Long Context Stage

  • 数百B tokens
  • 序列长度扩展至 32,768
  • 语料组成:75% 长度16K32K的文本+ 25% 长度4K16K的文本
  • RoPE base frequency 从10,000提升到1,000,000(ABF技术)
  • 引入 YaRN + Dual Chunk Attention (DCA) 实现推理时4倍序列长度扩展

训练数据

项目详情
多语言从Qwen2.5 的 29种语言扩展到 119种语言和方言
数据来源原文未逐项列出数据源
数据规模原文未给出精确总token数(从MoE base超越DeepSeek-V3 Base的描述推断,规模应在30T+级别)
数据质量原文未详述数据清洗pipeline

Infra 设计

项目详情
原文未详述-

2. 后训练 Recipe(四阶段 Pipeline)

Qwen3 的后训练分为四个阶段,前两阶段构建thinking能力,后两阶段融合 non-thinking 能力:

Stage 1: Long-CoT Cold Start

项目详情
目标为模型注入长链推理能力的初始能力
数据范围数学、代码、逻辑推理、通用STEM问题
数据特点每个问题配有 verified reference answers或 code-based test cases
Query过滤用Qwen2.5-72B-Instruct 识别并移除不易验证的query(含多子问题的、要求通用文本生成的)
Response过滤原文提到两阶段过滤但未展开全部细节

Stage 2: ReasoningRL

项目详情
目标聚焦数学和代码任务的推理能力强化
算法原文未明确指定(从上下文推断为GRPO类)
效果Qwen3-235B-A22B 的 AIME’24 从 70.1提升至 85.1(170RL steps)
训练稳定性实现单次RL run中 reward和validation一致提升,无需手动调超参
奖励设计原文未详述此阶段具体reward

Stage 3: Thinking Mode Fusion

项目详情
目标将non-thinking 能力融合进 thinking model,实现统一模型双模式
方法在 Stage 2 模型上做 continual SFT
Thinking数据用 Stage 2 模型对 Stage 1 query 做 rejection sampling生成
Non-thinking数据精心策展覆盖多任务:coding、math、instruction-following、多语言、创意写作、QA、角色扮演
质量控制自动生成 checklists 评估 non-thinking数据的response质量
低资源语言增加翻译任务比例以增强低资源语言能力
Chat Template设计引入 /think/no_think flag控制模式;non-thinking mode保留空<think></think>块确保格式一致
Thinking Budget模型学会双模式后,自然能在不同thinking token预算下平滑降级

Stage 4: General RL

项目详情
目标全面提升模型在多样场景下的能力和稳定性
覆盖能力Instruction Following、Format Following、Preference Alignment、Agent Ability、RAG等20+任务
AgentRLrollout时允许模型与真实环境执行反馈做完整多轮交互
三类Reward①Rule-based Reward(指令遵循/格式正确性)②Model-based Reward with Reference(Qwen2.5-72B-Instruct打分)③Model-based Reward without Reference(基于人类偏好数据训练的scalar reward model)

3. Strong-to-Weak Distillation(轻量模型方案)

项目详情
适用模型5个Dense (0.6B~14B) + 1个MoE (30B-A3B)
效率仅需四阶段训练 1/10 的GPU hours
TeacherQwen3-32B 或 Qwen3-235B-A22B

Phase 1: Off-policy Distillation

  • 结合teacher在/think/no_think 模式下的输出做response distillation
  • 让学生模型获得基础推理能力和模式切换能力

Phase 2: On-policy Distillation

  • 学生模型自己生成responses(/think或/no_think模式)
  • 对齐学生logits与teacher logits,最小化KL散度
  • 效果:Pass@1和Pass@64均优于四阶段独立训练

4. 关键亮点

  1. Thinking/Non-thinking 统一框架:单模型支持 /think /no_think 动态切换 + thinking budget控制
  2. 四阶段后训练 pipeline:Long-CoT Cold Start → Reasoning RL → Thinking Mode Fusion → General RL
  3. Strong-to-Weak Distillation:off-policy+on-policy两阶段蒸馏,1/10 GPU hours达到更好效果
  4. 119种语言:从29种扩展到119种语言和方言
  5. MoE效率:235B-A22B以1/3总参、2/3激活参数超越DeepSeek-V3 Base
  6. General RL的Agent能力:rollout时与真实环境多轮交互,覆盖20+任务类型
本文结束 感谢您的阅读