解读 Qwen3 的技术报告:通用、质量提升与长上下文三阶段预训练共约 36T token 的数据配比与学习率策略,以及长思维链冷启动、推理强化学习、思考模式融合与通用强化学习组成的四阶段后训练管线。
Qwen3 技术报告摘要
论文:Qwen3 Technical Report
团队:Qwen Team (阿里)
时间:2025.05(arXiv:2505.09388)
页数:35页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型系列 | 6个Dense (0.6B/1.7B/4B/8B/14B/32B) + 2个MoE (30B-A3B, 235B-A22B) |
| 旗舰 | Qwen3-235B-A22B: 235B总参, 22B激活, 128experts with 8 activated |
| 架构 | GQA + SwiGLU + RoPE + RMSNorm (pre-norm) |
| 与Qwen2.5区别 | 去除QKV-bias,引入 QK-Norm 保证稳定训练 |
| MoE设计 | 沿用Qwen2.5-MoE的fine-grained expert segmentation,128total experts, 8 activated |
| 训练阶段 | 三阶段预训练 |
| Scaling Law | 基于三阶段分别建立 scaling law 预测最优 LR和 batch size |
三阶段预训练
Stage 1: General Stage
- 大规模通用语料预训练
- 序列长度 4096 tokens
- 原文未详述具体token数(仅提到总量约 36T,见下方数据部分推断)
Stage 2: Quality Improvement Stage
- 约 5T更高质量 tokens
- 序列长度 4096
- 加速 learning rate decay
Stage 3: Long Context Stage
- 数百B tokens
- 序列长度扩展至 32,768
- 语料组成:75% 长度16K
32K的文本+ 25% 长度4K16K的文本 - RoPE base frequency 从10,000提升到1,000,000(ABF技术)
- 引入 YaRN + Dual Chunk Attention (DCA) 实现推理时4倍序列长度扩展
训练数据
| 项目 | 详情 |
|---|---|
| 多语言 | 从Qwen2.5 的 29种语言扩展到 119种语言和方言 |
| 数据来源 | 原文未逐项列出数据源 |
| 数据规模 | 原文未给出精确总token数(从MoE base超越DeepSeek-V3 Base的描述推断,规模应在30T+级别) |
| 数据质量 | 原文未详述数据清洗pipeline |
Infra 设计
| 项目 | 详情 |
|---|---|
| 原文未详述 | - |
2. 后训练 Recipe(四阶段 Pipeline)
Qwen3 的后训练分为四个阶段,前两阶段构建thinking能力,后两阶段融合 non-thinking 能力:
Stage 1: Long-CoT Cold Start
| 项目 | 详情 |
|---|---|
| 目标 | 为模型注入长链推理能力的初始能力 |
| 数据范围 | 数学、代码、逻辑推理、通用STEM问题 |
| 数据特点 | 每个问题配有 verified reference answers或 code-based test cases |
| Query过滤 | 用Qwen2.5-72B-Instruct 识别并移除不易验证的query(含多子问题的、要求通用文本生成的) |
| Response过滤 | 原文提到两阶段过滤但未展开全部细节 |
Stage 2: ReasoningRL
| 项目 | 详情 |
|---|---|
| 目标 | 聚焦数学和代码任务的推理能力强化 |
| 算法 | 原文未明确指定(从上下文推断为GRPO类) |
| 效果 | Qwen3-235B-A22B 的 AIME’24 从 70.1提升至 85.1(170RL steps) |
| 训练稳定性 | 实现单次RL run中 reward和validation一致提升,无需手动调超参 |
| 奖励设计 | 原文未详述此阶段具体reward |
Stage 3: Thinking Mode Fusion
| 项目 | 详情 |
|---|---|
| 目标 | 将non-thinking 能力融合进 thinking model,实现统一模型双模式 |
| 方法 | 在 Stage 2 模型上做 continual SFT |
| Thinking数据 | 用 Stage 2 模型对 Stage 1 query 做 rejection sampling生成 |
| Non-thinking数据 | 精心策展覆盖多任务:coding、math、instruction-following、多语言、创意写作、QA、角色扮演 |
| 质量控制 | 自动生成 checklists 评估 non-thinking数据的response质量 |
| 低资源语言 | 增加翻译任务比例以增强低资源语言能力 |
| Chat Template设计 | 引入 /think 和 /no_think flag控制模式;non-thinking mode保留空<think></think>块确保格式一致 |
| Thinking Budget | 模型学会双模式后,自然能在不同thinking token预算下平滑降级 |
Stage 4: General RL
| 项目 | 详情 |
|---|---|
| 目标 | 全面提升模型在多样场景下的能力和稳定性 |
| 覆盖能力 | Instruction Following、Format Following、Preference Alignment、Agent Ability、RAG等20+任务 |
| AgentRL | rollout时允许模型与真实环境执行反馈做完整多轮交互 |
| 三类Reward | ①Rule-based Reward(指令遵循/格式正确性)②Model-based Reward with Reference(Qwen2.5-72B-Instruct打分)③Model-based Reward without Reference(基于人类偏好数据训练的scalar reward model) |
3. Strong-to-Weak Distillation(轻量模型方案)
| 项目 | 详情 |
|---|---|
| 适用模型 | 5个Dense (0.6B~14B) + 1个MoE (30B-A3B) |
| 效率 | 仅需四阶段训练 1/10 的GPU hours |
| Teacher | Qwen3-32B 或 Qwen3-235B-A22B |
Phase 1: Off-policy Distillation
- 结合teacher在
/think和/no_think模式下的输出做response distillation - 让学生模型获得基础推理能力和模式切换能力
Phase 2: On-policy Distillation
- 学生模型自己生成responses(/think或/no_think模式)
- 对齐学生logits与teacher logits,最小化KL散度
- 效果:Pass@1和Pass@64均优于四阶段独立训练
4. 关键亮点
- Thinking/Non-thinking 统一框架:单模型支持
/think/no_think动态切换 + thinking budget控制 - 四阶段后训练 pipeline:Long-CoT Cold Start → Reasoning RL → Thinking Mode Fusion → General RL
- Strong-to-Weak Distillation:off-policy+on-policy两阶段蒸馏,1/10 GPU hours达到更好效果
- 119种语言:从29种扩展到119种语言和方言
- MoE效率:235B-A22B以1/3总参、2/3激活参数超越DeepSeek-V3 Base
- General RL的Agent能力:rollout时与真实环境多轮交互,覆盖20+任务类型

