解读 Qwen3-VL 的四阶段预训练设计与三项关键创新:交错式多模态 RoPE、把视觉特征分层注入语言模型的 DeepStack、以文本形式表达视频时间戳,以及平衡多模态 token 损失的平方根重加权策略。
Qwen3-VL 技术报告摘要
论文:Qwen3-VL Technical Report
团队:Qwen Team
时间:2025.11(arXiv:2511.21631)
页数:42页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 架构 | Vision Encoder (SigLIP-2) + MLP Merger + LLM (Qwen3) |
| 模型系列 | 4个Dense (2B/4B/8B/32B) + 2个MoE (30B-A3B, 235B-A22B) |
| ViT | SigLIP-2-SO-400M (大模型用) / SigLIP-2-Large-300M (2B/4B用),continual training with dynamic resolutions |
| 上下文 | 原生256K tokens |
| 预训练阶段 | 四阶段 |
四阶段预训练
| 阶段 | 目标 | 训练参数 | Token预算 | 序列长度 |
|---|---|---|---|---|
| S0 | Vision-Language Alignment | 仅Merger | 67B | 8,192 |
| S1 | Multimodal Pre-Training | 全部(ViT+Merger+LLM) | ~1T | 8,192 |
| S2 | Long-Context Pre-Training | 全部 | ~1T | 32,768 |
| S3 | Ultra-Long-Context Adaptation | 全部 | 100B | 262,144 |
S0: 仅训练MLP merger,ViT和LLM冻结;数据为image-caption pairs + visual knowledge + OCR
S1: 全参数训练;数据由VL data + text-only data混合组成:VL含interleaved image-text、visual grounding、VQA、STEM、少量video
S2: 序列长度4倍扩展至32K;增大text-only数据比例支撑长文本理解;VL数据大幅增加video和agent-oriented instruction-following数据
S3: 序列长度推至262,144;100B tokens of长视频+长文档理解数据
关键设计:Interleaved MRoPE
问题:Qwen2.5-VL的MRoPE将embedding dimensions分块为temporal(t)/horizontal(h)/vertical(w),导致频谱不均衡,损害长视频理解
做法:将t, h, w均匀交错分布到低频和高频bands中,而非分块分配
效果:更均衡的频率表示,改善长视频理解
关键设计:DeepStack
从ViT的不同层提取特征(三个不同level)
通过专用merger模块将多层级visual tokens投射后,直接加到LLM前三层的hidden states上
保留从low-level到high-level的丰富视觉信息
与原始DeepStack的区别:原始是stack多尺度视觉输入,这里是提取ViT中间层特征
关键设计:Text-based Video Timestamp
问题:Qwen2.5-VL的time-synchronized MRoPE对长视频产生过大且稀疏的temporal position ids,且需多种fps数据
做法:用文本token表示时间(如
<3.0 seconds>),支持seconds和HMS两种格式代价:slight上下文长度增加
效果:更精确的时间感知,支持video grounding和dense captioning
关键设计:Square-Root Reweighting
目的:平衡text-only和multimodal学习目标
做法:对multimodal loss施加square-root重加权
效果:提升多模态性能而不损害文本能力
具体公式/实现细节:原文仅在abstract中提及,未展开公式
训练数据
| 项目 | 详情 |
|---|---|
| Image Caption | 大规模中英web图文对,用fine-tuned Qwen2.5-VL-32B做recaptioning,语义相似度去重,visual embedding clustering补充稀疏区域 |
| Interleaved Text-Image | 中英网页多模态文档,domain classification过滤广告/低价值内容;book-scale数据用Qwen2.5-VL-7B做多模态解析,合并连续pages至256K |
| OCR/Chart/Table | 原文提到但未展开(沿用Qwen2.5-VL) |
| Video | 原文提到显著增量但未详述规模 |
Infra设计
| 项目 | 详情 |
|---|---|
| 原文未详述 | - |
2. 后训练 Recipe(三阶段)
Stage 1: SFT
| 项目 | 详情 |
|---|---|
| 数据量 | 约120万samples |
| 数据组成 | 1/3 text-only + 2/3 multimodal (image-text + video-text) |
| 语言 | 中英为主 + 多语言补充 |
| 对话复杂度 | 单轮+多轮,单图+多图+interleaved image-text |
| 新增能力 | spatial reasoning (embodied), image-grounded reasoning, spatio-temporal video grounding,数百页长技术文档理解 |
| 分阶段 | Phase 1: 32K序列长度 → Phase 2: 256K(长文档+长视频) |
| 模式分流 | Non-thinking models用标准格式, Thinking models用CoT格式 |
| 数据过滤 | Query Filtering(Qwen2.5-VL判断可验证性+复杂度)+ Response Filtering(Rule-based + Reward Model based多维评分) |
Stage 2: Strong-to-Weak Distillation
| 项目 | 详情 |
|---|---|
| 方法 | 用强teacher模型蒸馏到学生模型 |
| 关键发现 | 仅使用text-only data微调LLM backbone即可有效提升text和multimodal的reasoning能力 |
Stage 3: Reinforcement Learning
| 项目 | 详情 |
|---|---|
| 分两路 | ReasoningRL + General RL |
| 覆盖域 | 大规模RL横跨text和multimodal domains:math, OCR, grounding, instruction-following等 |
| 具体算法和超参 | 原文未详述 |
3. 关键亮点
- 四阶段预训练 (S0→S3):从67B alignment到1T multimodal再到256K ultra-long context,渐进式构建
- Interleaved MRoPE:t/h/w均匀交错分布替代分块,解决长视频理解的频率不均衡问题
- DeepStack:ViT多层特征注入LLM前三层,保留多粒度视觉信息
- Text-based Timestamp:文本token表示时间,替代position id式时间编码,更精确更易学
- Square-Root Reweighting:平衡text和multimodal loss,不损text能力
- Text-only Distillation for VLM:仅用text数据蒸馏即可提升多模态reasoning(关键发现)
- 256K原生上下文:支持数百页文档和数小时视频的端到端理解

