Qwen3-VL 技术报告解读:交错 MRoPE 与 DeepStack 视觉特征融合

解读 Qwen3-VL 的四阶段预训练设计与三项关键创新:交错式多模态 RoPE、把视觉特征分层注入语言模型的 DeepStack、以文本形式表达视频时间戳,以及平衡多模态 token 损失的平方根重加权策略。

Qwen3-VL 技术报告摘要

论文:Qwen3-VL Technical Report
团队:Qwen Team
时间:2025.11(arXiv:2511.21631)
页数:42页


1. 预训练 Recipe

训练策略

项目详情
架构Vision Encoder (SigLIP-2) + MLP Merger + LLM (Qwen3)
模型系列4个Dense (2B/4B/8B/32B) + 2个MoE (30B-A3B, 235B-A22B)
ViTSigLIP-2-SO-400M (大模型用) / SigLIP-2-Large-300M (2B/4B用),continual training with dynamic resolutions
上下文原生256K tokens
预训练阶段四阶段

四阶段预训练

阶段目标训练参数Token预算序列长度
S0Vision-Language Alignment仅Merger67B8,192
S1Multimodal Pre-Training全部(ViT+Merger+LLM)~1T8,192
S2Long-Context Pre-Training全部~1T32,768
S3Ultra-Long-Context Adaptation全部100B262,144

S0: 仅训练MLP merger,ViT和LLM冻结;数据为image-caption pairs + visual knowledge + OCR

S1: 全参数训练;数据由VL data + text-only data混合组成:VL含interleaved image-text、visual grounding、VQA、STEM、少量video

S2: 序列长度4倍扩展至32K;增大text-only数据比例支撑长文本理解;VL数据大幅增加video和agent-oriented instruction-following数据

S3: 序列长度推至262,144;100B tokens of长视频+长文档理解数据

关键设计:Interleaved MRoPE

  • 问题:Qwen2.5-VL的MRoPE将embedding dimensions分块为temporal(t)/horizontal(h)/vertical(w),导致频谱不均衡,损害长视频理解

  • 做法:将t, h, w均匀交错分布到低频和高频bands中,而非分块分配

  • 效果:更均衡的频率表示,改善长视频理解

    关键设计:DeepStack

  • 从ViT的不同层提取特征(三个不同level)

  • 通过专用merger模块将多层级visual tokens投射后,直接加到LLM前三层的hidden states上

  • 保留从low-level到high-level的丰富视觉信息

  • 与原始DeepStack的区别:原始是stack多尺度视觉输入,这里是提取ViT中间层特征

    关键设计:Text-based Video Timestamp

  • 问题:Qwen2.5-VL的time-synchronized MRoPE对长视频产生过大且稀疏的temporal position ids,且需多种fps数据

  • 做法:用文本token表示时间(如<3.0 seconds>),支持seconds和HMS两种格式

  • 代价:slight上下文长度增加

  • 效果:更精确的时间感知,支持video grounding和dense captioning

    关键设计:Square-Root Reweighting

  • 目的:平衡text-only和multimodal学习目标

  • 做法:对multimodal loss施加square-root重加权

  • 效果:提升多模态性能而不损害文本能力

  • 具体公式/实现细节:原文仅在abstract中提及,未展开公式

    训练数据

项目详情
Image Caption大规模中英web图文对,用fine-tuned Qwen2.5-VL-32B做recaptioning,语义相似度去重,visual embedding clustering补充稀疏区域
Interleaved Text-Image中英网页多模态文档,domain classification过滤广告/低价值内容;book-scale数据用Qwen2.5-VL-7B做多模态解析,合并连续pages至256K
OCR/Chart/Table原文提到但未展开(沿用Qwen2.5-VL)
Video原文提到显著增量但未详述规模

Infra设计

项目详情
原文未详述-

2. 后训练 Recipe(三阶段)

Stage 1: SFT

项目详情
数据量约120万samples
数据组成1/3 text-only + 2/3 multimodal (image-text + video-text)
语言中英为主 + 多语言补充
对话复杂度单轮+多轮,单图+多图+interleaved image-text
新增能力spatial reasoning (embodied), image-grounded reasoning, spatio-temporal video grounding,数百页长技术文档理解
分阶段Phase 1: 32K序列长度 → Phase 2: 256K(长文档+长视频)
模式分流Non-thinking models用标准格式, Thinking models用CoT格式
数据过滤Query Filtering(Qwen2.5-VL判断可验证性+复杂度)+ Response Filtering(Rule-based + Reward Model based多维评分)

Stage 2: Strong-to-Weak Distillation

项目详情
方法用强teacher模型蒸馏到学生模型
关键发现仅使用text-only data微调LLM backbone即可有效提升text和multimodal的reasoning能力

Stage 3: Reinforcement Learning

项目详情
分两路ReasoningRL + General RL
覆盖域大规模RL横跨text和multimodal domains:math, OCR, grounding, instruction-following等
具体算法和超参原文未详述

3. 关键亮点

  1. 四阶段预训练 (S0→S3):从67B alignment到1T multimodal再到256K ultra-long context,渐进式构建
  2. Interleaved MRoPE:t/h/w均匀交错分布替代分块,解决长视频理解的频率不均衡问题
  3. DeepStack:ViT多层特征注入LLM前三层,保留多粒度视觉信息
  4. Text-based Timestamp:文本token表示时间,替代position id式时间编码,更精确更易学
  5. Square-Root Reweighting:平衡text和multimodal loss,不损text能力
  6. Text-only Distillation for VLM:仅用text数据蒸馏即可提升多模态reasoning(关键发现)
  7. 256K原生上下文:支持数百页文档和数小时视频的端到端理解
本文结束 感谢您的阅读