Qwen-VL 系列架构演进梳理:从固定分辨率到统一时空理解

用对比表格梳理 Qwen-VL 系列的架构演进:从 Qwen-VL 的固定分辨率 ViT,到 Qwen2-VL 引入 NaViT 动态分辨率与 2D-RoPE,再到 Qwen2.5-VL 重新设计的窗口注意力 ViT,覆盖视觉编码器、跨模态连接机制与训练策略的差异。

Qwen-VL 系列模型作为多模态大模型的重要代表,其架构演进体现了从基础视觉语言对齐到统一时空理解的技术飞跃。下面我将通过一个表格梳理它们的核心架构差异,然后补充一些关键细节。

特性维度Qwen-VLQwen2-VLQwen2.5-VL
大型语言模型 (LLM)Qwen-7BQwen2Qwen2.5
视觉编码器 (ViT)OpenCLIP ViT-bigG (固定分辨率448×448)DFN初始化,支持动态分辨率 (NaViT策略),2D-RoPE重新设计的ViT,窗口注意力 (大多数层),2D-RoPE,支持3D Patch划分处理视频
视觉-语言连接机制位置感知的VL Adapter(单层交叉注意力,压缩至256个token)MLP压缩器 (相邻2x2视觉token合并)MLP压缩器 (空间相邻4个patch特征分组后经双层MLP投影)
位置编码2D绝对位置编码2D-RoPE + M-RoPE (多模态旋转位置嵌入,分解为时间、高度、宽度)2D-RoPE + 与绝对时间对齐的M-RoPE (时间ID与真实时间戳对齐)
图像处理固定分辨率 (预训练224²,多任务预训练和SFT时448²)原生动态分辨率 (Sequence Packing),支持任意分辨率输入原生动态分辨率
视频处理不支持统一图像和视频理解 (每秒2帧采样,3D卷积处理,帧分辨率动态调整)动态FPS采样绝对时间编码,支持长视频理解 (小时级)和精细时间定位 (秒级)
训练数据量预训练: ~14亿图文对SFT: 35万指令数据较Qwen-VL进一步增加大幅提升:预训练语料库从1.2万亿token扩展到**4.1万亿token**
训练策略三阶段:预训练(冻结LLM)→ 多任务预训练(全参数)→ 指令微调(冻结ViT)类似三阶段训练三阶段预训练 (训练ViT → 全参数解冻 → 加入视频/代理数据并增加序列长度) + 双阶段后训练(SFT + DPO)

视觉编码器 (ViT) 与处理能力

  • Qwen-VL 使用固定分辨率的ViT,这在当时是常见做法,但限制了模型处理不同尺寸图像和细节的能力。

  • Qwen2-VL 引入了 动态分辨率 处理(NaViT策略)和 2D-RoPE,使得模型能更灵活地处理任意分辨率的图像,并更好地捕捉图像的空间信息。

  • Qwen2.5-VL 的 ViT 进行了重新设计,采用 窗口注意力(Window Attention) 机制(大多数层使用,仅4层使用全局注意力)。这大幅降低了高分辨率输入带来的计算复杂度(从平方级降至线性级),提升了推理效率。同时,其支持3D Patch划分以更高效地处理视频序列。

    视觉-语言连接机制

  • Qwen-VL 采用交叉注意力适配器(Adapter),将视觉Token压缩为固定长度(256个)再输入LLM,这是一种参数高效的方法。

  • Qwen2-VLQwen2.5-VL 都转向了更简单直接MLP压缩器(前者合并2x2 token,后者分组4个patch特征后经MLP投影),放开了对视觉Token数量的束缚,可能有助于保留更多视觉细节。

    位置编码

  • Qwen-VL 使用2D绝对位置编码

  • Qwen2-VL 引入了 M-RoPE,将位置信息分解为时间、高度和宽度三个分量,首次为多模态输入提供了统一的位置编码方案,增强了对视频时序信息的理解。

  • Qwen2.5-VL 的关键升级在于将 M-RoPE 的时间分量与绝对时间戳对齐,而不仅仅是帧序。这使得模型能更好地理解视频中的真实时间关系和节奏,提升了长视频理解和精细时间定位的能力。

    模态支持与训练策略

  • Qwen-VL 专注于图像(不支持视频),采用经典的三阶段训练模式。

  • Qwen2-VL 开始统一图像和视频理解,引入了视频数据和处理方式(如3D卷积、动态调整帧分辨率)。

  • Qwen2.5-VL训练数据规模上大幅提升(预训练语料达4.1万亿token),并强调了动态FPS采样。其后训练阶段也更加精细,采用了 SFT (监督微调) 和 DPO (直接偏好优化) 结合的方式与人类偏好对齐。

本文结束 感谢您的阅读