用对比表格梳理 Qwen-VL 系列的架构演进:从 Qwen-VL 的固定分辨率 ViT,到 Qwen2-VL 引入 NaViT 动态分辨率与 2D-RoPE,再到 Qwen2.5-VL 重新设计的窗口注意力 ViT,覆盖视觉编码器、跨模态连接机制与训练策略的差异。
Qwen-VL 系列模型作为多模态大模型的重要代表,其架构演进体现了从基础视觉语言对齐到统一时空理解的技术飞跃。下面我将通过一个表格梳理它们的核心架构差异,然后补充一些关键细节。
| 特性维度 | Qwen-VL | Qwen2-VL | Qwen2.5-VL |
|---|---|---|---|
| 大型语言模型 (LLM) | Qwen-7B | Qwen2 | Qwen2.5 |
| 视觉编码器 (ViT) | OpenCLIP ViT-bigG (固定分辨率448×448) | DFN初始化,支持动态分辨率 (NaViT策略),2D-RoPE | 重新设计的ViT,窗口注意力 (大多数层),2D-RoPE,支持3D Patch划分处理视频 |
| 视觉-语言连接机制 | 位置感知的VL Adapter(单层交叉注意力,压缩至256个token) | MLP压缩器 (相邻2x2视觉token合并) | MLP压缩器 (空间相邻4个patch特征分组后经双层MLP投影) |
| 位置编码 | 2D绝对位置编码 | 2D-RoPE + M-RoPE (多模态旋转位置嵌入,分解为时间、高度、宽度) | 2D-RoPE + 与绝对时间对齐的M-RoPE (时间ID与真实时间戳对齐) |
| 图像处理 | 固定分辨率 (预训练224²,多任务预训练和SFT时448²) | 原生动态分辨率 (Sequence Packing),支持任意分辨率输入 | 原生动态分辨率 |
| 视频处理 | 不支持 | 统一图像和视频理解 (每秒2帧采样,3D卷积处理,帧分辨率动态调整) | 动态FPS采样,绝对时间编码,支持长视频理解 (小时级)和精细时间定位 (秒级) |
| 训练数据量 | 预训练: ~14亿图文对SFT: 35万指令数据 | 较Qwen-VL进一步增加 | 大幅提升:预训练语料库从 |
| 训练策略 | 三阶段:预训练(冻结LLM)→ 多任务预训练(全参数)→ 指令微调(冻结ViT) | 类似三阶段训练 | 三阶段预训练 (训练ViT → 全参数解冻 → 加入视频/代理数据并增加序列长度) + 双阶段后训练(SFT + DPO) |
视觉编码器 (ViT) 与处理能力
Qwen-VL 使用固定分辨率的ViT,这在当时是常见做法,但限制了模型处理不同尺寸图像和细节的能力。
Qwen2-VL 引入了 动态分辨率 处理(NaViT策略)和 2D-RoPE,使得模型能更灵活地处理任意分辨率的图像,并更好地捕捉图像的空间信息。
Qwen2.5-VL 的 ViT 进行了重新设计,采用 窗口注意力(Window Attention) 机制(大多数层使用,仅4层使用全局注意力)。这大幅降低了高分辨率输入带来的计算复杂度(从平方级降至线性级),提升了推理效率。同时,其支持3D Patch划分以更高效地处理视频序列。
视觉-语言连接机制
Qwen-VL 采用交叉注意力适配器(Adapter),将视觉Token压缩为固定长度(256个)再输入LLM,这是一种参数高效的方法。
Qwen2-VL 和 Qwen2.5-VL 都转向了更简单直接的 MLP压缩器(前者合并2x2 token,后者分组4个patch特征后经MLP投影),放开了对视觉Token数量的束缚,可能有助于保留更多视觉细节。
位置编码
Qwen-VL 使用2D绝对位置编码。
Qwen2-VL 引入了 M-RoPE,将位置信息分解为时间、高度和宽度三个分量,首次为多模态输入提供了统一的位置编码方案,增强了对视频时序信息的理解。
Qwen2.5-VL 的关键升级在于将 M-RoPE 的时间分量与绝对时间戳对齐,而不仅仅是帧序。这使得模型能更好地理解视频中的真实时间关系和节奏,提升了长视频理解和精细时间定位的能力。
模态支持与训练策略
Qwen-VL 专注于图像(不支持视频),采用经典的三阶段训练模式。
Qwen2-VL 开始统一图像和视频理解,引入了视频数据和处理方式(如3D卷积、动态调整帧分辨率)。
Qwen2.5-VL 在训练数据规模上大幅提升(预训练语料达4.1万亿token),并强调了动态FPS采样。其后训练阶段也更加精细,采用了 SFT (监督微调) 和 DPO (直接偏好优化) 结合的方式与人类偏好对齐。

