解读 Qwen2.5-VL 的关键设计:支持任意分辨率输入的原生动态分辨率 ViT 配合窗口注意力大幅降低计算开销、对齐绝对时间而非归一化位置的多模态 RoPE 实现秒级事件定位,以及 SFT 加 DPO 的后训练流程。
Qwen2.5-VL技术报告摘要
论文:Qwen2.5-VL Technical Report
团队:Qwen Team, Alibaba Group
时间:2025.02(arXiv:2502.13923)
页数:23页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 架构 | 三组件:Vision Encoder (ViT) + MLP Vision-Language Merger + LLM (Qwen2.5) |
| LLM初始化 | 从Qwen2.5 LLM预训练权重初始化 |
| ViT | 从零训练的原生动态分辨率ViT,patch size=14,window attention +2D-RoPE |
| Merger | 将4个相邻patch feature拼接后过2层MLP,压缩4倍视觉token数 |
| 位置编码改造 | 将1D RoPE改为Multimodal Rotary Position Embedding Aligned to Absolute Time |
| 训练阶段 | 三阶段预训练 |
| 序列长度 | Phase 1&2: 8192; Phase 3: 32768 |
| LLM训练tokens | 4.1T (各尺寸相同) |
关键设计:Native Dynamic-Resolution ViT
使用 Window Attention(window size=112)处理大部分层,仅在特定层(index 7,15,23,31)使用full attention
支持任意分辨率输入(高宽resize为28的倍数)
相比全局attention显著降低计算开销
关键设计:Multimodal RoPE Aligned to Absolute Time
对视频帧使用绝对时间编码而非归一化位置
使模型能原生感知时间动态,实现秒级事件定位
无需传统的时间归一化技术
训练数据
| 项目 | 详情 |
|---|---|
| 相比Qwen2-VL | 预训练数据从1.2T扩展到4T tokens |
| 数据类型 | Interleaved image-text, OCR, 文档解析, 图表, 视频, 定位(grounding) |
| OCR数据 | 合成数据(visual text generation engine) + 开源 + 自有收集;支持法/德/意/西/葡/阿/俄/日/韩/越等多语言 |
| 图表数据 | 100万合成样本(matplotlib/seaborn/plotly),涵盖bar/relational/heatmap等 |
| 表格数据 | 600万真实样本,经离线端到端表格识别模型处理后过滤低置信/重叠/稀疏表格 |
| 文档格式 | 设计了 QwenVL HTML Format:统一表示文档布局/文本/图表/公式/化学式/乐谱等 |
| 视频数据 | 原文提到支持小时级长视频,具体数据量未详述 |
Infra设计
| 项目 | 详情 |
|---|---|
| 负载均衡 | 按LLM输入序列长度动态packing数据,确保GPU间一致计算负载 |
| 其他 | 原文未详述集群规模和并行策略 |
2. 后训练 Recipe (SFT + DPO)
SFT 阶段
| 项目 | 详情 |
|---|---|
| 方法 | SFT with ChatML format |
| 数据量 | 约200万条entries |
| 数据比例 | 纯文本50% + 多模态50%(image-text + video-text) |
| 语言 | 主要中英文,补充多语言 |
| 对话复杂度 | 单轮+多轮;单图+多图序列 |
| Query来源 | 开源 + 购买 + 在线query |
| 任务覆盖 | General VQA, Captioning, Math, Coding, 安全, Doc/OCR, Grounding, Video Analysis, Agent |
关键设计:两阶段数据过滤 Pipeline
Stage 1: Domain-Specific Categorization
- 使用 Qwen2-VL-Instag(基于Qwen2-VL-72B的分类模型)对样本分域分类
Stage 2: (原文后续描述被截断,应为质量评分和过滤)
DPO 阶段
| 项目 | 详情 |
|---|---|
| 方法 | Direct Preference Optimization |
| 用途 | Human preference distillation,行为精化 |
| 细节 | 原文描述较简略 |
3. RL Recipe
| 项目 | 详情 |
|---|---|
| 本报告未涉及独立RL阶段 | 后训练仅含SFT + DPO |
4. 关键亮点
- Native Dynamic-Resolution ViT:从零训练,Window Attention + 2D-RoPE,支持任意分辨率,显著降低计算
- Absolute Time Encoding:视频帧用绝对时间位置编码,实现秒级事件定位
- QwenVL HTML Format:统一文档表示格式,涵盖layout/text/chart/formula/music sheet/chemical formula
- 4T预训练tokens:相比Qwen2-VL的1.2T提升3.3倍
- MLP Merger压缩:4个patch feature合并为1,视觉token数压缩4倍
- Agent能力:可操作电脑和手机的交互式视觉Agent

