Qwen2.5-VL 技术报告解读:原生动态分辨率 ViT 与绝对时间编码

解读 Qwen2.5-VL 的关键设计:支持任意分辨率输入的原生动态分辨率 ViT 配合窗口注意力大幅降低计算开销、对齐绝对时间而非归一化位置的多模态 RoPE 实现秒级事件定位,以及 SFT 加 DPO 的后训练流程。

Qwen2.5-VL技术报告摘要

论文:Qwen2.5-VL Technical Report
团队:Qwen Team, Alibaba Group
时间:2025.02(arXiv:2502.13923)
页数:23页


1. 预训练 Recipe

训练策略

项目详情
架构三组件:Vision Encoder (ViT) + MLP Vision-Language Merger + LLM (Qwen2.5)
LLM初始化从Qwen2.5 LLM预训练权重初始化
ViT从零训练的原生动态分辨率ViT,patch size=14,window attention +2D-RoPE
Merger将4个相邻patch feature拼接后过2层MLP,压缩4倍视觉token数
位置编码改造将1D RoPE改为Multimodal Rotary Position Embedding Aligned to Absolute Time
训练阶段三阶段预训练
序列长度Phase 1&2: 8192; Phase 3: 32768
LLM训练tokens4.1T (各尺寸相同)

关键设计:Native Dynamic-Resolution ViT

  • 使用 Window Attention(window size=112)处理大部分层,仅在特定层(index 7,15,23,31)使用full attention

  • 支持任意分辨率输入(高宽resize为28的倍数)

  • 相比全局attention显著降低计算开销

    关键设计:Multimodal RoPE Aligned to Absolute Time

  • 对视频帧使用绝对时间编码而非归一化位置

  • 使模型能原生感知时间动态,实现秒级事件定位

  • 无需传统的时间归一化技术

    训练数据

项目详情
相比Qwen2-VL预训练数据从1.2T扩展到4T tokens
数据类型Interleaved image-text, OCR, 文档解析, 图表, 视频, 定位(grounding)
OCR数据合成数据(visual text generation engine) + 开源 + 自有收集;支持法/德/意/西/葡/阿/俄/日/韩/越等多语言
图表数据100万合成样本(matplotlib/seaborn/plotly),涵盖bar/relational/heatmap等
表格数据600万真实样本,经离线端到端表格识别模型处理后过滤低置信/重叠/稀疏表格
文档格式设计了 QwenVL HTML Format:统一表示文档布局/文本/图表/公式/化学式/乐谱等
视频数据原文提到支持小时级长视频,具体数据量未详述

Infra设计

项目详情
负载均衡按LLM输入序列长度动态packing数据,确保GPU间一致计算负载
其他原文未详述集群规模和并行策略

2. 后训练 Recipe (SFT + DPO)

SFT 阶段

项目详情
方法SFT with ChatML format
数据量约200万条entries
数据比例纯文本50% + 多模态50%(image-text + video-text)
语言主要中英文,补充多语言
对话复杂度单轮+多轮;单图+多图序列
Query来源开源 + 购买 + 在线query
任务覆盖General VQA, Captioning, Math, Coding, 安全, Doc/OCR, Grounding, Video Analysis, Agent

关键设计:两阶段数据过滤 Pipeline

Stage 1: Domain-Specific Categorization

  • 使用 Qwen2-VL-Instag(基于Qwen2-VL-72B的分类模型)对样本分域分类

Stage 2: (原文后续描述被截断,应为质量评分和过滤)

DPO 阶段

项目详情
方法Direct Preference Optimization
用途Human preference distillation,行为精化
细节原文描述较简略

3. RL Recipe

项目详情
本报告未涉及独立RL阶段后训练仅含SFT + DPO

4. 关键亮点

  1. Native Dynamic-Resolution ViT:从零训练,Window Attention + 2D-RoPE,支持任意分辨率,显著降低计算
  2. Absolute Time Encoding:视频帧用绝对时间位置编码,实现秒级事件定位
  3. QwenVL HTML Format:统一文档表示格式,涵盖layout/text/chart/formula/music sheet/chemical formula
  4. 4T预训练tokens:相比Qwen2-VL的1.2T提升3.3倍
  5. MLP Merger压缩:4个patch feature合并为1,视觉token数压缩4倍
  6. Agent能力:可操作电脑和手机的交互式视觉Agent
本文结束 感谢您的阅读