解读 Qwen-VL 如何以 Qwen-7B 为基座引入视觉感知器完成基础视觉语言对齐,梳理其视觉编码器设计、位置感知适配器的作用与训练流程,并给出源码与工程实现的参考资料。
https://zhuanlan.zhihu.com/p/25267823390
https://blog.csdn.net/gitblog_00030/article/details/150753913
https://www.51cto.com/aigc/4716.html
https://github.com/vllm-project/vllm/blob/v0.8.5.post1/vllm/model_executor/models/qwen_vl.py
https://zhuanlan.zhihu.com/p/1921289925552210138

Qwen-VL 是以Qwen-7B Base为主干模型,通过引入视觉感知器(Visual receptor)来增强视觉特征的感知能力。视觉感知器包括一个跟语言模型对齐视觉编码器(visual encoder)和一个位置感知的适配器(position- aware adapter)。套用上面的通用多模态框架,Qwen-VL包括了典型的前3个模块:
- 模态编码器(Modality Encoder) : 视觉编码器(visual encoder),只用来编码图片视觉特征
- 输入投影层(Input Projector):位置感知的适配器(position-aware adapter)
- LLM主干网络(LLM Backbone): Qwen-7B Base 模型
下面我们分别来看看Qwen-VL的两个核心模块:视觉编码器、感知位置的适配器。接着描述一些规范化样本处理过程,最后描述下模型的训练过程。

