Qwen-VL 1.0 解读:视觉感知器与基础视觉语言对齐

解读 Qwen-VL 如何以 Qwen-7B 为基座引入视觉感知器完成基础视觉语言对齐,梳理其视觉编码器设计、位置感知适配器的作用与训练流程,并给出源码与工程实现的参考资料。

https://zhuanlan.zhihu.com/p/25267823390

https://blog.csdn.net/gitblog_00030/article/details/150753913

https://www.51cto.com/aigc/4716.html

https://github.com/vllm-project/vllm/blob/v0.8.5.post1/vllm/model_executor/models/qwen_vl.py

https://zhuanlan.zhihu.com/p/1921289925552210138

Qwen-VL 是以Qwen-7B Base为主干模型,通过引入视觉感知器(Visual receptor)来增强视觉特征的感知能力。视觉感知器包括一个跟语言模型对齐视觉编码器(visual encoder)和一个位置感知的适配器(position- aware adapter)。套用上面的通用多模态框架,Qwen-VL包括了典型的前3个模块:

  • 模态编码器(Modality Encoder) : 视觉编码器(visual encoder),只用来编码图片视觉特征
  • 输入投影层(Input Projector):位置感知的适配器(position-aware adapter)
  • LLM主干网络(LLM Backbone): Qwen-7B Base 模型
    下面我们分别来看看Qwen-VL的两个核心模块:视觉编码器、感知位置的适配器。接着描述一些规范化样本处理过程,最后描述下模型的训练过程
本文结束 感谢您的阅读