InternVL3 技术报告解读:原生多模态预训练与测试时配方

解读 InternVL3 的原生多模态预训练思路:在自回归损失中只对文本 token 计算梯度,让视觉与语言从预训练阶段就统一建模,并梳理其两阶段后训练与测试时优化配方。

InternVL3 技术报告摘要

论文:InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
团队:Shanghai AI Laboratory + SenseTime + Tsinghua/Nanjing/Fudan/CUHK/SJTU
时间:2025.04(arXiv:2504.10479)
页数:27页


1. 预训练 Recipe(Native Multimodal Pre-Training)

训练策略

项目详情
架构ViT-MLP-LLM (沿用InternVL系列)
核心范式Native Multimodal Pre-Training:将language pre-training和multimodal alignment合并为单个预训练阶段
与传统区别不再”先训LLM再适配多模态”,而是在预训练期间交错multimodal data和text-only data联合优化所有参数
Loss仅在text tokens上计算loss(visual tokens仅作为conditioning context)
位置编码V2PE (Variable Visual Position Encoding):使用smaller, more flexible的position encoding for visual tokens,支持extended multimodal contexts

关键设计:Native Multimodal Pre-Training

公式化:

  • 标准autoregressive loss,但只对text token计算:L_text-only(θ) = -Σ w_i·log p_θ(x_i|x_1,…,x_{i-1}) for x_i ∈ Text
  • Joint Parameter Optimization:θ* = argmin E_{x∈D_multi}[L_text-only(θ)],D_multi为text-only和multimodal corpora的联合

Token Weighting (Square Averaging):

  • 问题:token averaging偏向长response,sample averaging偏向短response
  • 做法:w_i = 1/l^0.5(square averaging),l为当前样本需计算loss的token数
  • 介于token averaging (l^0)和sample averaging (l^1)之间

核心优势:

  • 无需额外bridging模块或后续inter-modal alignment
  • 单模型同时获得linguistic和multimodal能力
  • 保持强大的pure-language proficiency

训练数据

项目详情
数据类型text-only + image-text + video-text + interleaved image-text序列
全部开源https://huggingface.co/datasets/OpenGVLab/InternVL-Data
具体规模原文未给出精确token数

Infra设计

项目详情
框架InternEVO(从ZeRO优化的LLM训练框架扩展而来)
并行策略data/tensor/sequence/pipeline parallelism及任意组合
模块解耦ViT/MLP/LLM各组件灵活独立sharding
负载均衡动态平衡visual和textual token间的计算负载不均
序列长度支持32K tokens(head-parallel + sequence-parallel)
加速效果相比InternVL2.5训练加速 50%-200%(相同算力预算)

2. 后训练 Recipe(两阶段)

Stage 1: SFT

项目详情
方法Supervised Fine-Tuning with multimodal conversation data
具体数据和超参原文简述

Stage 2: Mixed Preference Optimization (MPO)

项目详情
方法MPO(混合偏好优化)
目的进一步增强multimodal conversation和reasoning能力
数据VisualPRM(基于MMPR v1.2构建)+ 从InternVL3-8B/38B做rollout扩展

3. RL/Test-Time Scaling Recipe

项目详情
Test-Time Scaling报告标题中提到test-time recipes
VisualPRM用于multimodal reasoning的Process Reward Model
具体TTS方法原文描述基于VisualPRM的search/verification策略

4. 关键亮点

  1. Native Multimodal Pre-Training:打破”先训LLM再适配”的传统范式,单阶段联合学习linguistic+multimodal
  2. Square Averaging:w=1/l^0.5的token weighting折中方案,解决token/sample averaging的bias问题
  3. V2PE (Variable Visual Position Encoding):灵活的visual position encoding支持extended multimodal contexts
  4. InternEVO框架:ViT/MLP/LLM解耦sharding + 动态负载均衡 → 50-200%训练加速
  5. 全数据开源:训练数据+模型权重完全开源(开源VLM中rare)
  6. 78B模型MMMU 72.2:开源MLLM SOTA,接近Gemini 2.5 Pro (74.7)
  7. 保持language proficiency:Native multimodal training不损害纯文本能力
本文结束 感谢您的阅读