解读 InternVL3 的原生多模态预训练思路:在自回归损失中只对文本 token 计算梯度,让视觉与语言从预训练阶段就统一建模,并梳理其两阶段后训练与测试时优化配方。
InternVL3 技术报告摘要
论文:InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
团队:Shanghai AI Laboratory + SenseTime + Tsinghua/Nanjing/Fudan/CUHK/SJTU
时间:2025.04(arXiv:2504.10479)
页数:27页
1. 预训练 Recipe(Native Multimodal Pre-Training)
训练策略
| 项目 | 详情 |
|---|---|
| 架构 | ViT-MLP-LLM (沿用InternVL系列) |
| 核心范式 | Native Multimodal Pre-Training:将language pre-training和multimodal alignment合并为单个预训练阶段 |
| 与传统区别 | 不再”先训LLM再适配多模态”,而是在预训练期间交错multimodal data和text-only data联合优化所有参数 |
| Loss | 仅在text tokens上计算loss(visual tokens仅作为conditioning context) |
| 位置编码 | V2PE (Variable Visual Position Encoding):使用smaller, more flexible的position encoding for visual tokens,支持extended multimodal contexts |
关键设计:Native Multimodal Pre-Training
公式化:
- 标准autoregressive loss,但只对text token计算:L_text-only(θ) = -Σ w_i·log p_θ(x_i|x_1,…,x_{i-1}) for x_i ∈ Text
- Joint Parameter Optimization:θ* = argmin E_{x∈D_multi}[L_text-only(θ)],D_multi为text-only和multimodal corpora的联合
Token Weighting (Square Averaging):
- 问题:token averaging偏向长response,sample averaging偏向短response
- 做法:w_i = 1/l^0.5(square averaging),l为当前样本需计算loss的token数
- 介于token averaging (l^0)和sample averaging (l^1)之间
核心优势:
- 无需额外bridging模块或后续inter-modal alignment
- 单模型同时获得linguistic和multimodal能力
- 保持强大的pure-language proficiency
训练数据
| 项目 | 详情 |
|---|---|
| 数据类型 | text-only + image-text + video-text + interleaved image-text序列 |
| 全部开源 | https://huggingface.co/datasets/OpenGVLab/InternVL-Data |
| 具体规模 | 原文未给出精确token数 |
Infra设计
| 项目 | 详情 |
|---|---|
| 框架 | InternEVO(从ZeRO优化的LLM训练框架扩展而来) |
| 并行策略 | data/tensor/sequence/pipeline parallelism及任意组合 |
| 模块解耦 | ViT/MLP/LLM各组件灵活独立sharding |
| 负载均衡 | 动态平衡visual和textual token间的计算负载不均 |
| 序列长度 | 支持32K tokens(head-parallel + sequence-parallel) |
| 加速效果 | 相比InternVL2.5训练加速 50%-200%(相同算力预算) |
2. 后训练 Recipe(两阶段)
Stage 1: SFT
| 项目 | 详情 |
|---|---|
| 方法 | Supervised Fine-Tuning with multimodal conversation data |
| 具体数据和超参 | 原文简述 |
Stage 2: Mixed Preference Optimization (MPO)
| 项目 | 详情 |
|---|---|
| 方法 | MPO(混合偏好优化) |
| 目的 | 进一步增强multimodal conversation和reasoning能力 |
| 数据 | VisualPRM(基于MMPR v1.2构建)+ 从InternVL3-8B/38B做rollout扩展 |
3. RL/Test-Time Scaling Recipe
| 项目 | 详情 |
|---|---|
| Test-Time Scaling | 报告标题中提到test-time recipes |
| VisualPRM | 用于multimodal reasoning的Process Reward Model |
| 具体TTS方法 | 原文描述基于VisualPRM的search/verification策略 |
4. 关键亮点
- Native Multimodal Pre-Training:打破”先训LLM再适配”的传统范式,单阶段联合学习linguistic+multimodal
- Square Averaging:w=1/l^0.5的token weighting折中方案,解决token/sample averaging的bias问题
- V2PE (Variable Visual Position Encoding):灵活的visual position encoding支持extended multimodal contexts
- InternEVO框架:ViT/MLP/LLM解耦sharding + 动态负载均衡 → 50-200%训练加速
- 全数据开源:训练数据+模型权重完全开源(开源VLM中rare)
- 78B模型MMMU 72.2:开源MLLM SOTA,接近Gemini 2.5 Pro (74.7)
- 保持language proficiency:Native multimodal training不损害纯文本能力

