InternVL3.5 技术报告解读:Cascade RL 与动态视觉分辨率路由

解读 InternVL3.5 的三项关键改进:离线 MPO 到在线 GSPO 的两阶段 Cascade RL 框架、语义感知的动态视觉分辨率路由 ViR 带来约 4 倍推理加速,以及视觉 token 的动态压缩策略。

InternVL3.5 —技术报告摘要

论文:InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency (arXiv:2508.18265)
团队:InternVL Team, Shanghai AI Laboratory
发布时间:2025.08
页数:34页


1. 预训练 Recipe

训练策略

项目详情
架构ViT–MLP–LLM paradigm(延续InternVL系列)
LLM backboneQwen3系列 / GPT-OSS
模型规模1B~241B,含dense和MoE版本;旗舰 241B-A28B
训练目标NTP on text tokens + square averaging loss reweighting(缓解response长度偏差)
Square Averagingloss权重 w_i = 1/N^0.5,N为样本token数
Random JPEG Compression预训练时随机JPEG压缩增强real-world性能
最大序列长度32K tokens

训练数据

项目详情
总量~250B tokens(116M samples)
多模态数据源自InternVL3语料:image captioning, general QA, math, science, charts, OCR, knowledge grounding, document understanding, multi-turn dialogue, medical
文本数据基于InternLM系列训练语料 + 开源数据集扩充
Text:Multimodal比例约1:2.5
全参更新预训练阶段ViT+MLP+LLM全部联合更新

Infra设计

项目详情
DvD (Decoupled Vision-Language Deployment)Vision encoder和LLM部署在不同GPU上,有效平衡计算负载
ViR (Visual Resolution Router)动态为每个image patch选择压缩率(1/4或1/16),从语义内容角度引入自适应(超越单纯width/height分割)
效果推理加速4.05×(vs InternVL3),推理能力+16.0%

2. 后训练 Recipe (SFT)

训练策略

项目详情
方法与预训练相同目标(NTP + square averaging),使用更高质量对话数据
数据量~130B tokens
覆盖下游任务适配:reasoning, text, general multimodal, agentic tasks

3. RL Recipe — Cascade RL

训练策略

项目详情
核心创新Cascade RL:两阶段coarse-to-fine策略
Stage 1: Offline RL (MPO)Mixed Preference Optimization:L_MPO = w_p·L_p + w_q·L_q + w_g·L_g(DPO loss + BCO loss + LM loss)
MPO优势rollouts可跨模型共享,摊销采样成本;训练稳定(rollout collection和parameter update解耦)
Stage 2: Online RL (GSPO)无reference model约束;advantage定义为same-query responses的normalized reward;importance sampling ratio用geometric mean of per-token ratios
GSPO vs GRPO使用geometric mean ratio而非arithmetic(更稳定)
Cascade优势①Offline→Online warmup提升training stability ②Offline rollouts可跨模型共享降低成本 ③两阶段组合performance ceiling更高
数据量270K samples(Cascade RL阶段)

ViCO (Visual Consistency Learning)

项目详情
目的将ViR集成到InternVL3.5,构建InternVL3.5-Flash
方法最小化不同visual compression rates下的output divergence
Router Training~30B tokens
ViR机制Patch Router评估每个patch语义丰富度,决定送入哪个pixel shuffle module(高压缩/低压缩)
Flash效果减少50% visual tokens,性能几乎不降

4. 关键亮点

  1. Cascade RL:Offline MPO→Online GSPO两阶段,MLLM领域首个稳定高效的RL框架
  2. ViR (Visual Resolution Router):语义感知的动态视觉分辨率选择,4.05×推理加速
  3. DvD (Decoupled Vision-Language Deployment):ViT和LLM分GPU部署,平衡计算负载
  4. Square Averaging:loss reweighting缓解response长度偏差
  5. 241B-A28B模型在开源MLLM中SOTA,接近GPT-5水平
  6. 新能力:GUI interaction + embodied agency
本文结束 感谢您的阅读