解读 InternVL3.5 的三项关键改进:离线 MPO 到在线 GSPO 的两阶段 Cascade RL 框架、语义感知的动态视觉分辨率路由 ViR 带来约 4 倍推理加速,以及视觉 token 的动态压缩策略。
InternVL3.5 —技术报告摘要
论文:InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency (arXiv:2508.18265)
团队:InternVL Team, Shanghai AI Laboratory
发布时间:2025.08
页数:34页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 架构 | ViT–MLP–LLM paradigm(延续InternVL系列) |
| LLM backbone | Qwen3系列 / GPT-OSS |
| 模型规模 | 1B~241B,含dense和MoE版本;旗舰 241B-A28B |
| 训练目标 | NTP on text tokens + square averaging loss reweighting(缓解response长度偏差) |
| Square Averaging | loss权重 w_i = 1/N^0.5,N为样本token数 |
| Random JPEG Compression | 预训练时随机JPEG压缩增强real-world性能 |
| 最大序列长度 | 32K tokens |
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | ~250B tokens(116M samples) |
| 多模态数据 | 源自InternVL3语料:image captioning, general QA, math, science, charts, OCR, knowledge grounding, document understanding, multi-turn dialogue, medical |
| 文本数据 | 基于InternLM系列训练语料 + 开源数据集扩充 |
| Text:Multimodal比例 | 约1:2.5 |
| 全参更新 | 预训练阶段ViT+MLP+LLM全部联合更新 |
Infra设计
| 项目 | 详情 |
|---|---|
| DvD (Decoupled Vision-Language Deployment) | Vision encoder和LLM部署在不同GPU上,有效平衡计算负载 |
| ViR (Visual Resolution Router) | 动态为每个image patch选择压缩率(1/4或1/16),从语义内容角度引入自适应(超越单纯width/height分割) |
| 效果 | 推理加速4.05×(vs InternVL3),推理能力+16.0% |
2. 后训练 Recipe (SFT)
训练策略
| 项目 | 详情 |
|---|---|
| 方法 | 与预训练相同目标(NTP + square averaging),使用更高质量对话数据 |
| 数据量 | ~130B tokens |
| 覆盖 | 下游任务适配:reasoning, text, general multimodal, agentic tasks |
3. RL Recipe — Cascade RL
训练策略
| 项目 | 详情 |
|---|---|
| 核心创新 | Cascade RL:两阶段coarse-to-fine策略 |
| Stage 1: Offline RL (MPO) | Mixed Preference Optimization:L_MPO = w_p·L_p + w_q·L_q + w_g·L_g(DPO loss + BCO loss + LM loss) |
| MPO优势 | rollouts可跨模型共享,摊销采样成本;训练稳定(rollout collection和parameter update解耦) |
| Stage 2: Online RL (GSPO) | 无reference model约束;advantage定义为same-query responses的normalized reward;importance sampling ratio用geometric mean of per-token ratios |
| GSPO vs GRPO | 使用geometric mean ratio而非arithmetic(更稳定) |
| Cascade优势 | ①Offline→Online warmup提升training stability ②Offline rollouts可跨模型共享降低成本 ③两阶段组合performance ceiling更高 |
| 数据量 | 270K samples(Cascade RL阶段) |
ViCO (Visual Consistency Learning)
| 项目 | 详情 |
|---|---|
| 目的 | 将ViR集成到InternVL3.5,构建InternVL3.5-Flash |
| 方法 | 最小化不同visual compression rates下的output divergence |
| Router Training | ~30B tokens |
| ViR机制 | Patch Router评估每个patch语义丰富度,决定送入哪个pixel shuffle module(高压缩/低压缩) |
| Flash效果 | 减少50% visual tokens,性能几乎不降 |
4. 关键亮点
- Cascade RL:Offline MPO→Online GSPO两阶段,MLLM领域首个稳定高效的RL框架
- ViR (Visual Resolution Router):语义感知的动态视觉分辨率选择,4.05×推理加速
- DvD (Decoupled Vision-Language Deployment):ViT和LLM分GPU部署,平衡计算负载
- Square Averaging:loss reweighting缓解response长度偏差
- 241B-A28B模型在开源MLLM中SOTA,接近GPT-5水平
- 新能力:GUI interaction + embodied agency

