MiMo-V2-Flash 技术报告解读:混合滑窗注意力与多教师在线蒸馏

解读小米 MiMo-V2-Flash 的关键设计:滑窗注意力配合 Attention Sink 偏置的混合架构在推理与长上下文上更优且 KV 缓存减少 6 倍、多教师在线策略蒸馏 MOPD,以及解决 MoE 路由不一致的 Rollout Routing Replay。

MiMo-V2-Flash —技术报告摘要

论文:MiMo-V2-Flash Technical Report (arXiv:2601.02780)
团队:LLM-Core Xiaomi
发布时间:2026.01
页数:31页


1. 预训练 Recipe

训练策略

项目详情
模型架构MoE, 309B总参/ 15B激活
层数48层(39SWA + 9 GA),M=8 Hybrid Blocks,每block N=5 SWA + 1 GA
Hybrid AttentionSWA(sliding window=128) + GA(global),5:1比例交错;KV-cache和attention计算减少近6×
Attention Sink BiasLearnable sink bias维持SWA在长上下文的建模能力(关键:无sink时128-window严重退化)
第一层特殊处理GA + Dense FFN(非MoE),稳定early representation
MoE256 experts/layer, top-8 activated, 无shared experts
GQASWA: 64Q/8KV heads;GA: 64Q/4KV heads;QK head dim=192, V head dim=128
MTPLightweight MTP blocks:SWA + Dense FFN,每block仅0.33B参数;3层MTP weights开源
训练精度FP8 mixed-precision
上下文Native 32K → extended 256K
训练Token数27T

训练数据

项目详情
总量27T tokens
Data Scheduler三阶段:Phase1General Pre-training(0-22T, 32K, diverse corpus) → Phase2 High-Quality(22-27T, quality-focused) → Long-context extension
数据Recipe继承MiMo-7B并增强

Infra设计

项目详情
训练精度FP8 mixed-precision大规模训练
架构消融250B tokens ablation验证:SWA W=128 + sink bias > All GA(在reasoning和long-context上均优)
关键发现W=128比W=512在long-context extension后更稳定(W=512退化严重)

2. 后训练 Recipe (SFT)

训练策略

项目详情
定位General SFT作为MOPD pipeline第一阶段
原文未详述SFT具体数据量和配置作为MOPD的基础student

3. RL Recipe — MOPD (Multi-Teacher On-Policy Distillation)

训练策略

项目详情
三阶段Pipeline①General SFT → ②Specialized RL/SFT训练domain-specific teachers → ③MOPD合并
MOPD核心Student从两类信号学习:①dense token-level rewards from specialized teachers ②verifiable outcome-based reward
Teacher来源各domain独立训练的specialized teacher(via large-scale RL)
效果Student同时掌握各domain teacher的peak capabilities

RL Training

项目详情
Non-Agentic RL推理任务(math, code, science等)的standard RL
Agentic RLSWE/terminal/web等long-horizon agent任务
SWE-Bench成果73.4% Verified, 71.7% Multilingual(开源最强)

Infra设计

项目详情
R3(Rollout Routing Replay)稳定化训练:解决MoE routing在RL中的不稳定问题
Data SchedulerRL阶段动态调整不同domain数据配比
Toolbox & Tool ManagerAgentRL环境管理工具
Context Management长程agent任务的上下文管理策略

4. MTP加速

项目详情
Acceptance LengthUp to 3.6(3-layer MTP)
Decoding Speedup2.6×(3-layer MTP)
MTP设计Lightweight: SWA + Dense FFN, 每block 0.33B参数
MTP加速RLMTP提升rollout speed,有助于scaleRL compute

5. 关键亮点

  1. Hybrid SWA(128) + Attention Sink Bias:比full GA在reasoning和long-context上更优,且KV-cache减少6×
  2. MOPD:独立于Nemotron/Kimi同期提出的同名方法,dense token-level teacher reward + outcome reward
  3. R3 (Rollout Routing Replay):解决MoE routing在RL中的不稳定性
  4. Lightweight MTP:0.33B/block, 3层达3.6 acceptance length / 2.6× speedup
  5. 27T FP8预训练:大规模FP8 MoE训练
  6. SWE-Bench最强开源:Verified 73.4%, Multilingual 71.7%
  7. W=128 > W=512:反直觉发现——更小window size在long-context extension后反而更稳定
本文结束 感谢您的阅读