解读小米 MiMo-V2-Flash 的关键设计:滑窗注意力配合 Attention Sink 偏置的混合架构在推理与长上下文上更优且 KV 缓存减少 6 倍、多教师在线策略蒸馏 MOPD,以及解决 MoE 路由不一致的 Rollout Routing Replay。
MiMo-V2-Flash —技术报告摘要
论文:MiMo-V2-Flash Technical Report (arXiv:2601.02780)
团队:LLM-Core Xiaomi
发布时间:2026.01
页数:31页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型架构 | MoE, 309B总参/ 15B激活 |
| 层数 | 48层(39SWA + 9 GA),M=8 Hybrid Blocks,每block N=5 SWA + 1 GA |
| Hybrid Attention | SWA(sliding window=128) + GA(global),5:1比例交错;KV-cache和attention计算减少近6× |
| Attention Sink Bias | Learnable sink bias维持SWA在长上下文的建模能力(关键:无sink时128-window严重退化) |
| 第一层特殊处理 | GA + Dense FFN(非MoE),稳定early representation |
| MoE | 256 experts/layer, top-8 activated, 无shared experts |
| GQA | SWA: 64Q/8KV heads;GA: 64Q/4KV heads;QK head dim=192, V head dim=128 |
| MTP | Lightweight MTP blocks:SWA + Dense FFN,每block仅0.33B参数;3层MTP weights开源 |
| 训练精度 | FP8 mixed-precision |
| 上下文 | Native 32K → extended 256K |
| 训练Token数 | 27T |
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | 27T tokens |
| Data Scheduler | 三阶段:Phase1General Pre-training(0-22T, 32K, diverse corpus) → Phase2 High-Quality(22-27T, quality-focused) → Long-context extension |
| 数据Recipe | 继承MiMo-7B并增强 |
Infra设计
| 项目 | 详情 |
|---|---|
| 训练精度 | FP8 mixed-precision大规模训练 |
| 架构消融 | 250B tokens ablation验证:SWA W=128 + sink bias > All GA(在reasoning和long-context上均优) |
| 关键发现 | W=128比W=512在long-context extension后更稳定(W=512退化严重) |
2. 后训练 Recipe (SFT)
训练策略
| 项目 | 详情 |
|---|---|
| 定位 | General SFT作为MOPD pipeline第一阶段 |
| 原文未详述SFT具体数据量和配置 | 作为MOPD的基础student |
3. RL Recipe — MOPD (Multi-Teacher On-Policy Distillation)
训练策略
| 项目 | 详情 |
|---|---|
| 三阶段Pipeline | ①General SFT → ②Specialized RL/SFT训练domain-specific teachers → ③MOPD合并 |
| MOPD核心 | Student从两类信号学习:①dense token-level rewards from specialized teachers ②verifiable outcome-based reward |
| Teacher来源 | 各domain独立训练的specialized teacher(via large-scale RL) |
| 效果 | Student同时掌握各domain teacher的peak capabilities |
RL Training
| 项目 | 详情 |
|---|---|
| Non-Agentic RL | 推理任务(math, code, science等)的standard RL |
| Agentic RL | SWE/terminal/web等long-horizon agent任务 |
| SWE-Bench成果 | 73.4% Verified, 71.7% Multilingual(开源最强) |
Infra设计
| 项目 | 详情 |
|---|---|
| R3(Rollout Routing Replay) | 稳定化训练:解决MoE routing在RL中的不稳定问题 |
| Data Scheduler | RL阶段动态调整不同domain数据配比 |
| Toolbox & Tool Manager | AgentRL环境管理工具 |
| Context Management | 长程agent任务的上下文管理策略 |
4. MTP加速
| 项目 | 详情 |
|---|---|
| Acceptance Length | Up to 3.6(3-layer MTP) |
| Decoding Speedup | 2.6×(3-layer MTP) |
| MTP设计 | Lightweight: SWA + Dense FFN, 每block 0.33B参数 |
| MTP加速RL | MTP提升rollout speed,有助于scaleRL compute |
5. 关键亮点
- Hybrid SWA(128) + Attention Sink Bias:比full GA在reasoning和long-context上更优,且KV-cache减少6×
- MOPD:独立于Nemotron/Kimi同期提出的同名方法,dense token-level teacher reward + outcome reward
- R3 (Rollout Routing Replay):解决MoE routing在RL中的不稳定性
- Lightweight MTP:0.33B/block, 3层达3.6 acceptance length / 2.6× speedup
- 27T FP8预训练:大规模FP8 MoE训练
- SWE-Bench最强开源:Verified 73.4%, Multilingual 71.7%
- W=128 > W=512:反直觉发现——更小window size在long-context extension后反而更稳定

