解读小米 MiMo-7B 如何让 7B 基座模型的推理潜力超越 32B 模型:从预训练阶段的数据质量与配比策略、兼顾性能与推理加速的 MTP,到借鉴竞赛评分机制缓解代码任务稀疏奖励的 Test Difficulty Driven Reward 与高效 rollout 引擎。
MiMo-7B 技术报告摘要
论文:MiMo: Unlocking the Reasoning Potential of Language Model – From Pretraining to Posttraining
团队:小米 LLM-Core
时间:2025.05 (arXiv:2505.07608)
页数:28页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型架构 | Transformer,7B参数,GQA |
| 训练目标 | NTP + MTP |
| 训练Token数 | 25T |
| 数据混合策略 | 三阶段混合:逐步增加推理密度数据占比 |
| 上下文长度 | 32K |
| 关键设计 | 预训练阶段即注重推理模式密度,而非仅依赖后训练 |
训练数据
| 项目 | 详情 |
|---|---|
| 数据来源 | 网页、学术论文、书籍、编程代码、合成数据 |
| 数据处理 | 优化文本抽取工具 + 多维度数据过滤,提升推理数据密度 |
| 合成数据 | 利用高级推理模型生成大量多样化合成推理数据 |
| 三阶段策略 | 阶段性调整数据配比,后期阶段提高代码/数学/推理数据占比 |
| 代码数据 | 保持原始仓库完整性,按仓库级别处理 |
| 质量过滤 | 多维度过滤:语言识别、去重、安全过滤、质量评分 |
Infra 设计
| 项目 | 详情 |
|---|---|
| 报告未详述预训练Infra | (未公开集群规模和并行策略细节) |
2. 后训练 Recipe (SFT)
训练策略
| 项目 | 详情 |
|---|---|
| 方法 | 标准 Supervised Fine-Tuning |
| 用途 | 作为 RL 的冷启动(cold-start),产出 MiMo-7B-SFT |
| 数据清洗 | 三阶段预处理:①去除与评估集16-gram重叠的query ②剔除混合语言/不完整回复 ③质量+多样性筛选 |
训练数据
| 项目 | 详情 |
|---|---|
| 数据来源 | 开源数据 + 自有蒸馏数据 |
| 数据重点 | 推理类任务(数学、代码)的长思维链数据 |
Infra 设计
| 项目 | 详情 |
|---|---|
| 未特别说明 | - |
3. RL Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 算法 | GRPO |
| 关键改进 | ①去除KL Loss ②Dynamic Sampling(过滤passrate=0或1的prompt) ③Clip-Higher(增大上clip阈值,促进探索) |
| 奖励设计 | Test Difficulty Driven Reward(IOI赛制启发):用多模型rollout的pass rate将test case聚类为Easy/Medium/Hard档,设计Strict和Soft两种打分方案,使难题即使只通过部分子任务也能获得部分奖励 |
| 采样策略 | Easy Data Re-Sampling:passrate=1的题存入easy pool,rollout时10%概率从pool采样混入batch,稳定policy update |
| 训练长度 | 32K → 38K → 48K(渐进扩展) |
| 超参 | batch=512, mini_batch=32, 16 grad updates/iter, lr=1e-6, temp=1.0, top_p=1.0 |
| 两条路线 | RL-Zero(Base直接RL)+ RL(SFT冷启动再RL) |
训练数据
| 项目 | 详情 |
|---|---|
| RL数据量 | 130K 可验证数学+编程问题 |
| 验证方式 | Rule-based verifiers |
| 数学数据 | 可验证数学问题 |
| 代码数据 | 算法编程题(多组测试用例,按难度分层) |
Infra 设计
| 项目 | 详情 |
|---|---|
| RL框架 | 基于 verl + Ray |
| 核心创新 | Seamless Rollout Engine |
| 组件 | Continuous Rollout + Async Reward Computation + Early Termination |
| 加速效果 | 训练 2.29×,验证 1.96× |
| 推理引擎 | vLLM(支持MTP推理) |
| 关键优化 | 解决长序列导致的GPU空闲,同步训练无staleness |
4. 关键亮点
- 预训练即为推理而生:数据质量+配比策略,7B base推理潜力超越32B
- MTP:既提升性能又加速推理
- Test Difficulty Driven Reward:借鉴IOI评分,缓解代码任务稀疏奖励
- Seamless Rollout Engine:2.29× RL训练加速,同步训练无staleness
- 7B超o1-mini:AIME 2025 55.4 vs50.7,LiveCodeBench显著领先

