MiMo-7B 技术报告解读:为推理能力而生的预训练与后训练

解读小米 MiMo-7B 如何让 7B 基座模型的推理潜力超越 32B 模型:从预训练阶段的数据质量与配比策略、兼顾性能与推理加速的 MTP,到借鉴竞赛评分机制缓解代码任务稀疏奖励的 Test Difficulty Driven Reward 与高效 rollout 引擎。

MiMo-7B 技术报告摘要

论文:MiMo: Unlocking the Reasoning Potential of Language Model – From Pretraining to Posttraining
团队:小米 LLM-Core
时间:2025.05 (arXiv:2505.07608)
页数:28页


1. 预训练 Recipe

训练策略

项目详情
模型架构Transformer,7B参数,GQA
训练目标NTP + MTP
训练Token数25T
数据混合策略三阶段混合:逐步增加推理密度数据占比
上下文长度32K
关键设计预训练阶段即注重推理模式密度,而非仅依赖后训练

训练数据

项目详情
数据来源网页、学术论文、书籍、编程代码、合成数据
数据处理优化文本抽取工具 + 多维度数据过滤,提升推理数据密度
合成数据利用高级推理模型生成大量多样化合成推理数据
三阶段策略阶段性调整数据配比,后期阶段提高代码/数学/推理数据占比
代码数据保持原始仓库完整性,按仓库级别处理
质量过滤多维度过滤:语言识别、去重、安全过滤、质量评分

Infra 设计

项目详情
报告未详述预训练Infra(未公开集群规模和并行策略细节)

2. 后训练 Recipe (SFT)

训练策略

项目详情
方法标准 Supervised Fine-Tuning
用途作为 RL 的冷启动(cold-start),产出 MiMo-7B-SFT
数据清洗三阶段预处理:①去除与评估集16-gram重叠的query ②剔除混合语言/不完整回复 ③质量+多样性筛选

训练数据

项目详情
数据来源开源数据 + 自有蒸馏数据
数据重点推理类任务(数学、代码)的长思维链数据

Infra 设计

项目详情
未特别说明-

3. RL Recipe

训练策略

项目详情
算法GRPO
关键改进①去除KL Loss ②Dynamic Sampling(过滤passrate=0或1的prompt) ③Clip-Higher(增大上clip阈值,促进探索)
奖励设计Test Difficulty Driven Reward(IOI赛制启发):用多模型rollout的pass rate将test case聚类为Easy/Medium/Hard档,设计Strict和Soft两种打分方案,使难题即使只通过部分子任务也能获得部分奖励
采样策略Easy Data Re-Sampling:passrate=1的题存入easy pool,rollout时10%概率从pool采样混入batch,稳定policy update
训练长度32K → 38K → 48K(渐进扩展)
超参batch=512, mini_batch=32, 16 grad updates/iter, lr=1e-6, temp=1.0, top_p=1.0
两条路线RL-Zero(Base直接RL)+ RL(SFT冷启动再RL)

训练数据

项目详情
RL数据量130K 可验证数学+编程问题
验证方式Rule-based verifiers
数学数据可验证数学问题
代码数据算法编程题(多组测试用例,按难度分层)

Infra 设计

项目详情
RL框架基于 verl + Ray
核心创新Seamless Rollout Engine
组件Continuous Rollout + Async Reward Computation + Early Termination
加速效果训练 2.29×,验证 1.96×
推理引擎vLLM(支持MTP推理)
关键优化解决长序列导致的GPU空闲,同步训练无staleness

4. 关键亮点

  1. 预训练即为推理而生:数据质量+配比策略,7B base推理潜力超越32B
  2. MTP:既提升性能又加速推理
  3. Test Difficulty Driven Reward:借鉴IOI评分,缓解代码任务稀疏奖励
  4. Seamless Rollout Engine:2.29× RL训练加速,同步训练无staleness
  5. 7B超o1-mini:AIME 2025 55.4 vs50.7,LiveCodeBench显著领先
本文结束 感谢您的阅读