解读 MiniMax-M1 如何用 Lightning Attention 支撑超长上下文下的测试时计算扩展,并重点分析混合架构特有的训练与推理精度不匹配问题:把 LM 输出头提升到高精度后,强化学习的 reward 才能正常增长。
MiniMax-M1 技术报告摘要
论文:MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
团队:MiniMax
时间:2025.06(arXiv:2506.13585)
页数:22页
1. 预训练 Recipe (Continued Pre-Training)
训练策略
| 项目 | 详情 |
|---|---|
| 基座 | MiniMax-Text-01 (456B总参, 45.9B激活, 32 experts) |
| 架构 | Hybrid MoE:每7个Transnormer block(lightning attention) +1个标准Transformer block(softmax attention) |
| 上下文 | 原生1M tokens |
| Continued Pre-Training | 7.5T tokens reasoning-intensive corpus |
| Lightning Attention | 线性注意力的I/O-aware实现,生成100K tokens时仅需DeepSeek-R1 25%的FLOPs |
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | 7.5T tokens |
| 重点 | reasoning-intensive corpus |
| 数据改进 | 优化Web和PDF解析,增强启发式清洗规则,确保高召回率的数学和代码数据 |
Infra设计
| 项目 | 详情 |
|---|---|
| 原文未详述预训练Infra | - |
2. 后训练 Recipe (SFT)
| 项目 | 详情 |
|---|---|
| 方法 | SFT注入CoT patterns |
| 目的 | 为RL建立strong foundation |
| 具体数据量/方法 | 原文简略提及 |
3. RL Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 核心算法 | CISPO (Clipped Importance Sampling Policy Optimization) |
| 与GRPO/DAPO区别 | CISPO clip importance sampling weights(而非token updates),始终利用所有tokens计算梯度 |
| 效率 | 相比DAPO 2x加速(Qwen2.5-32B上验证) |
| 训练规模 | 512H800 GPUs,3周完成fullRL,rental cost ~$534,700 |
| 输出版本 | M1-40K(中间checkpoint)+ M1-80K(完整训练)thinking budgets |
关键设计:RL with Hybrid Attention的挑战和解法
① Computational Precision Mismatch
- 问题:训练模式和推理模式中token概率存在显著偏差(hybrid architecture特有),导致reward无法增长
- 原因:LM output head的high-magnitude activations在不同精度kernel下产生误差
- 解法:将LM output head提升至FP32精度
- 效果:概率correlation从~0.9x提升到0.99x
② Optimizer Hyperparameter Sensitivity
- 问题:梯度量级跨度极大(1e-18到1e-5),相邻iteration梯度correlation弱
- 解法:设β₁=0.9, β₂=0.95, eps=1e-15(远小于default1e-8)
③ Early Truncation via Repetition Detection
- 问题:复杂prompt诱发病态长重复response,大梯度威胁稳定性
- 解法:基于token probability的启发式——连续3000个token概率>0.99时终止生成
- 优于简单字符串匹配
###RL 数据
| 项目 | 详情 |
|---|---|
| 数据类型 | Verifiable + Non-verifiable problems |
| 数学推理 | 竞赛数学 |
| 编程 | 竞赛编程 |
| 逻辑推理 | SynLogic框架生成,41种不同逻辑任务 |
| 软件工程 | SWE-bench derived sandbox环境 |
| 通用任务 | GenRM评估的non-verifiable tasks |
关键设计:GenRM Bias Mitigation for Long CoT
问题:Generative Reward Model对长输出有length bias,incentivize verbosity
Offline策略(部分有效):多样化长度训练数据 + 对抗样本 + 架构优化
核心策略:Online length bias监控
关键设计:Curriculum for Diverse Data
起步仅用reasoning-intensive任务 + rule-based reward
逐步引入general domain任务 + GenRM reward
动态权重策略平衡reasoning和general任务
Infra设计
| 项目 | 详情 |
|---|---|
| 硬件 | 512 H800 GPUs |
| 训练时长 | 3周 |
| 成本 | ~$534,700 |
| Lightning Attention优势 | 100K生成仅需softmax attention 25% FLOPs |
4. 关键亮点
- CISPO算法:clip importance sampling weights而非token updates,always利用所有tokens,2x faster than DAPO
- Hybrid Attention for RL:lightning attention使100K生成仅25% FLOPs,但需解决precision mismatch(LM head→FP32)
- 512 GPU3周 $53万:全流程RL成本极低
- 1M input + 80K output:开源模型中最长的thinking budget之一
- GenRM Online Bias Monitoring:训练中动态检测length bias并recalibrate
- SynLogic:41种逻辑推理任务的合成框架
- Early Truncation:基于连续高概率token的重复检测,保护训练稳定

