MiniMax-M1 技术报告解读:Lightning Attention 与高效测试时扩展

解读 MiniMax-M1 如何用 Lightning Attention 支撑超长上下文下的测试时计算扩展,并重点分析混合架构特有的训练与推理精度不匹配问题:把 LM 输出头提升到高精度后,强化学习的 reward 才能正常增长。

MiniMax-M1 技术报告摘要

论文:MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
团队:MiniMax
时间:2025.06(arXiv:2506.13585)
页数:22页


1. 预训练 Recipe (Continued Pre-Training)

训练策略

项目详情
基座MiniMax-Text-01 (456B总参, 45.9B激活, 32 experts)
架构Hybrid MoE:每7个Transnormer block(lightning attention) +1个标准Transformer block(softmax attention)
上下文原生1M tokens
Continued Pre-Training7.5T tokens reasoning-intensive corpus
Lightning Attention线性注意力的I/O-aware实现,生成100K tokens时仅需DeepSeek-R1 25%的FLOPs

训练数据

项目详情
总量7.5T tokens
重点reasoning-intensive corpus
数据改进优化Web和PDF解析,增强启发式清洗规则,确保高召回率的数学和代码数据

Infra设计

项目详情
原文未详述预训练Infra-

2. 后训练 Recipe (SFT)

项目详情
方法SFT注入CoT patterns
目的为RL建立strong foundation
具体数据量/方法原文简略提及

3. RL Recipe

训练策略

项目详情
核心算法CISPO (Clipped Importance Sampling Policy Optimization)
与GRPO/DAPO区别CISPO clip importance sampling weights(而非token updates),始终利用所有tokens计算梯度
效率相比DAPO 2x加速(Qwen2.5-32B上验证)
训练规模512H800 GPUs,3周完成fullRL,rental cost ~$534,700
输出版本M1-40K(中间checkpoint)+ M1-80K(完整训练)thinking budgets

关键设计:RL with Hybrid Attention的挑战和解法

① Computational Precision Mismatch

  • 问题:训练模式和推理模式中token概率存在显著偏差(hybrid architecture特有),导致reward无法增长
  • 原因:LM output head的high-magnitude activations在不同精度kernel下产生误差
  • 解法:将LM output head提升至FP32精度
  • 效果:概率correlation从~0.9x提升到0.99x

② Optimizer Hyperparameter Sensitivity

  • 问题:梯度量级跨度极大(1e-18到1e-5),相邻iteration梯度correlation弱
  • 解法:设β₁=0.9, β₂=0.95, eps=1e-15(远小于default1e-8)

③ Early Truncation via Repetition Detection

  • 问题:复杂prompt诱发病态长重复response,大梯度威胁稳定性
  • 解法:基于token probability的启发式——连续3000个token概率>0.99时终止生成
  • 优于简单字符串匹配

###RL 数据

项目详情
数据类型Verifiable + Non-verifiable problems
数学推理竞赛数学
编程竞赛编程
逻辑推理SynLogic框架生成,41种不同逻辑任务
软件工程SWE-bench derived sandbox环境
通用任务GenRM评估的non-verifiable tasks

关键设计:GenRM Bias Mitigation for Long CoT

  • 问题:Generative Reward Model对长输出有length bias,incentivize verbosity

  • Offline策略(部分有效):多样化长度训练数据 + 对抗样本 + 架构优化

  • 核心策略:Online length bias监控

    关键设计:Curriculum for Diverse Data

  • 起步仅用reasoning-intensive任务 + rule-based reward

  • 逐步引入general domain任务 + GenRM reward

  • 动态权重策略平衡reasoning和general任务

    Infra设计

项目详情
硬件512 H800 GPUs
训练时长3周
成本~$534,700
Lightning Attention优势100K生成仅需softmax attention 25% FLOPs

4. 关键亮点

  1. CISPO算法:clip importance sampling weights而非token updates,always利用所有tokens,2x faster than DAPO
  2. Hybrid Attention for RL:lightning attention使100K生成仅25% FLOPs,但需解决precision mismatch(LM head→FP32)
  3. 512 GPU3周 $53万:全流程RL成本极低
  4. 1M input + 80K output:开源模型中最长的thinking budget之一
  5. GenRM Online Bias Monitoring:训练中动态检测length bias并recalibrate
  6. SynLogic:41种逻辑推理任务的合成框架
  7. Early Truncation:基于连续高概率token的重复检测,保护训练稳定
本文结束 感谢您的阅读