解读美团 LongCat-Flash 的高效 MoE 设计:按 token 动态分配计算预算的零计算专家、重叠通信与计算的 Shortcut-Connected MoE,以及支撑 30 天完成 20T token 训练的训练管线与 PID 负载均衡控制器。
LongCat-Flash —技术报告摘要
论文:LongCat-Flash Technical Report (arXiv:2509.01322)
团队:Meituan LongCat Team
发布时间:2025.09
页数:36页
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型架构 | MoE, 560B总参,动态激活18.6B-31.3B(平均27B) |
| 核心创新1: Zero-Computation Experts | 部分expert为identity function(不计算),实现动态计算预算分配:简单token少用计算,复杂token多用 |
| 核心创新2: Shortcut-Connected MoE (ScMoE) | 扩大computation-communication overlap window,提升推理throughput(quality-neutral,不影响loss) |
| Budget Control | PID controller动态调整expert bias,使平均expert activation收敛到预期值 |
| Load Balance | Aux-loss-free策略 + expert-specific bias + exclude zero-computation experts from bias update |
| Variance Alignment | Scale-Correction for MLA + Variance Compensation for Experts Initialization(保证scalability) |
| 注意力 | MLA (Multi-head Latent Attention) |
| 训练完成时间 | 20T+ tokens在30天内完成 |
| 推理效率 | 100+ TPS, $0.70/M output tokens |
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | 20T+ tokens |
| 阶段 | General Pre-training → Reasoning & Coding Enhancement(mid-training)→ Long Context Extension |
| 数据策略 | Optimized mixtures,synthetic data + tool use tasks |
| Decontamination | 预训练数据去污染 |
Pre-training Strategy
| 项目 | 详情 |
|---|---|
| Hyperparameter Transfer | 从小模型transfer超参到大模型 |
| Model Growth Initialization | 从小checkpoint grow到大模型初始化 |
| Training Stability | Multi-pronged stability suite + deterministic computation |
Infra设计
| 项目 | 详情 |
|---|---|
| Numerical Precision Control | 精度控制+故障检测 |
| Deterministic Computation | 确保可复现性 |
| Kernel Optimization | 自定义kernel保证确定性和性能 |
| Distributed Strategy | 大规模分布式训练策略 |
| Reliability & Observability | 训练可靠性和可观测性 |
2. 后训练 Recipe
Post-Training
| 项目 | 详情 |
|---|---|
| Reasoning & Coding | 针对推理和编码的post-training |
| Agentic Tool Use | Agent工具使用能力增强 |
| General Capability | 通用能力对齐 |
| 定位 | Non-thinking foundation model(非reasoning model) |
3. 推理与部署
| 项目 | 详情 |
|---|---|
| ScMoE推理优化 | Computation-communication overlap扩大 |
| Speculative Decoding | 推测解码加速 |
| KV Cache Reduction | 减少KV cache |
| Quantization | 量化部署 |
| Custom Kernel | 自定义推理kernel |
| 性能 | 100+ TPS, $0.70/M output tokens |
4. 关键亮点
- Zero-Computation Experts:动态计算预算分配(18.6B-31.3B),token级别的adaptive compute
- Shortcut-Connected MoE (ScMoE):推理效率优化,quality-neutral(不影响training loss)
- 30天完成20T+ tokens训练:高效训练pipeline
- PID Controller load balance:无aux-loss,expert利用率自动收敛
- Variance Alignment设计:Scale-Correction for MLA + Variance Compensation,保证从小到大scalability
- $0.70/M output tokens:极致成本控制

