LongCat-Flash 技术报告解读:零计算专家与 Shortcut 连接 MoE

解读美团 LongCat-Flash 的高效 MoE 设计:按 token 动态分配计算预算的零计算专家、重叠通信与计算的 Shortcut-Connected MoE,以及支撑 30 天完成 20T token 训练的训练管线与 PID 负载均衡控制器。

LongCat-Flash —技术报告摘要

论文:LongCat-Flash Technical Report (arXiv:2509.01322)
团队:Meituan LongCat Team
发布时间:2025.09
页数:36页


1. 预训练 Recipe

训练策略

项目详情
模型架构MoE, 560B总参,动态激活18.6B-31.3B(平均27B)
核心创新1: Zero-Computation Experts部分expert为identity function(不计算),实现动态计算预算分配:简单token少用计算,复杂token多用
核心创新2: Shortcut-Connected MoE (ScMoE)扩大computation-communication overlap window,提升推理throughput(quality-neutral,不影响loss)
Budget ControlPID controller动态调整expert bias,使平均expert activation收敛到预期值
Load BalanceAux-loss-free策略 + expert-specific bias + exclude zero-computation experts from bias update
Variance AlignmentScale-Correction for MLA + Variance Compensation for Experts Initialization(保证scalability)
注意力MLA (Multi-head Latent Attention)
训练完成时间20T+ tokens在30天内完成
推理效率100+ TPS, $0.70/M output tokens

训练数据

项目详情
总量20T+ tokens
阶段General Pre-training → Reasoning & Coding Enhancement(mid-training)→ Long Context Extension
数据策略Optimized mixtures,synthetic data + tool use tasks
Decontamination预训练数据去污染

Pre-training Strategy

项目详情
Hyperparameter Transfer从小模型transfer超参到大模型
Model Growth Initialization从小checkpoint grow到大模型初始化
Training StabilityMulti-pronged stability suite + deterministic computation

Infra设计

项目详情
Numerical Precision Control精度控制+故障检测
Deterministic Computation确保可复现性
Kernel Optimization自定义kernel保证确定性和性能
Distributed Strategy大规模分布式训练策略
Reliability & Observability训练可靠性和可观测性

2. 后训练 Recipe

Post-Training

项目详情
Reasoning & Coding针对推理和编码的post-training
Agentic Tool UseAgent工具使用能力增强
General Capability通用能力对齐
定位Non-thinking foundation model(非reasoning model)

3. 推理与部署

项目详情
ScMoE推理优化Computation-communication overlap扩大
Speculative Decoding推测解码加速
KV Cache Reduction减少KV cache
Quantization量化部署
Custom Kernel自定义推理kernel
性能100+ TPS, $0.70/M output tokens

4. 关键亮点

  1. Zero-Computation Experts:动态计算预算分配(18.6B-31.3B),token级别的adaptive compute
  2. Shortcut-Connected MoE (ScMoE):推理效率优化,quality-neutral(不影响training loss)
  3. 30天完成20T+ tokens训练:高效训练pipeline
  4. PID Controller load balance:无aux-loss,expert利用率自动收敛
  5. Variance Alignment设计:Scale-Correction for MLA + Variance Compensation,保证从小到大scalability
  6. $0.70/M output tokens:极致成本控制
本文结束 感谢您的阅读