解读美团 LongCat-2.0 的三大设计:从三个正交方向改进 DSA 的 LongCat 稀疏注意力、用 N-gram 嵌入在 MoE 之外开辟正交扩参维度以突破稀疏化收益递减,以及在非 GPU 的 ASIC 平台上完成 35T token 预训练的工程实践。
LongCat-2.0 —技术报告摘要
来源:GitHub README +技术博客(无独立arXiv)
团队:Meituan LongCat Team
发布时间:2026.06
许可证:MIT
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型架构 | MoE, 1.6T总参/ ~48B激活 |
| N-gram Embedding | 135B参数,在MoE正交的稀疏维度中扩展参数,提高参数利用效率 |
| 注意力 | LongCat Sparse Attention (LSA),改进DSA的Lightning Indexer |
| MTP | 3步Multi-Token Prediction用于speculative decoding |
| 上下文 | 1M tokens |
| 训练Token | 35T+ |
| 长上下文训练 | 数千亿token的1M上下文数据 |
| 硬件 | AI ASIC超级计算集群(非GPU/NPU),证明替代硬件可行性 |
| 训练规模 | 数百万加速器天 |
| 训练稳定性 | 无回滚、无不可恢复loss尖峰 |
LSA (LongCat Sparse Attention) 三个正交优化
| 技术 | 详情 |
|---|---|
| Streaming-aware Indexing (SI) | 重塑token选择预算,硬件对齐连续访问+动态随机选择,碎片化→可预测顺序读取,合并HBM访问 |
| Cross-Layer Indexing (CLI) | 利用相邻层间attention显著性经验稳定性,跨层蒸馏使单次索引服务多个连续层,摊销索引成本 |
| Hierarchical Indexing (HI) | 粗到细两阶段:块级近似评分粗筛→细粒度token选择,缩小候选空间 |
LSA与MTP协同
| 项目 | 详情 |
|---|---|
| CLI | 目标模型每2层共享一个索引 |
| MTP | 所有3个draft步骤共享单次索引传递 |
N-gram Embedding设计原则
| 原则 | 详情 |
|---|---|
| ①MoE稀疏性已超最优点 | 继续增加MoE稀疏性收益递减 |
| ②N-gram比例约束 | 确保相对于等规模纯MoE的稳健优势 |
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | 35T+ tokens |
| 长上下文 | 数千亿token 1M上下文数据 |
| 具体数据构成 | 原文未详述 |
2. 后训练 Recipe
| 项目 | 详情 |
|---|---|
| 目标 | 编码和Agent任务能力增强 |
| 具体方法 | 原文未详述(博文+GitHub级信息) |
3. 关键亮点
- LongCat Sparse Attention (LSA):SI+CLI+HI三重优化改进DSA,解决不连续性和二次方评分瓶颈
- N-gram Embedding (135B):MoE正交维度扩参,突破MoE稀疏性收益递减
- 1.6T / ~48B激活 + 35T预训练:开源最大规模MoE之一
- 非GPU ASIC训练:证明替代硬件平台前沿规模训练可行性
- LSA-MTP协同:跨层索引共享+MTP共享,最大化推理效率
- 稳定训练:数百万加速器天无回滚

