LongCat-2.0 技术报告解读:稀疏注意力与 N-Gram 嵌入扩参

解读美团 LongCat-2.0 的三大设计:从三个正交方向改进 DSA 的 LongCat 稀疏注意力、用 N-gram 嵌入在 MoE 之外开辟正交扩参维度以突破稀疏化收益递减,以及在非 GPU 的 ASIC 平台上完成 35T token 预训练的工程实践。

LongCat-2.0 —技术报告摘要

来源:GitHub README +技术博客(无独立arXiv)
团队:Meituan LongCat Team
发布时间:2026.06
许可证:MIT


1. 预训练 Recipe

训练策略

项目详情
模型架构MoE, 1.6T总参/ ~48B激活
N-gram Embedding135B参数,在MoE正交的稀疏维度中扩展参数,提高参数利用效率
注意力LongCat Sparse Attention (LSA),改进DSA的Lightning Indexer
MTP3步Multi-Token Prediction用于speculative decoding
上下文1M tokens
训练Token35T+
长上下文训练数千亿token的1M上下文数据
硬件AI ASIC超级计算集群(非GPU/NPU),证明替代硬件可行性
训练规模数百万加速器天
训练稳定性无回滚、无不可恢复loss尖峰

LSA (LongCat Sparse Attention) 三个正交优化

技术详情
Streaming-aware Indexing (SI)重塑token选择预算,硬件对齐连续访问+动态随机选择,碎片化→可预测顺序读取,合并HBM访问
Cross-Layer Indexing (CLI)利用相邻层间attention显著性经验稳定性,跨层蒸馏使单次索引服务多个连续层,摊销索引成本
Hierarchical Indexing (HI)粗到细两阶段:块级近似评分粗筛→细粒度token选择,缩小候选空间

LSA与MTP协同

项目详情
CLI目标模型每2层共享一个索引
MTP所有3个draft步骤共享单次索引传递

N-gram Embedding设计原则

原则详情
①MoE稀疏性已超最优点继续增加MoE稀疏性收益递减
②N-gram比例约束确保相对于等规模纯MoE的稳健优势

训练数据

项目详情
总量35T+ tokens
长上下文数千亿token 1M上下文数据
具体数据构成原文未详述

2. 后训练 Recipe

项目详情
目标编码和Agent任务能力增强
具体方法原文未详述(博文+GitHub级信息)

3. 关键亮点

  1. LongCat Sparse Attention (LSA):SI+CLI+HI三重优化改进DSA,解决不连续性和二次方评分瓶颈
  2. N-gram Embedding (135B):MoE正交维度扩参,突破MoE稀疏性收益递减
  3. 1.6T / ~48B激活 + 35T预训练:开源最大规模MoE之一
  4. 非GPU ASIC训练:证明替代硬件平台前沿规模训练可行性
  5. LSA-MTP协同:跨层索引共享+MTP共享,最大化推理效率
  6. 稳定训练:数百万加速器天无回滚
本文结束 感谢您的阅读