美团 LongCat-Flash 技术报告解读:5600 亿参数的智能体 MoE 模型

解读美团 LongCat-Flash 这一 5600 亿参数的混合专家模型:用零计算专家按 token 动态分配 186 亿到 313 亿激活参数、用快捷连接 MoE 提升推理效率,在兼顾计算效率的同时强化智能体能力。

https://mp.weixin.qq.com/s/L6ksiCP6z84NeKNZ1h6OoA

LongCat-Flash,一个拥有 5600 亿参数的专家混合 (Mixture-of-Experts, MoE) 语言模型,旨在兼顾计算效率与先进的智能体 (Agentic) 能力。为满足可扩展效率的需求,LongCat-Flash 采用了两项新颖设计:
a) 零计算专家 (Zero-computation Experts):此机制能够实现动态计算预算分配,根据上下文需求为每个词元(token)激活 186 亿至 313 亿(平均 270 亿)不等的参数,从而优化资源利用。
b) 快捷连接 MoE (Shortcut-connected MoE):此设计扩大了计算与通信的重叠窗口,与同等规模的模型相比,在推理效率和吞吐量方面展现出显著的提升。

本文结束 感谢您的阅读