跳到正文
孔明の博客
AI 大模型研发与应用
Home
Archives
Search
输入搜索关键词
MoE
Tag
08-04
开源大模型技术演进时间线:预训练、后训练与强化学习
08-04
NVIDIA Nemotron 3 白皮书解读:混合 Mamba-Transformer MoE 家族
08-04
Nemotron 3 Super 技术报告解读:LatentMoE 与 NVFP4 预训练
08-04
MiniMax-M2 技术报告解读:细粒度专家与 Sigmoid 门控 MoE
08-04
MiMo-V2-Flash 技术报告解读:混合滑窗注意力与多教师在线蒸馏
08-04
LongCat-Flash 技术报告解读:零计算专家与 Shortcut 连接 MoE
08-04
LongCat-2.0 技术报告解读:稀疏注意力与 N-Gram 嵌入扩参
08-04
Kimi-K3 技术报告解读:2.8T 参数的混合线性注意力架构
08-04
Kimi-K2 技术报告解读:MuonClip 优化器与智能体能力训练
08-04
Inkling 技术报告解读:Thinking Machines Lab 的 975B 开源 MoE 模型
08-04
GLM-5 技术报告解读:从 Vibe Coding 到智能体工程
08-04
GLM-4.5 技术报告解读:Agentic、推理与编码三位一体的基座模型
1
2
0
%