跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

MoETag

08-04

开源大模型技术演进时间线:预训练、后训练与强化学习

08-04

NVIDIA Nemotron 3 白皮书解读:混合 Mamba-Transformer MoE 家族

08-04

Nemotron 3 Super 技术报告解读:LatentMoE 与 NVFP4 预训练

08-04

MiniMax-M2 技术报告解读:细粒度专家与 Sigmoid 门控 MoE

08-04

MiMo-V2-Flash 技术报告解读:混合滑窗注意力与多教师在线蒸馏

08-04

LongCat-Flash 技术报告解读:零计算专家与 Shortcut 连接 MoE

08-04

LongCat-2.0 技术报告解读:稀疏注意力与 N-Gram 嵌入扩参

08-04

Kimi-K3 技术报告解读:2.8T 参数的混合线性注意力架构

08-04

Kimi-K2 技术报告解读:MuonClip 优化器与智能体能力训练

08-04

Inkling 技术报告解读:Thinking Machines Lab 的 975B 开源 MoE 模型

08-04

GLM-5 技术报告解读:从 Vibe Coding 到智能体工程

08-04

GLM-4.5 技术报告解读:Agentic、推理与编码三位一体的基座模型

12
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.6k 赣ICP备20004005号
0%