跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

大模型全栈知识Category

05-07

探秘 Transformer 之(2):总体架构与文本生成执行流程

04-25

探秘 Transformer 之(1):注意力机制的背景与演化动机

04-22

手算 LLM 参数量:以 Qwen2.5-32B 为例逐层拆解

04-21

探秘 Transformer 之(24):KV Cache 优化的原理与方法分类

04-15

GLU 与 SwiGLU 激活函数详解:从门控线性单元到大模型 FFN 标配

04-15

ALiBi 详解:用线性偏置实现长度外推的注意力机制

04-14

预训练优化器—神经网络优化器全景:从 SGD 到 Adam

04-11

HuggingFace AutoModel 系列详解:自动加载类与任务对照

04-10

Tokenizer 分词器详解:BPE、WordPiece 与编解码流程

03-13

大语言模型简史:从 Transformer (2017) 到 DeepSeek-R1 (2025)

03-13

DeepSeek 开源周技术总览:FlashMLA、DeepEP、DeepGEMM 与 3FS

03-13

DeepSeek 进化史:从 V1、V2、V3 到 R1 的技术路线全梳理

1…4567
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.6k 赣ICP备20004005号
0%