跳到正文
孔明の博客
AI 大模型研发与应用
Home
Archives
Search
输入搜索关键词
大模型全栈知识
Category
05-07
探秘 Transformer 之(2):总体架构与文本生成执行流程
04-25
探秘 Transformer 之(1):注意力机制的背景与演化动机
04-22
手算 LLM 参数量:以 Qwen2.5-32B 为例逐层拆解
04-21
探秘 Transformer 之(24):KV Cache 优化的原理与方法分类
04-15
GLU 与 SwiGLU 激活函数详解:从门控线性单元到大模型 FFN 标配
04-15
ALiBi 详解:用线性偏置实现长度外推的注意力机制
04-14
预训练优化器—神经网络优化器全景:从 SGD 到 Adam
04-11
HuggingFace AutoModel 系列详解:自动加载类与任务对照
04-10
Tokenizer 分词器详解:BPE、WordPiece 与编解码流程
03-13
大语言模型简史:从 Transformer (2017) 到 DeepSeek-R1 (2025)
03-13
DeepSeek 开源周技术总览:FlashMLA、DeepEP、DeepGEMM 与 3FS
03-13
DeepSeek 进化史:从 V1、V2、V3 到 R1 的技术路线全梳理
1
…
4
5
6
7
0
%