Transformer 机制—结构详解:位置编码、自注意力与残差归一化 Posted on 2024-05-16 | In 大模型全栈知识 , Transformer 机制 | 4.1k | 16 分钟逐层拆解 Transformer 的结构:位置嵌入如何补入序列顺序信息、自注意力机制的矩阵计算与 Padding Mask、残差连接与 Layer Normalization 的作用,并说明它相比 LSTM 串行训练为何能大幅并行提效。Read more »
DeepSeek-V2 模型梳理:236B 参数 MoE 的架构与部署 Posted on 2024-05-13 | In 大模型全栈知识 , 模型认知与生态 | 1.5k | 9 分钟梳理 DeepSeek-V2 这一以经济训练和高效推理为特点的 MoE 语言模型:总参数 236B、每个 token 激活 21B,并整理其更新日志、模型下载、评估结果、架构说明与本地运行及 API 使用方式。Read more »
Mixtral 8x7B 详解:稀疏专家混合模型的架构与源码分析 Posted on 2024-04-25 | In 大模型全栈知识 , 模型认知与生态 | 10k | 40 分钟解读 Mistral AI 发布的 Mixtral 8x7B 稀疏专家混合模型:支持 32K 上下文、多语言与代码生成能力突出,并顺着 transformers 源码逐层分析 MixtralConfig、MixtralModel 的初始化与前向计算流程。Read more »
vLLM 源码解析(一):SequenceGroup 与调度执行链路 Posted on 2024-04-24 | In 大模型推理优化 , 核心推理机制 | 13k | 52 分钟顺着 vLLM 的入口函数逐层拆解推理内核:SequenceGroup 如何组织一次请求中的多条候选序列,调度器如何决定参与推理的请求并完成逻辑块到物理块的映射,以及 Worker 与 CacheEngine 的分工。Read more »
vLLM 架构解析:离线批处理、在线服务与 LLMEngine 内核 Posted on 2024-04-23 | In 大模型推理优化 , 推理框架与系统架构 | 4.4k | 16 分钟解析 vLLM 的两种调用方式——同步的离线批推理与异步的在线 API 服务,并深入其内核引擎 LLMEngine 的整体架构:集中式控制器、调度器与执行模块如何协同完成请求的批处理与调度。Read more »
Text2vec-Large-Chinese 私有化部署:中文句向量服务搭建 Posted on 2024-04-23 | In 大模型全栈知识 , 模型认知与生态 | 1k | 6 分钟记录中文句向量模型 text2vec-large-chinese 的私有化部署方式:基于 sentence-transformers 封装编码函数,给出可直接使用的服务端代码与调用示例。Read more »
Baichuan-7B 与 Baichuan-13B 梳理:开源可商用中英双语模型 Posted on 2024-04-22 | In 大模型全栈知识 , 模型认知与生态 | 4.2k | 18 分钟梳理百川智能的 Baichuan 系列:基于 Transformer 结构、在约 1.2 万亿 token 上训练的 70 亿参数中英双语模型,在 C-Eval 与 MMLU 等基准上达到同尺寸最好效果,并给出数据处理方法、推理与量化部署方式。Read more »
vLLM Prefix 前缀缓存详解:复用 System Prompt 的计算 Posted on 2024-04-22 | In 大模型推理优化 , 核心推理机制 | 1k | 3 分钟讲解 vLLM 的 Prefix 特性:把每次推理都重复计算的 System Prompt 前缀缓存下来以避免自注意力阶段的冗余计算,配合 FIFO 或贪心的动态调度策略提升吞吐并降低延迟,并给出使用示例。Read more »
PagedAttention 详解:用虚拟内存思想管理 KV Cache Posted on 2024-04-22 | In 大模型推理优化 , 显存与 GPU 利用率优化 | 7k | 25 分钟讲解 vLLM 的核心技术 PagedAttention:先说明 LLM 推理的 prefill 与 decode 两阶段以及传统 KV cache 预分配造成的显存浪费,再借操作系统虚拟内存与分页管理把 KV cache 切块按需分配。Read more »
Continuous Batching 详解:动态批处理提升 GPU 利用率 Posted on 2024-04-22 | In 大模型推理优化 , 核心推理机制 | 1.1k | 3 分钟讲解大语言模型推理中的连续批处理技术:针对输出长度不可预知、请求耗时差异大的特点,在每个迭代动态调整批大小而不是等整批完成,从而显著提升 GPU 利用率与吞吐并降低延迟。Read more »
Llama-1 与 Llama-2 模型梳理:架构改动与训练数据 Posted on 2024-04-19 | In 大模型全栈知识 , 模型认知与生态 | 5.4k | 19 分钟梳理 Llama 系列模型:基于 Transformer 解码器架构,在原始解码器基础上做了前置归一化、RMSNorm、SwiGLU 与旋转位置编码等改动,并给出 Llama-1 与 Llama-2 的模型架构、训练数据构成与训练方法差异。Read more »
ChatGLM-6B 与 ChatGLM2-6B 梳理:中英双语对话模型与本地部署 Posted on 2024-04-19 | In 大模型全栈知识 , 模型认知与生态 | 493 | 1 分钟梳理 ChatGLM-6B 与 ChatGLM2-6B:基于 GLM 架构的 62 亿参数中英双语对话模型,经约 1T token 训练并结合监督微调与人类反馈强化学习,INT4 量化后最低 6GB 显存即可在消费级显卡部署,并给出代码调用与 API 部署方式。Read more »