跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

Transformer 机制—结构详解:位置编码、自注意力与残差归一化

Posted on 2024-05-16 | In 大模型全栈知识 , Transformer 机制 | 4.1k | 16 分钟
逐层拆解 Transformer 的结构:位置嵌入如何补入序列顺序信息、自注意力机制的矩阵计算与 Padding Mask、残差连接与 Layer Normalization 的作用,并说明它相比 LSTM 串行训练为何能大幅并行提效。
Read more »

DeepSeek-V2 模型梳理:236B 参数 MoE 的架构与部署

Posted on 2024-05-13 | In 大模型全栈知识 , 模型认知与生态 | 1.5k | 9 分钟
梳理 DeepSeek-V2 这一以经济训练和高效推理为特点的 MoE 语言模型:总参数 236B、每个 token 激活 21B,并整理其更新日志、模型下载、评估结果、架构说明与本地运行及 API 使用方式。
Read more »

Mixtral 8x7B 详解:稀疏专家混合模型的架构与源码分析

Posted on 2024-04-25 | In 大模型全栈知识 , 模型认知与生态 | 10k | 40 分钟
解读 Mistral AI 发布的 Mixtral 8x7B 稀疏专家混合模型:支持 32K 上下文、多语言与代码生成能力突出,并顺着 transformers 源码逐层分析 MixtralConfig、MixtralModel 的初始化与前向计算流程。
Read more »

vLLM 源码解析(一):SequenceGroup 与调度执行链路

Posted on 2024-04-24 | In 大模型推理优化 , 核心推理机制 | 13k | 52 分钟
顺着 vLLM 的入口函数逐层拆解推理内核:SequenceGroup 如何组织一次请求中的多条候选序列,调度器如何决定参与推理的请求并完成逻辑块到物理块的映射,以及 Worker 与 CacheEngine 的分工。
Read more »

vLLM 架构解析:离线批处理、在线服务与 LLMEngine 内核

Posted on 2024-04-23 | In 大模型推理优化 , 推理框架与系统架构 | 4.4k | 16 分钟
解析 vLLM 的两种调用方式——同步的离线批推理与异步的在线 API 服务,并深入其内核引擎 LLMEngine 的整体架构:集中式控制器、调度器与执行模块如何协同完成请求的批处理与调度。
Read more »

Text2vec-Large-Chinese 私有化部署:中文句向量服务搭建

Posted on 2024-04-23 | In 大模型全栈知识 , 模型认知与生态 | 1k | 6 分钟
记录中文句向量模型 text2vec-large-chinese 的私有化部署方式:基于 sentence-transformers 封装编码函数,给出可直接使用的服务端代码与调用示例。
Read more »

Baichuan-7B 与 Baichuan-13B 梳理:开源可商用中英双语模型

Posted on 2024-04-22 | In 大模型全栈知识 , 模型认知与生态 | 4.2k | 18 分钟
梳理百川智能的 Baichuan 系列:基于 Transformer 结构、在约 1.2 万亿 token 上训练的 70 亿参数中英双语模型,在 C-Eval 与 MMLU 等基准上达到同尺寸最好效果,并给出数据处理方法、推理与量化部署方式。
Read more »

vLLM Prefix 前缀缓存详解:复用 System Prompt 的计算

Posted on 2024-04-22 | In 大模型推理优化 , 核心推理机制 | 1k | 3 分钟
讲解 vLLM 的 Prefix 特性:把每次推理都重复计算的 System Prompt 前缀缓存下来以避免自注意力阶段的冗余计算,配合 FIFO 或贪心的动态调度策略提升吞吐并降低延迟,并给出使用示例。
Read more »

PagedAttention 详解:用虚拟内存思想管理 KV Cache

Posted on 2024-04-22 | In 大模型推理优化 , 显存与 GPU 利用率优化 | 7k | 25 分钟
讲解 vLLM 的核心技术 PagedAttention:先说明 LLM 推理的 prefill 与 decode 两阶段以及传统 KV cache 预分配造成的显存浪费,再借操作系统虚拟内存与分页管理把 KV cache 切块按需分配。
Read more »

Continuous Batching 详解:动态批处理提升 GPU 利用率

Posted on 2024-04-22 | In 大模型推理优化 , 核心推理机制 | 1.1k | 3 分钟
讲解大语言模型推理中的连续批处理技术:针对输出长度不可预知、请求耗时差异大的特点,在每个迭代动态调整批大小而不是等整批完成,从而显著提升 GPU 利用率与吞吐并降低延迟。
Read more »

Llama-1 与 Llama-2 模型梳理:架构改动与训练数据

Posted on 2024-04-19 | In 大模型全栈知识 , 模型认知与生态 | 5.4k | 19 分钟
梳理 Llama 系列模型:基于 Transformer 解码器架构,在原始解码器基础上做了前置归一化、RMSNorm、SwiGLU 与旋转位置编码等改动,并给出 Llama-1 与 Llama-2 的模型架构、训练数据构成与训练方法差异。
Read more »

ChatGLM-6B 与 ChatGLM2-6B 梳理:中英双语对话模型与本地部署

Posted on 2024-04-19 | In 大模型全栈知识 , 模型认知与生态 | 493 | 1 分钟
梳理 ChatGLM-6B 与 ChatGLM2-6B:基于 GLM 架构的 62 亿参数中英双语对话模型,经约 1T token 训练并结合监督微调与人类反馈强化学习,INT4 量化后最低 6GB 显存即可在消费级显卡部署,并给出代码调用与 API 部署方式。
Read more »
1…121314…16
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.7k 赣ICP备20004005号
0%