PagedAttention 详解:用虚拟内存思想管理 KV Cache 发表于 2024-04-22 | 分类于 大模型推理优化 | 7k | 25 分钟讲解 vLLM 的核心技术 PagedAttention:先说明 LLM 推理的 prefill 与 decode 两阶段以及传统 KV cache 预分配造成的显存浪费,再借操作系统虚拟内存与分页管理把 KV cache 切块按需分配。阅读全文 »
Continuous Batching 详解:动态批处理提升 GPU 利用率 发表于 2024-04-22 | 分类于 大模型推理优化 | 1.1k | 3 分钟讲解大语言模型推理中的连续批处理技术:针对输出长度不可预知、请求耗时差异大的特点,在每个迭代动态调整批大小而不是等整批完成,从而显著提升 GPU 利用率与吞吐并降低延迟。阅读全文 »
Llama-1 与 Llama-2 模型梳理:架构改动与训练数据 发表于 2024-04-19 | 分类于 大模型全栈知识 , 模型认知与生态 | 5.4k | 19 分钟梳理 Llama 系列模型:基于 Transformer 解码器架构,在原始解码器基础上做了前置归一化、RMSNorm、SwiGLU 与旋转位置编码等改动,并给出 Llama-1 与 Llama-2 的模型架构、训练数据构成与训练方法差异。阅读全文 »
ChatGLM-6B 与 ChatGLM2-6B 梳理:中英双语对话模型与本地部署 发表于 2024-04-19 | 分类于 大模型全栈知识 , 模型认知与生态 | 8.1k | 39 分钟梳理 ChatGLM-6B 与 ChatGLM2-6B:基于 GLM 架构的 62 亿参数中英双语对话模型,经约 1T token 训练并结合监督微调与人类反馈强化学习,INT4 量化后最低 6GB 显存即可在消费级显卡部署,并给出代码调用与 API 部署方式。阅读全文 »
Flash Attention 加速详解:分块计算、重计算与算子融合 发表于 2024-04-16 | 分类于 大模型推理优化 | 1.3k | 4 分钟讲解 FlashAttention 如何突破注意力的显存访问瓶颈:用 Tiling 分块把计算搬到 SRAM 中完成、反向传播以重计算换显存、通过 kernel 融合减少显存读写,并延伸到块稀疏 FlashAttention。阅读全文 »
vLLM 与 PagedAttention 详解:显存分页的高吞吐推理框架 发表于 2024-04-16 | 分类于 大模型推理优化 , 推理框架 | 1.3k | 5 分钟介绍 vLLM 这一开源大模型推理加速框架:以 PagedAttention 高效管理注意力缓存,把吞吐量做到 HuggingFace Transformers 的 14 到 24 倍,并给出基于 Qwen1.5-7B-Chat 的推理代码示例。阅读全文 »
DeepSpeed 指南:ZeRO 显存优化与分布式训练实践 发表于 2024-04-16 | 分类于 大模型训练与微调 , 分布式训练与系统架构 | 7.7k | 30 分钟系统讲解为什么需要 DeepSpeed、分布式训练的通信策略与显存构成,逐层拆解 ZeRO 三个级别的参数切分方式、混合精度训练与显存占用分析,并对比 Accelerate 等方案给出适用场景。阅读全文 »
图网络开放数据集汇总:GNN 性能评测数据 发表于 2021-04-06 | 分类于 深度学习 | 1.6k | 6 分钟本文汇总常用于图神经网络(GNN)性能评测的开放数据集,便于图相关任务与算法对比实验的选型参考。阅读全文 »
TeX Live 2021 从卸载到安装指南(WIN10) 发表于 2021-04-06 | 分类于 编程与数学 | 399 | 1 分钟本文记录在WIN10下TeX Live 2021的卸载、下载安装以及TeXstudio配置全过程,适合LaTeX写作环境搭建。阅读全文 »
MATLAB 常用命令记录:图形绘制与可视化 发表于 2021-04-05 | 分类于 编程与数学 | 1.3k | 5 分钟本文记录MATLAB中基本图形的绘制方法,涵盖子图、二维三维绘图与可视化技巧,作为日常查阅笔记。阅读全文 »
MATLAB 常用命令记录:函数用法入门 发表于 2021-04-05 | 分类于 编程与数学 | 1.1k | 5 分钟本文记录MATLAB中常用函数的用法,涵盖匿名函数、函数定义与基本编程技巧,作为日常查阅笔记。阅读全文 »
Git 教程:版本控制、远程仓库与分支标签全流程 发表于 2021-04-03 | 分类于 工具与工程实践 | 3k | 12 分钟本文系统介绍Git版本控制,涵盖配置、远程仓库、分支创建与切换、标签等核心用法,适合入门与日常参考。阅读全文 »