DeepSeek 开源周技术总览:FlashMLA、DeepEP、DeepGEMM 与 3FS Posted on 2025-03-13 | In 大模型全栈知识 , 分布式训练与系统架构 | 2.3k | 8 分钟汇总 DeepSeek 开源周发布的五个基础设施项目:面向 Hopper 架构的 MLA 解码内核 FlashMLA、专家并行通信库 DeepEP、FP8 GEMM 库 DeepGEMM、双向流水线 DualPipe 与专家负载均衡 EPLB,以及高性能分布式文件系统 3FS。Read more »
DeepSeek 进化史:从 V1、V2、V3 到 R1 的技术路线全梳理 Posted on 2025-03-13 | In 大模型全栈知识 , 模型认知与生态 | 11.1k | 40 分钟沿时间线梳理 DeepSeek 的技术演进:67B 基座 V1 的预训练与对齐、引入 MLA 与 MoE 的 V2、采用 FP8 混合精度与无辅助损失负载均衡的 V3,以及以冷启动数据与强化学习锻造推理能力的 R1。Read more »
LLM 参数量、计算量与显存占用分析:从 Decoder-Only 结构出发 Posted on 2025-03-05 | In 大模型全栈知识 , 模型认知与生态 | 4.2k | 16 分钟以 GPT 系列 decoder-only 架构为例,系统推导大语言模型的参数量、训练与推理计算量(FLOPs)以及显存占用,覆盖 Self-attention 与 MLP 的计算量估算及中间激活带来的显存开销。Read more »
从 MHA、MQA、GQA 到 MLA:注意力机制的 KV Cache 演进 Posted on 2025-02-20 | In 大模型推理优化 , 注意力与 KV Cache 优化 | 1.9k | 9 分钟系统梳理注意力机制为压缩 KV 缓存所做的演进:从多头注意力 MHA 出发分析其显存瓶颈,依次推导多查询注意力 MQA、分组查询注意力 GQA,直至用低秩键值联合压缩的多头潜在注意力 MLA 及其数学形式。Read more »
DeepSeek-V3 技术报告解读:FP8 训练、DualPipe 与 MoE 负载均衡 Posted on 2025-02-18 | In 大模型全栈知识 , 模型认知与生态 | 4.2k | 15 分钟解读 DeepSeek-V3 如何用 14.8T 高质量 token、FP8 低精度训练、DualPipe 双向流水线与 MoE 负载均衡,在压低训练与推理成本的同时把开源模型的效果推到新高度。Read more »
高性能 GPU 服务器硬件拓扑与集群组网详解 Posted on 2025-01-09 | In 大模型训练与微调 , 通信与硬件 | 2k | 8 分钟详解大模型训练集群的硬件拓扑:8 卡 GPU 主机内 CPU、内存、NVMe 与 GPU 如何通过 PCIe 总线和交换芯片互联,NVLink 各代的演进与监控方式,以及 NVSwitch 与 NVLink Switch 在整机与跨机互联中的作用。Read more »
GPU 通信技术详解:GPUDirect、NVLink、NVSwitch 与 RDMA Posted on 2025-01-09 | In 大模型训练与微调 , 通信与硬件 | 2.3k | 8 分钟梳理多卡训练需要的通信技术:单机多卡场景下 GPUDirect、GPUDirect Storage 与 P2P、NVLink 与 NVSwitch 让 GPU 绕过 CPU 直接互连,多机场景则依赖 RDMA 实现跨节点的高效数据传输。Read more »
Qwen2.5-7B-Instruct LoRA 微调实战:从数据构建到权重推理 Posted on 2024-11-26 | In 大模型训练与微调 , 模型微调与参数高效适配 | 1.4k | 6 分钟以 Qwen2.5-7B-Instruct 为例走通 LoRA 微调全流程:环境准备与依赖安装、模型下载、指令集构建与数据格式化、加载半精度模型与 tokenizer、定义 LoraConfig 并用 Trainer 训练,最后加载 LoRA 权重推理。Read more »
LLM 推理框架运行时优化:CUDA Graph、分块预填充与投机解码 Posted on 2024-11-22 | In 大模型推理优化 , 推理框架与系统架构 | 4.3k | 15 分钟分析主流 LLM 推理框架的运行时开销来源(Python GIL 与多进程通信),并梳理 CUDA Graph、多步调度、Chunked Prefill、投机解码、基于哈希的自动前缀缓存与 vLLM Engine V2 等优化手段。Read more »
混合专家模型 MoE 详解:稀疏性、负载均衡与 Transformer 结合 Posted on 2024-11-18 | In 大模型全栈知识 , 模型认知与生态 | 3.7k | 12 分钟系统讲解混合专家模型:从 MoE 的发展简史说起,解释条件计算带来的稀疏性、token 级负载均衡的必要性,再讲 MoE 层如何嵌入 Transformer,以及 Switch Transformers 等代表性工作与显存代价。Read more »
NVIDIA A100 GPU 服务器配置详解与三代显卡对比 Posted on 2024-11-18 | In 大模型训练与微调 , 通信与硬件 | 1.6k | 6 分钟整理 NVIDIA A100 GPU 服务器的详细规格:7nm 工艺 542 亿晶体管、6912 个核心、40GB 或 80GB HBM2 显存与近 1.6TB/s 带宽、NVLink 600GB/s 互联、最多切分为 7 个 MIG 实例,并对比 V100 与 H100。Read more »
Hunyuan-Large 模型解读:3890 亿参数的开源 MoE 与 KV 缓存压缩 Posted on 2024-11-11 | In 大模型全栈知识 , 模型认知与生态 | 7.7k | 27 分钟解读腾讯混元 Large:当时规模最大的开源 Transformer 混合专家模型,总参数 3890 亿、激活 520 亿,支持 256K 上下文,主要贡献包括大规模数据合成、混合专家路由策略、KV 缓存压缩与专家特定学习率策略。Read more »