MoE 并行详解:专家拆分与分布式并行策略 Posted on 2025-04-28 | In 大模型训练与微调 , 分布式训练与系统架构 | 2.4k | 10 分钟讲解稀疏 MoE 架构的分布式训练:把大模型拆成多个专家并由门控网络按样本激活部分专家以节省算力,以及 MoE 与数据并行、模型并行的组合方式和 GShard、Switch-Transformer 等工业界方案。Read more »
分布式训练并行策略总览:从数据并行到自动并行 Posted on 2025-04-28 | In 大模型训练与微调 , 分布式训练与系统架构 | 2.7k | 9 分钟系统梳理大模型分布式训练的八类并行技术:数据并行、流水线并行、张量并行、序列并行、多维混合并行、自动并行、MoE 并行与优化器相关并行,并给出不同模型规模下的并行策略选择建议。Read more »
人类对齐与强化学习—RLHF 核心问题梳理与实践难点 Posted on 2025-04-28 | In 大模型训练与微调 , 人类对齐与强化学习 | 5.4k | 18 分钟以问答形式梳理 RLHF 的核心问题:强化学习与有监督学习的区别、RLHF 完整流程、奖励模型是否需与基座一致,以及偏好数据成本高、三阶段迭代慢、PPO 四模型显存开销大等实践痛点与应对思路。Read more »
自动并行详解:从 Mesh-TensorFlow 到 GSPMD Posted on 2025-04-27 | In 大模型训练与微调 , 分布式训练与系统架构 | 5.4k | 19 分钟讲解自动并行这一分布式训练的终极目标:给定模型与机器资源后自动选择较优的并行策略,区分半自动的 Mesh-TensorFlow、GShard、GSPMD 与全自动的 FlexFlow、Alpa 等方案及其切分表达方式。Read more »
多维混合并行详解:DP、PP、TP 的组合与业界实践 Posted on 2025-04-27 | In 大模型训练与微调 , 分布式训练与系统架构 | 2.3k | 8 分钟讲解如何把数据并行、流水线并行与张量并行组合起来:从 DP 与 PP 的设备映射、至少需要 8 卡的 3D 并行,到结合 ZeRO 的混合方案,并梳理 CodeGeeX、GPT-NeoX 与 GLM-130B 的并行策略。Read more »
探秘 Transformer 之(1):注意力机制的背景与演化动机 Posted on 2025-04-25 | In 大模型全栈知识 , Transformer 机制 | 18.7k | 65 分钟从 seq2seq、文本生成机制、自回归与隐变量自回归模型讲到编码器-解码器结构,梳理在 CNN 与 RNN 方案之后为什么还需要注意力机制,为后续逐层拆解 Transformer 打下背景基础。Read more »
流水线并行详解:微批次切分与 GPipe 实现原理 Posted on 2025-04-25 | In 大模型训练与微调 , 分布式训练与系统架构 | 6.1k | 22 分钟讲解流水线并行如何把模型不同层放置到不同设备以解决单卡放不下整个模型的问题:从朴素流水线的气泡问题、微批次切分到 GPipe 的实现,并对比层间并行与层内张量并行的差异。Read more »
张量并行详解:层内切分的行并行与列并行 Posted on 2025-04-25 | In 大模型训练与微调 , 分布式训练与系统架构 | 4.1k | 16 分钟讲解张量并行的原理与实现:把线性层的权重矩阵按行或按列切分到不同 GPU 上分别计算再合并、非线性层不做额外设计,并延伸到 2D 张量并行等多维切分方式。Read more »
序列并行详解:突破长序列训练的显存瓶颈 Posted on 2025-04-25 | In 大模型训练与微调 , 分布式训练与系统架构 | 2.1k | 7 分钟讲解 Colossal-AI 提出的序列并行:针对自注意力显存随序列长度平方增长的问题切分序列维度,并给出在 PyTorch 中通过设备网格创建分片计划、并行化模块与执行前向反向的完整代码示例。Read more »
分布式训练概述:八类并行技术的全景图 Posted on 2025-04-23 | In 大模型训练与微调 , 分布式训练与系统架构 | 2k | 7 分钟概览大模型分布式训练的主要并行方式:沿批次维度切分的数据并行、按层或按张量拆分模型的模型并行、张量并行与流水线并行的区别、优化器相关并行、异构系统并行,以及多维混合并行与自动并行。Read more »
数据并行详解:从 PyTorch DP、DDP 到 FSDP 与 ZeRO Posted on 2025-04-23 | In 大模型训练与微调 , 分布式训练与系统架构 | 5.1k | 19 分钟讲解数据并行的演进:把数据集切分到多个 GPU、各自持有完整模型副本并聚合梯度,对比 PyTorch 的 DataParallel、DistributedDataParallel 与 FullyShardedDataParallel 的差异,并说明 ZeRO 如何消除显存冗余。Read more »
PD 分离架构详解:预填充与解码解耦的工程权衡 Posted on 2025-04-23 | In 大模型推理优化 , 推理框架与系统架构 | 2.7k | 10 分钟讲解 PD 分离(预填充与解码解耦)推理架构:把两个阶段拆到不同实例分别优化以提升 GPU 利用率,并围绕 KV Cache 是否直连传输、是否按层收发、首 token 处理与 KV Cache 存储池设计等关键问题展开分析。Read more »