旋转位置编码 RoPE 详解:从绝对位置编码到旋转变换 发表于 2024-06-02 | 分类于 大模型全栈知识 , 大模型推理优化 | 5k | 22 分钟系统推导旋转位置编码:从绝对位置编码与正弦编码出发,讨论良好位置编码应满足的性质,再用复数与旋转矩阵的形式推导 RoPE 如何用绝对位置的旋转表达相对位置关系。阅读全文 »
人类对齐与强化学习—DPO 直接偏好优化原理详解 发表于 2024-06-02 | 分类于 大模型训练与微调 | 2.2k | 8 分钟解读 DPO 论文:跳过显式奖励模型,把偏好优化直接写成语言模型上的分类损失。文章先梳理 RLHF 的 SFT、奖励建模与 RL 微调三阶段流水线,再展开 PPO 算法总览与 DPO 目标函数的推导。阅读全文 »
七大 LLM 推理服务框架横向对比与选型 发表于 2024-06-01 | 分类于 大模型推理优化 , 推理框架 | 3.8k | 15 分钟横向对比 vLLM、Text Generation Inference、CTranslate2、OpenLLM、Ray Serve 等七个主流大模型推理框架:各自的安装方式、适用场景与优缺点,帮助按批量吞吐、CPU 推理或流水线部署等需求选型。阅读全文 »
LLaMA-Factory 使用指南:从环境校验到自定义数据集微调 发表于 2024-05-24 | 分类于 大模型训练与微调 | 5.5k | 21 分钟介绍使用 LLaMA-Factory 完成大模型微调的完整流程:硬件与 CUDA、PyTorch 环境校验,模型下载与可用性验证,原始模型推理,构建自定义数据集,以及预训练、指令微调与对齐等全链路训练方式。阅读全文 »
图解 BERT 与 ELMo:NLP 中的迁移学习与词嵌入演进 发表于 2024-05-16 | 分类于 大模型全栈知识 , 大模型训练与微调 | 3.9k | 14 分钟以图解方式讲解 BERT 的工作原理:模型输入输出、与卷积神经网络的差异、词嵌入的演进,以及 ELMo 如何用语境化表示解决一词多义问题,帮助理解预训练加微调的迁移学习范式。阅读全文 »
Transformer 机制—结构详解:位置编码、自注意力与残差归一化 发表于 2024-05-16 | 分类于 大模型全栈知识 , 深度学习 | 4.1k | 16 分钟逐层拆解 Transformer 的结构:位置嵌入如何补入序列顺序信息、自注意力机制的矩阵计算与 Padding Mask、残差连接与 Layer Normalization 的作用,并说明它相比 LSTM 串行训练为何能大幅并行提效。阅读全文 »
DeepSeek-V2 模型梳理:236B 参数 MoE 的架构与部署 发表于 2024-05-13 | 分类于 大模型全栈知识 , 模型认知与生态 | 1.5k | 9 分钟梳理 DeepSeek-V2 这一以经济训练和高效推理为特点的 MoE 语言模型:总参数 236B、每个 token 激活 21B,并整理其更新日志、模型下载、评估结果、架构说明与本地运行及 API 使用方式。阅读全文 »
Mixtral 8x7B 详解:稀疏专家混合模型的架构与源码分析 发表于 2024-04-25 | 分类于 大模型全栈知识 , 模型认知与生态 | 10k | 40 分钟解读 Mistral AI 发布的 Mixtral 8x7B 稀疏专家混合模型:支持 32K 上下文、多语言与代码生成能力突出,并顺着 transformers 源码逐层分析 MixtralConfig、MixtralModel 的初始化与前向计算流程。阅读全文 »
vLLM 架构解析:离线批处理、在线服务与 LLMEngine 内核 发表于 2024-04-23 | 分类于 大模型推理优化 , 推理框架 | 4.4k | 16 分钟解析 vLLM 的两种调用方式——同步的离线批推理与异步的在线 API 服务,并深入其内核引擎 LLMEngine 的整体架构:集中式控制器、调度器与执行模块如何协同完成请求的批处理与调度。阅读全文 »
中文向量模型私有化部署:text2vec与BGE-M3服务搭建 发表于 2024-04-23 | 分类于 大模型全栈知识 , 模型认知与生态 | 1.5k | 8 分钟中文向量检索模型私有化部署指南,覆盖text2vec-large-chinese与BGE-M3两款主流模型的服务搭建、FastAPI接口封装与检索性能对比。阅读全文 »
Baichuan-7B 与 Baichuan-13B 梳理:开源可商用中英双语模型 发表于 2024-04-22 | 分类于 大模型全栈知识 , 模型认知与生态 | 4.2k | 18 分钟梳理百川智能的 Baichuan 系列:基于 Transformer 结构、在约 1.2 万亿 token 上训练的 70 亿参数中英双语模型,在 C-Eval 与 MMLU 等基准上达到同尺寸最好效果,并给出数据处理方法、推理与量化部署方式。阅读全文 »
vLLM Prefix 前缀缓存详解:复用 System Prompt 的计算 发表于 2024-04-22 | 分类于 大模型推理优化 | 1k | 3 分钟讲解 vLLM 的 Prefix 特性:把每次推理都重复计算的 System Prompt 前缀缓存下来以避免自注意力阶段的冗余计算,配合 FIFO 或贪心的动态调度策略提升吞吐并降低延迟,并给出使用示例。阅读全文 »