全部子文章(162 篇)
- MiniCPM-O 4.5 CookBook概览:多模态模型配套文档与使用指南入口MiniCPM-o 4.5 CookBook 概览入口与配套文档截图。
- 主机DNS解析排查记录:网络连通性与域名解析故障定位(20260723)主机 DNS 解析排查记录(20260723)。
- 大模型推理加速三种草稿模型对比:DFlash纯并行、DSpark半自回归与Eagle3纯自回归架构选型大模型推理加速三种草稿模型方案对比:DFlash(纯并行)、DSpark(半自回归)与 Eagle3(纯自回归)的核心架构、生成机制与选型建议。
- DeepSeek-V4预览版架构调研报告:CSA+HCA混合注意力、Manifold超连接与V3升级全景DeepSeek-V4 预览版调研报告,梳理 CSA+HCA 混合注意力、Manifold-Constrained Hyper-Connections、Muon 优化器等核心架构创新,以及 V3→V4 的升级点全景对比与 API 接入信息。
- vLLM 推理框架部署 Qwen3-235B-A22B 大语言模型实践Qwen3-235B-A22B大语言模型完整部署实践指南,覆盖vLLM与SGLang双框架启动参数、FP8量化优化、Kubernetes部署YAML、多机多卡分布式配置与推理性能调优。
- 主流开源大模型上下文长度对照表:Qwen、DeepSeek-V4、GLM5.2与MiniMax-M3等私有模型参数梳理主流开源大模型上下文长度与最大输出长度对照表(私有模型):Qwen 系列、DeepSeek-V4、GLM5.2、MiniMax-M3、kimi-k2.7-code 等。
- 2026年6月大模型发布全景汇总:80+条开源与商业模型动态梳理2026 年 6 月 1-18 日模型发布动态汇总:80+ 条开源与商业模型动态,覆盖 MiniMax M3、GLM-5.2、Kimi K2.7-Code、Grok 4.3、DFlash Spec V2 等。
- 大语言模型基准测试全解:GLUE/HumanEval/MT-Bench等评测方法与主流公开榜单对比大语言模型基准测试全解:GLUE、HumanEval、MBPP、IFEval、MT-Bench、AGIEval等评测方法解析与22个主流公开榜单对比。
- FlashInfer推理内核详解:陈天奇团队MLSys最佳论文,大模型推理注意力加速利器FlashInfer 推理内核简介:由陈天奇团队开发、获 MLSys 最佳论文奖的高性能大模型推理注意力内核,在多 Batch、动态输入、长上下文场景下带宽利用率显著优于 FlashAttention 系列。
- 大语言模型排行榜快照(2026年6月):Arena AI全模型与开源模型榜单截至 2026 年 6 月 15 日的大语言模型排行榜快照:Arena AI 全模型榜单与开源模型榜单。
- DeepSeek系列模型推理性能对比:V4-Pro与V4-Flash资源效率及多版本横向比较DeepSeek 系列模型推理性能与不同尺寸版本对比:V4-Pro 与 V4-Flash 资源效率、Base 模型、不同尺寸模式的 V4 系列横向比较。
- Qwen3.5 与 Qwen3 深度架构对比:混合 SSM-Transformer 的效率革命逐项对比 Qwen3 与 Qwen3.5 的架构差异:混合 SSM-Transformer 设计、Gated DeltaNet 线性注意力层的参数构成、视觉编码器与图文对齐方式的演进,并解释 DeepStack 为何在 Qwen3.5 中消...
- DeepSeek-V4 高效长上下文注意力:FP4 混合精度与稀疏注意力解析解析 DeepSeek-V4 在百万 token 长上下文下的注意力设计:专家权重 FP4 与其他参数 FP8 的混合精度存储、DeepSeek 稀疏注意力(DSA)降低注意力计算成本,以及 vLLM 保持 KV 缓存紧凑与 GPU 满载的...
- vLLM v0.10.2更新日志解读:新增模型家族、V1引擎成熟化、Blackwell优化与PyTorch 2.8升级vLLM v0.10.2 更新日志:新增模型家族与 PP/DP/LoRA 扩展、V1 引擎成熟化、Blackwell 性能优化、量化与 API 改进、PyTorch 2.8 升级等重大变更
- 2080Ti安装vLLM完整教程:CUDA/PyTorch/Anaconda环境搭建、Qwen1.5-14B部署与常见报错排查2080Ti 环境下 CUDA、PyTorch、Anaconda3 安装,vLLM 服务部署与 Qwen1.5-14B-Chat 服务调用,含三个常见报错 bug 的排查与解决
- vLLM官方Benchmark工具使用指南:延迟、前缀缓存、服务端与吞吐量四类压测脚本实战vLLM 官方 benchmark 工具使用示例:benchmark_latency、benchmark_prefix_caching、benchmark_serving、benchmark_throughput 四类压测脚本的启动命令与执...
- Mooncake推理框架环境搭建实战:系统依赖、编译安装与Qwen2.5-72B-Instruct部署Mooncake推理框架环境搭建完整指南:Ubuntu系统依赖、cmake/gcc/Python/Go版本要求、基础库安装与编译部署流程。
- FastDeploy部署ERNIE-4.5实战:Docker镜像、环境依赖与推理服务搭建FastDeploy部署ERNIE-4.5完整实践:Docker镜像拉取、CUDA/cuDNN/Python环境依赖与推理服务启动配置。
- Mooncake推理框架Qwen2.5-72B性能报告:预填充解码分离、RDMA/TCP后端与多QPS延迟实测Mooncake推理框架Qwen2.5-72B-Instruct性能测试报告:预填充与解码分离、Chunked Prefill、RDMA/TCP Transfer Engine后端在多QPS下的TTFT/TPOT/ITL延迟与吞吐量实测。
- Ollama部署Qwen2-7B-Instruct实战:本地大模型工具、自定义GGUF文件运行与API调用Ollama部署Qwen2-7B-Instruct实战:本地大模型运行工具安装、自定义GGUF文件获取与运行、API调用测试。
- SGLang推理框架参数调优全解析:温度非确定性根源、动态批量处理与前缀缓存对输出一致性的影响SGLang推理框架参数调优全解析:温度为0时输出非确定性的根源(数值精度舍入误差与多线程并行计算)、动态批量处理(占95%)与前缀缓存对结果一致性的影响。
- SGLang、vLLM与LMDeploy推理框架对比:架构特点、部署实践与性能差异分析SGLang、vLLM与LMDeploy三大推理框架对比:图计算优化架构、部署实践、并发性能与适用场景差异分析。
- Transformers部署sqlcoder-70b-alpha实战:环境搭建、模型下载与文本到SQL推理测试Transformers部署sqlcoder-70b-alpha实战:环境搭建、模型下载与文本到SQL(Text-to-SQL)推理测试。
- Transformers部署Qwen-14B-Chat实战:环境安装、OpenAI兼容API服务启动与Function Call测试Transformers部署Qwen-14B-Chat实战:环境安装、OpenAI兼容API服务启动与Function Call功能测试。
- vLLM与SGLang部署DeepSeek-V3-0324系列:R1与V3模型定位、特点及适用场景对比DeepSeek R1与V3系列模型定位对比:通用型LLM与垂直领域优化模型的特点、适用场景及vLLM/SGLang部署要点。
- 最新开源大模型简介(第38周):Qwen3-Max、GLM-5.2等模型发布动态与能力亮点最新开源大模型简介(第38周模型速递):Qwen3-Max(超1T参数)、GLM-5.2等模型的发布动态、架构特点与能力亮点。
- 知识图谱技术综述:知识抽取、表示、融合、推理与应用的全景梳理知识图谱技术综述:知识抽取、知识表示、知识融合、知识推理与典型应用的全景梳理,涵盖实体-关系-实体三元组与图数据模型。
- 2026年5月主流开源大模型横向对比:DeepSeek-V4、GLM-5.1、Kimi K2.6与Qwen3.5架构能力及vLLM部署2026 年 5 月主流开源大模型横向对比,覆盖 DeepSeek-V4、GLM-5.1、Kimi K2.6、Qwen3.5-122B、Qwen3.6-27B、MiMo-V2.5-Pro 与 MiniMax-M2.7 的架构、能力与 vLL...
- 2026年3月前沿开源模型调研:开源模型最新进展与部署资源情况汇总2026 年 3 月前沿开源模型调研汇总,涵盖开源模型的最新进展与部署资源情况。
- vLLM服务502错误排查指南:服务崩溃无响应、Ingress连接管理与Service到Pod流量路由分析vLLM 服务 502 问题排查原因记录:服务崩溃无响应、Ingress 连接管理、Service 到 Pod 流量路由。
- 长沙高铁工务段钢轨探伤基本情况记录:行业应用与设备现状(4.23)长沙高铁工务段钢轨探伤基本情况记录(4.23)。
- 广铁集团AI需求分析记录:行业应用场景与需求梳理(2026-04-28)广铁集团 AI 需求分析记录(2026-04-28),含需求分析文档截图。
- vLLM 0.11.0部署Qwen3-VL-2B-Instruct实战:Docker启动、OpenAI兼容API调用与返回参数解析vLLM 0.11.0 部署 Qwen3-VL-2B-Instruct 的完整实践:docker 启动命令、启动日志、OpenAI 兼容 API 调用方式、调用日志与返回参数解析。
- Qwen3-VL 梳理:模型架构、版本更新与部署要点梳理 Qwen3-VL 的发布脉络与工程要点:235B-A22B 的 Instruct 与 Thinking 版本、模型架构与在线服务形态,以及 FP8 量化对 H100 及以上显卡与 CUDA 版本的要求。
- Qwen2.5-VL图像Token数计算分析:patch步长、空间合并因子与动态分辨率下的视觉Token估算分析 Qwen2.5-VL 模型图像编码 token 数量的计算方法:patch 步长、空间合并因子、动态分辨率,以及常见分辨率与高分辨率图片、视频的 token 估算与实测验证。
- Qwen-VL 1.0 解读:视觉感知器与基础视觉语言对齐解读 Qwen-VL 如何以 Qwen-7B 为基座引入视觉感知器完成基础视觉语言对齐,梳理其视觉编码器设计、位置感知适配器的作用与训练流程,并给出源码与工程实现的参考资料。
- Qwen-VL 系列架构演进梳理:从固定分辨率到统一时空理解用对比表格梳理 Qwen-VL 系列的架构演进:从 Qwen-VL 的固定分辨率 ViT,到 Qwen2-VL 引入 NaViT 动态分辨率与 2D-RoPE,再到 Qwen2.5-VL 重新设计的窗口注意力 ViT,覆盖视觉编码器、跨模态...
- 隐马尔可夫模型 HMM 详解:定义、三个基本问题与算法推导系统讲解隐马尔可夫模型:从马尔可夫过程与 HMM 的形式化定义出发,详细推导评估观测序列概率的前向后向算法、解码隐藏状态序列的维特比算法,以及参数学习的 Baum-Welch 算法。
- LLM 领域重要论文清单:从 Transformer 到前沿探索按奠基理论、里程碑突破、核心架构与方法、重要优化与应用、前沿探索五个维度梳理大语言模型领域的代表性论文,逐篇给出链接、主要内容与影响,可作为系统入门的阅读路线。
- Text-GCN 详解:用词共现图做文本分类讲解 Text-GCN:用词共现与文档-词关系为整个语料库构造一张异构图,把文档和词都作为节点,再用图卷积网络学习节点表示并送进分类器,无需预训练词嵌入即可在多个基准上超过当时的文本分类方法。
- TextRNN 详解:基于多任务学习的循环神经网络文本分类讲解这篇把多任务学习引入 RNN 文本分类的工作:现实问题常被拆成相互关联的子任务,文章提出三种不同的信息共享机制,让所有任务在同一个网络中共同学习,从而利用任务间的共享表示提升效果。
- 命名实体识别 NER 综述:从词典规则到深度学习的技术演进系统梳理命名实体识别任务:从 MUC-6 提出的任务定义出发,介绍基于词典规则与统计机器学习的传统方法,再展开深度学习 NER 的通用框架——输入层、编码层与解码层的典型设计与代表模型。
- Elasticsearch 相似度算法详解:TF-IDF 与 BM25 的原理与演进讲解 Elasticsearch 计算文档相似度的两种核心算法:由词频与逆文档频率构成的 TF-IDF,以及 5.0 之后成为默认、在 7.x 中取代 TF-IDF 的 BM25,并说明自定义相似度算法的适用场景。
- 美团 LongCat-Flash 技术报告解读:5600 亿参数的智能体 MoE 模型解读美团 LongCat-Flash 这一 5600 亿参数的混合专家模型:用零计算专家按 token 动态分配 186 亿到 313 亿激活参数、用快捷连接 MoE 提升推理效率,在兼顾计算效率的同时强化智能体能力。
- 视觉多模态理解模型盘点(5~8 月):GLM-4.5V、MiMo-VL 等盘点 2025 年 5 到 8 月发布的视觉多模态模型:GLM-4.5V 与 GLM-4.1V-Thinking、MiMo-VL-7B-RL、MiniCPM-V-4、Intern-S1、step3、Qwen2.5-VL-72B、Intern...
- 人类对齐与强化学习—On-Policy 与 Off-Policy 深度辨析从基本定义、原理区别、数学表达、实例类比到矛盾分析,逐层辨析强化学习中 on-policy 与 off-policy 两种学习策略的本质差异:训练所使用的数据究竟来自当前策略还是其他策略。
- 开源大模型技术演进时间线:预训练、后训练与强化学习基于 36 篇技术报告梳理 2025 下半年到 2026 上半年的开源大模型技术演进:注意力从全局走向混合稀疏、DSA 成为事实标杆、线性注意力在旗舰模型落地、滑动窗口回归与 Mamba 路线,以及 MoE、训练精度与 MTP 的演进趋势。
- Kimi-K3 技术报告解读:2.8T 参数的混合线性注意力架构解读 Kimi-K3 如何把开源模型推到 3T 参数级别:线性注意力 KDA 与全局 Gated MLA 按层混合以高效处理百万上下文、用注意力残差缓解深层网络的信息压缩瓶颈,以及提升大规模 MoE 训练稳定性的 Stable Latent...
- LLM 推理过程详解:Prefill 与 Decode 两阶段的差异与优化拆解大语言模型推理的两个阶段:Prefill 阶段并行处理提示词并生成 KV 缓存,属于计算密集型;Decode 阶段逐个生成 token,属于显存带宽密集型,并分别给出两阶段的资源特征与优化技术。
- 主流大模型评测数据集速查:从 AIME、GPQA 到 MMLU整理大模型常用评测数据集及其来源:AIME2025 数学竞赛题、GPQA 专家级多选问答、LiveCodeBench 编程竞赛题、Arena-hard 人类偏好对话、BFCL-v3 工具调用、MMLU 与 CMMLU 知识评测以及 ARC-...
- Qwen3.5-Omni 技术报告解读:ARIA 单流生成与在线策略蒸馏解读 Qwen3.5-Omni 的全模态架构:Thinker 与 Talker 均采用混合 MoE 加 GDN 提升长音视频推理效率、用 ARIA 统一文本与语音交错的单流生成以消除双轨同步开销,并通过在线策略蒸馏缩小语音回复的质量差距。
- DeepSeek-V3.2 技术报告解读:稀疏注意力与专家蒸馏DeepSeek-V3.2 在 V3.1-Terminus 的 128K 上下文 checkpoint 上继续预训练,核心是引入 DeepSeek 稀疏注意力(DSA):用轻量索引器为每个 query token 挑选关键上下文。本文梳理其...
- Qwen3.5 技术报告解读:397B 稀疏 MoE 与原生多模态融合梳理 Qwen3.5 旗舰模型 397B-A17B 的关键设计:线性注意力 GDN 替代 75% 标准注意力让 256K 上下文效率提升 19 倍、从预训练第一步就统一视觉语言的 Early Fusion、仅激活 4.3% 参数的极端稀疏 ...
- MiniMax-M2 技术报告解读:细粒度专家与 Sigmoid 门控 MoE解读 MiniMax-M2 的 MoE 架构创新:用 256 个细粒度专家替代少量大专家以增加路由组合多样性、用相互独立的 Sigmoid 门控取代 softmax top-k 竞争,并梳理其面向智能体编码的后训练数据方案。
- InternVL3.5 技术报告解读:Cascade RL 与动态视觉分辨率路由解读 InternVL3.5 的三项关键改进:离线 MPO 到在线 GSPO 的两阶段 Cascade RL 框架、语义感知的动态视觉分辨率路由 ViR 带来约 4 倍推理加速,以及视觉 token 的动态压缩策略。
- Nex-N2 技术报告摘要:面向智能体的 Agentic Thinking 框架梳理 Nex-AGI 的 Nex-N2 模型:在 Qwen3.5 基座上做后训练,核心是统一自适应思维与连贯思维的 Agentic Thinking 框架,并说明当前公开材料尚未披露训练方法、数据配比与 RL 算法等细节这一局限。
- MiMo-V2-Flash 技术报告解读:混合滑窗注意力与多教师在线蒸馏解读小米 MiMo-V2-Flash 的关键设计:滑窗注意力配合 Attention Sink 偏置的混合架构在推理与长上下文上更优且 KV 缓存减少 6 倍、多教师在线策略蒸馏 MOPD,以及解决 MoE 路由不一致的 Rollout R...
- LongCat-Flash-Thinking 技术报告解读:领域并行强化学习与 DORA 异步框架解读美团 LongCat-Flash-Thinking 的推理能力训练方案:把 STEM、代码与智能体领域拆开并行做强化学习再融合为帕累托最优模型,并用工业级异步 rollout 框架 DORA 取得三倍以上的训练加速。
- GLM-5.2 技术报告解读:IndexShare 稀疏注意力与反奖励作弊强化学习梳理智谱 GLM-5.2 的 744B 总参 MoE 架构:每四层共享一个索引器的 IndexShare 稀疏注意力、改进的 MTP 投机解码,以及从 GRPO 转向 Critic-based PPO 并引入反奖励作弊模块的强化学习配方。
- Seed2.0 Model Card 解读:面向真实世界复杂性的三档模型梳理字节跳动 Seed2.0 的 Model Card 内容:面向不同延迟场景的 Pro、Lite、Mini 三档规模划分、设计优先级与评测重点,并说明该报告以能力展示与部署模式为主、未披露训练配方这一性质。
- LongCat-Flash 技术报告解读:零计算专家与 Shortcut 连接 MoE解读美团 LongCat-Flash 的高效 MoE 设计:按 token 动态分配计算预算的零计算专家、重叠通信与计算的 Shortcut-Connected MoE,以及支撑 30 天完成 20T token 训练的训练管线与 PID ...
- Inkling 技术报告解读:Thinking Machines Lab 的 975B 开源 MoE 模型梳理 Thinking Machines Lab 首个开源模型 Inkling 的设计要点:975B 总参数的 MoE、长序列外推更优的相对位置编码与 Short Convolutions、无编码器的多模态输入,以及 Muon 与 Adam...
- DeepSeek-V4 技术报告解读:混合注意力与百万 Token 上下文梳理 DeepSeek-V4 面向百万 token 上下文的架构设计:压缩稀疏注意力 CSA 与 HCA 交替的混合注意力、V4-Pro 的架构参数、预训练与后训练的 On-Policy 蒸馏配方,以及支撑超长上下文的基础设施设计。
- H20部署实战:DeepSeek-V4-Flash与GLM-5.1-FP8双模型推理配置H20服务器部署DeepSeek-V4-Flash与GLM-5.1-FP8大模型实战指南,覆盖vLLM与SGLang双框架部署、InfiniBand多卡通信环境变量配置、FP8量化优化、128k长上下文设置与推理故障排查。
- DeepSeek V4 Flash推理加速指南:vLLM与SGLang双框架25项特性逐条解析DeepSeek V4 Flash推理加速完整指南,覆盖vLLM与SGLang双框架25项核心优化特性:FP8量化、MoE优化、注意力与KV Cache优化、调度与延迟优化、结构化输出、图优化、长上下文扩展,逐条对应启动参数、内核与源码路径...
- MiniCPM-O 端侧全模态模型解读:端到端语音与视觉理解解读面壁智能 MiniCPM-o 这一端侧多模态大模型系列:以端到端方式接受图像、视频、文本与音频输入并生成文本和语音输出,覆盖音频编码、语音解码、端到端视觉理解与全模态流式机制,8B 参数达到 GPT-4o 级别体验。
- NVIDIA Nemotron 3 白皮书解读:混合 Mamba-Transformer MoE 家族梳理 NVIDIA Nemotron 3 白皮书:由三个模型组成的混合 Mamba-Transformer MoE 家族、在隐空间做路由以兼顾延迟与吞吐的 LatentMoE 核心技术,以及多环境强化学习等预训练与后训练设计。
- Nemotron 3 Ultra 技术报告解读:550B 规模的 NVFP4 预训练与多教师蒸馏解读 NVIDIA Nemotron 3 Ultra:用 550B 参数与 20T token 验证 NVFP4 在极限规模下的训练稳定性,并通过多教师在线策略蒸馏 MOPD 把多个专用教师模型的能力压缩进单一学生模型。
- Nemotron 3 Super 技术报告解读:LatentMoE 与 NVFP4 预训练解读 NVIDIA Nemotron 3 Super 的三大技术点:在隐空间做专家路由、同时优化精度与 FLOPs 的 LatentMoE,首次大规模稳定训练到 25T token 的 NVFP4 预训练,以及以 Mamba-2 为主的混合...
- GLM-5 技术报告解读:从 Vibe Coding 到智能体工程解读 GLM-5 相比 GLM-4.5 的关键改进:规模从 355B 扩展到 744B、专家数增加而层数减少以降低专家并行通信开销,以及为适配 Muon 优化器重新设计的 MLA 与 MuonSplit 注意力、中期训练与后训练配方。
- Qwen3-VL 技术报告解读:交错 MRoPE 与 DeepStack 视觉特征融合解读 Qwen3-VL 的四阶段预训练设计与三项关键创新:交错式多模态 RoPE、把视觉特征分层注入语言模型的 DeepStack、以文本形式表达视频时间戳,以及平衡多模态 token 损失的平方根重加权策略。
- Kimi-K2.5 技术报告解读:视觉智能体与 Zero-Vision SFT解读 Kimi-K2.5 面向视觉智能体的两项关键设计:固定视觉文本 token 预算下早期融合优于后期大量注入视觉这一预训练发现,以及解决多模态工具调用冷启动问题的 Zero-Vision SFT 方案。
- Gemma 4 技术报告解读:P-RoPE 与键值复用的极简长上下文设计解读 Gemma 4 的架构创新:仅对 25% 头维度施加 RoPE 的 p-RoPE 让全局 KV 缓存减少 37.5%、全局层直接用 key 充当 value 进一步压缩缓存,以及去编码器的多模态设计与音频模态支持。
- Seed1.5-VL 技术报告解读:原生分辨率视觉与混合可验证奖励强化学习解读字节跳动 Seed1.5-VL:原生动态分辨率的 SeedViT 视觉编码器、只监督最终输出而不约束思维链的监督策略,以及联合 RLHF 与 RLVF 并用视觉语言模型自身充当奖励模型的混合强化学习方案。
- MiMo-VL 技术报告解读:混合在线强化学习的多模态推理模型解读小米 MiMo-VL 的训练思路:预训练中期就引入长思维链推理数据、后训练跳过独立 SFT 直接进入强化学习,并用统一 RLVR 与 RLHF 的混合在线强化学习框架 MORL 让 7B 模型超越 72B 级多模态模型。
- MiniMax-M1 技术报告解读:Lightning Attention 与高效测试时扩展解读 MiniMax-M1 如何用 Lightning Attention 支撑超长上下文下的测试时计算扩展,并重点分析混合架构特有的训练与推理精度不匹配问题:把 LM 输出头提升到高精度后,强化学习的 reward 才能正常增长。
- Hunyuan-TurboS 技术报告解读:Mamba-Transformer 协同与自适应长短思维链解读腾讯混元 TurboS 的两大创新:Mamba 与 Transformer 协同的混合架构,以及让单一模型自动选择长思考或短思考模式的自适应 CoT 融合方案,并梳理其后训练四大模块。
- Kimi-K2 技术报告解读:MuonClip 优化器与智能体能力训练解读 Kimi-K2 如何用 MuonClip 优化器解决大规模 MoE 训练中的注意力 logits 爆炸问题:在 Muon 正交化基础上新增 QK-Clip 约束注意力分数,配合权重衰减稳定训练,并梳理其后训练配方。
- InternVL3 技术报告解读:原生多模态预训练与测试时配方解读 InternVL3 的原生多模态预训练思路:在自回归损失中只对文本 token 计算梯度,让视觉与语言从预训练阶段就统一建模,并梳理其两阶段后训练与测试时优化配方。
- vLLM开源模型部署实践汇总:Qwen3-235B、gemma-3-27b、Qwen2.5-72B、QwQ-32B与DeepSeek-R1多卡启动命令vLLM 推理框架开源模型部署实践汇总,包含 Qwen3-235B-A22B、gemma-3-27b-it、Qwen2.5-72B-Instruct、QwQ-32B、DeepSeek-R1 等模型的 Docker 容器创建与多卡启动命令,以...
- GLM-4.5 技术报告解读:Agentic、推理与编码三位一体的基座模型解读 GLM-4.5 的架构取舍——以更深的 MoE 层数与更多的注意力头换取推理能力,并梳理其预训练与中期训练数据配方、基础设施设计,以及两阶段的专家模型迭代式后训练流程。
- vLLM API Server参数调优全解析:解码、并行、缓存、调度、调试与Tool Calling/Reasoning/推测解码配置vLLM API server 常用参数解析与调优方案,覆盖默认参数、解码策略、并行策略、缓存策略、调度策略、调试策略、Tool Calling、Reasoning、结构化输出与推测解码。
- Seed1.5-Thinking 技术报告解读:VAPO 与 DAPO 强化学习训练推理模型解读字节跳动 Seed1.5-Thinking 的强化学习方案:VAPO 与 DAPO 两类算法提升推理模型的训练稳定性、带推理路径的验证器把准确率推到 99.3% 以消除奖励作弊,以及 Decoupled-GAE 与长度自适应优化。
- MiMo-7B 技术报告解读:为推理能力而生的预训练与后训练解读小米 MiMo-7B 如何让 7B 基座模型的推理潜力超越 32B 模型:从预训练阶段的数据质量与配比策略、兼顾性能与推理加速的 MTP,到借鉴竞赛评分机制缓解代码任务稀疏奖励的 Test Difficulty Driven Rewar...
- 探秘 Transformer 之(2):总体架构与文本生成执行流程梳理 Transformer 的总体架构与执行流程:设计动机、模型结构与注意力模块,并按分词、编码、嵌入、位置编码、注意力计算到采样的顺序完整走一遍文本生成过程。
- MoE 并行详解:专家拆分与分布式并行策略讲解稀疏 MoE 架构的分布式训练:把大模型拆成多个专家并由门控网络按样本激活部分专家以节省算力,以及 MoE 与数据并行、模型并行的组合方式和 GShard、Switch-Transformer 等工业界方案。
- 分布式训练并行策略总览:从数据并行到自动并行系统梳理大模型分布式训练的八类并行技术:数据并行、流水线并行、张量并行、序列并行、多维混合并行、自动并行、MoE 并行与优化器相关并行,并给出不同模型规模下的并行策略选择建议。
- 人类对齐与强化学习—RLHF 核心问题梳理与实践难点以问答形式梳理 RLHF 的核心问题:强化学习与有监督学习的区别、RLHF 完整流程、奖励模型是否需与基座一致,以及偏好数据成本高、三阶段迭代慢、PPO 四模型显存开销大等实践痛点与应对思路。
- 自动并行详解:从 Mesh-TensorFlow 到 GSPMD讲解自动并行这一分布式训练的终极目标:给定模型与机器资源后自动选择较优的并行策略,区分半自动的 Mesh-TensorFlow、GShard、GSPMD 与全自动的 FlexFlow、Alpa 等方案及其切分表达方式。
- 多维混合并行详解:DP、PP、TP 的组合与业界实践讲解如何把数据并行、流水线并行与张量并行组合起来:从 DP 与 PP 的设备映射、至少需要 8 卡的 3D 并行,到结合 ZeRO 的混合方案,并梳理 CodeGeeX、GPT-NeoX 与 GLM-130B 的并行策略。
- 探秘 Transformer 之(1):注意力机制的背景与演化动机从 seq2seq、文本生成机制、自回归与隐变量自回归模型讲到编码器-解码器结构,梳理在 CNN 与 RNN 方案之后为什么还需要注意力机制,为后续逐层拆解 Transformer 打下背景基础。
- 流水线并行详解:微批次切分与 GPipe 实现原理讲解流水线并行如何把模型不同层放置到不同设备以解决单卡放不下整个模型的问题:从朴素流水线的气泡问题、微批次切分到 GPipe 的实现,并对比层间并行与层内张量并行的差异。
- 张量并行详解:层内切分的行并行与列并行讲解张量并行的原理与实现:把线性层的权重矩阵按行或按列切分到不同 GPU 上分别计算再合并、非线性层不做额外设计,并延伸到 2D 张量并行等多维切分方式。
- 序列并行详解:突破长序列训练的显存瓶颈讲解 Colossal-AI 提出的序列并行:针对自注意力显存随序列长度平方增长的问题切分序列维度,并给出在 PyTorch 中通过设备网格创建分片计划、并行化模块与执行前向反向的完整代码示例。
- 分布式训练概述:八类并行技术的全景图概览大模型分布式训练的主要并行方式:沿批次维度切分的数据并行、按层或按张量拆分模型的模型并行、张量并行与流水线并行的区别、优化器相关并行、异构系统并行,以及多维混合并行与自动并行。
- 数据并行详解:从 PyTorch DP、DDP 到 FSDP 与 ZeRO讲解数据并行的演进:把数据集切分到多个 GPU、各自持有完整模型副本并聚合梯度,对比 PyTorch 的 DataParallel、DistributedDataParallel 与 FullyShardedDataParallel 的差异...
- PD 分离架构详解:预填充与解码解耦的工程权衡讲解 PD 分离(预填充与解码解耦)推理架构:把两个阶段拆到不同实例分别优化以提升 GPU 利用率,并围绕 KV Cache 是否直连传输、是否按层收发、首 token 处理与 KV Cache 存储池设计等关键问题展开分析。
- 模型压缩三剑客:量化、蒸馏与剪枝的原理对比梳理大语言模型的三类压缩方法:通过降低权重精度减小体积的量化(含训练后量化 PTQ 与量化感知训练 QAT)、用大模型教小模型的知识蒸馏,以及裁剪冗余连接的剪枝,并比较各自的效果与代价。
- 手算 LLM 参数量:以 Qwen2.5-32B 为例逐层拆解以 Qwen2.5-32B-Instruct 的 config 为例,按嵌入层、多头注意力、前馈网络与归一化层逐项推导 Transformer 模型的参数量计算公式,并给出各层参数占比的完整推导过程。
- 思维链与推理编排:从 CoT、自我一致性到 ToT 与 GoT梳理生产落地中常用的提示编排策略:通过少样本或零样本思维链引导模型逐步推理、用自我一致性做多路投票降低幻觉,再到支持搜索与回溯的树状思维 ToT 和图状思维 GoT。
- 探秘 Transformer 之(24):KV Cache 优化的原理与方法分类分析大语言模型服务中 KV Cache 带来的显存压力:多请求、长序列与束搜索等场景都会放大缓存占用,并系统地按公式角度与特性角度梳理 KV Cache 的优化思路与代表性方案。
- SnapKV 详解:基于注意力一致性的 KV Cache 稀疏化讲解 SnapKV 这一 KV Cache 稀疏化方法:利用生成过程中注意力模式的稳定性,在 prefill 阶段把 prompt 拆成 prefix 与窗口两部分,用窗口内 token 的注意力分数筛选需保留的 KV,从而大幅压缩缓存尺寸...
- FlashMLA 详解:面向 Hopper 架构的 MLA 高效解码内核介绍 DeepSeek 开源周首个项目 FlashMLA:针对 Hopper GPU 优化的多头潜注意力解码内核,专为可变长度序列设计,在 H800 上可达 3000GB/s 带宽与 580 TFLOPS 算力,适用于长文档处理与实时对话等...
- Qwen3 技术报告解读:三阶段预训练与思考模式统一解读 Qwen3 的技术报告:通用、质量提升与长上下文三阶段预训练共约 36T token 的数据配比与学习率策略,以及长思维链冷启动、推理强化学习、思考模式融合与通用强化学习组成的四阶段后训练管线。
- Qwen2.5-Omni 技术报告解读:时间对齐多模态 RoPE 与流式语音生成解读 Qwen2.5-Omni 的全模态设计:用时间对齐多模态 RoPE 同步音视频时间戳、音频编码器改为分块注意力、视觉编码器引入 Flash Attention 与 token 合并,并通过滑窗 DiT 实现流式语音生成。
- Prefix-Tuning 与 Prompt Tuning 详解:软提示类参数高效微调对比两种在输入前添加可训练连续向量的参数高效微调方法:Prefix-Tuning 在自回归与编码器-解码器结构中的不同注入方式,以及 Prompt Tuning 的简化思路,并分别给出它们的优点与局限。
- GLU 与 SwiGLU 激活函数详解:从门控线性单元到大模型 FFN 标配从 GLU 门控线性单元的公式推导出发,讲解 Swish 的平滑非单调特性,再推出 PaLM 与 LLaMA 采用的 SwiGLU,并系统列出 Bilinear、ReGLU、GEGLU、SwiGLU 等变体替换 FFN 后对应的前馈网络公式...
- ALiBi 详解:用线性偏置实现长度外推的注意力机制讲解 ALiBi(Attention with Linear Biases):在注意力分数上按 query 与 key 的距离施加线性惩罚偏置,无需额外位置嵌入即可让模型在远超训练长度的序列上保持良好的外推能力,并分析其偏置矩阵与优点。
- 预训练优化器—神经网络优化器全景:从 SGD 到 Adam按时间线系统讲解神经网络优化器:SGD 的随机近似原理、Momentum 的动量加速、ASGD 与 Rprop、AdaGrad 与 AdaDelta 的自适应学习率、RMSProp 与 Adam 的二阶矩估计,并给出各算法的更新公式与适用场...
- LoRA 详解:低秩适配的原理与代码实现讲解 LoRA(Low-Rank Adaptation)的原理:冻结预训练权重、只对增量做低秩分解,用极少的参数完成大模型微调,并给出线性层与注意力模块上带 LoRA 的代码实现示例。
- HuggingFace AutoModel 系列详解:自动加载类与任务对照系统介绍 HuggingFace Transformers 中的 AutoModel 系列自动加载类:按任务类型划分的常用类及其用途、如何根据模型名称自动匹配架构与预训练权重,并给出文本生成等场景的加载与推理代码示例。
- Phi-4-Reasoning 技术报告解读:可教学数据过滤与推理能力训练解读微软 Phi-4-reasoning 的数据工程:从公开网站、已有数据集与合成问题收集种子题库,再按问题是否处于可教学难度区间筛选样本,并梳理其监督微调与强化学习两阶段后训练方案。
- BPE 与 WordPiece 分词方法对比:子词分割与 Tokenizer 原理对比 BPE 与 WordPiece 两种经典子词分割算法,解析 Tokenizer,在编码与解码阶段的词元切分、映射及词汇表构建机制,及其在预训练模型中的应用。
- NCCL 详解:多 GPU 集合通信库与 PyTorch 集成讲解 NVIDIA NCCL 集合通信库:它解决的问题、重要概念与支持的通信操作类型、设备要求与拓扑自动识别优化,并给出在 PyTorch 中初始化进程组、创建分布式模型与调用集合通信的示例。
- 常用 NVIDIA 运维指令速查:互联拓扑、NUMA 与 NVLink 查询整理 GPU 服务器运维常用的 NVIDIA 指令:用 nvidia-smi 与 nvidia-smi topo -m 查看设备状态与互联拓扑、判断是 SYS 还是 NVLink 连接,并结合 NUMA 亲和性与 CPU 绑定排查系统规模与...
- 人类对齐与强化学习—RLHF 全流程与 PPO 原理源码解读从 deepspeed-chat 开源实现入手讲解 RLHF:强化学习中智能体与环境的交互框架、NLP 场景下的强化学习,以及 Actor、Reference、Critic、Reward 四个模型在 PPO 训练流程中的分工与公式推导。
- FlashInfer 详解:LLM 注意力内核库与负载均衡调度介绍 FlashInfer 这一面向大模型服务的注意力内核库与生成器:提供 FlashAttention、稀疏注意力、PageAttention 与采样等高性能实现,覆盖稀疏与密集 KV 存储的 CUDA 与 Tensor 核心模板,并提供...
- SGLang部署DeepSeek实战(H20):多机硬件资源、SSH连接与推理服务搭建SGLang部署DeepSeek实战(H20多机):硬件资源清单、SSH连接配置与推理服务搭建完整记录。
- LLM 推理优化技术纵览:子图融合、模型压缩与量化蒸馏系统梳理大模型推理优化的两大方向:通过算子合并减少 kernel 调用与显存读写的子图融合(FasterTransformer、DeepSpeed Inference、MLC LLM),以及稀疏化、量化与蒸馏三类模型压缩技术。
- NVIDIA GPU 架构演进详解:从 Pascal 到 Blackwell按时间线梳理 NVIDIA GPU 架构的关键技术:Pascal 的 16nm 工艺与 NVLink、Volta 引入的 Tensor Core、Turing 的 RT Core、Ampere 的第三代 Tensor Core、Ada Lo...
- Gemma 3 技术报告解读:局部全局交替注意力与全系列知识蒸馏解读 Gemma 3 的三大关键设计:5:1 的局部与全局交替注意力配合 1024 滑窗在 128K 上下文下大幅压缩 KV 缓存、覆盖全尺寸的知识蒸馏,以及 SigLIP 视觉编码器固定压缩为 256 个视觉 token 的多模态方案。
- 大语言模型简史:从 Transformer (2017) 到 DeepSeek-R1 (2025)以 2017 年 Transformer 架构为起点回顾大语言模型的发展脉络:自注意力带来的并行化革命、2018 到 2020 年的预训练模型时代,一直到 2025 年以高性价比与强推理能力引发行业震动的 DeepSeek-R1。
- DeepSeek 开源周技术总览:FlashMLA、DeepEP、DeepGEMM 与 3FS汇总 DeepSeek 开源周发布的五个基础设施项目:面向 Hopper 架构的 MLA 解码内核 FlashMLA、专家并行通信库 DeepEP、FP8 GEMM 库 DeepGEMM、双向流水线 DualPipe 与专家负载均衡 EPL...
- DeepSeek 进化史:从 V1、V2、V3 到 R1 的技术路线全梳理沿时间线梳理 DeepSeek 的技术演进:67B 基座 V1 的预训练与对齐、引入 MLA 与 MoE 的 V2、采用 FP8 混合精度与无辅助损失负载均衡的 V3,以及以冷启动数据与强化学习锻造推理能力的 R1。
- Qwen2.5-VL 技术报告解读:原生动态分辨率 ViT 与绝对时间编码解读 Qwen2.5-VL 的关键设计:支持任意分辨率输入的原生动态分辨率 ViT 配合窗口注意力大幅降低计算开销、对齐绝对时间而非归一化位置的多模态 RoPE 实现秒级事件定位,以及 SFT 加 DPO 的后训练流程。
- SGLang部署Qwen2.5-72B-Instruct实战:BF16/FP8推理、容器创建与DeepSeek-V3-AWQ部署记录SGLang部署Qwen2.5-72B-Instruct实战:BF16与FP8推理模式、容器创建、DeepSeek-V3-AWQ部署记录与官方安装文档参考。
- LLM 参数量、计算量与显存占用分析:从 Decoder-Only 结构出发以 GPT 系列 decoder-only 架构为例,系统推导大语言模型的参数量、训练与推理计算量(FLOPs)以及显存占用,覆盖 Self-attention 与 MLP 的计算量估算及中间激活带来的显存开销。
- 从 MHA、MQA、GQA 到 MLA:注意力机制的 KV Cache 演进系统梳理注意力机制为压缩 KV 缓存所做的演进:从多头注意力 MHA 出发分析其显存瓶颈,依次推导多查询注意力 MQA、分组查询注意力 GQA,直至用低秩键值联合压缩的多头潜在注意力 MLA 及其数学形式。
- DeepSeek-V3 技术报告解读:FP8 训练、DualPipe 与 MoE 负载均衡解读 DeepSeek-V3 如何用 14.8T 高质量 token、FP8 低精度训练、DualPipe 双向流水线与 MoE 负载均衡,在压低训练与推理成本的同时把开源模型的效果推到新高度。
- vLLM部署Qwen2.5-7B-Instruct实战:框架特性、离线推理、OpenAI兼容API与HuggingFace速度对比vLLM 推理框架部署 Qwen2.5-7B-Instruct 完整实践:框架特性、环境准备、离线推理脚本、OpenAI 兼容 API 服务创建与调用,以及 vLLM 与 HuggingFace 推理速度对比。
- vLLM并发性能测试汇总:Qwen系列与Command R多模型推理延迟对比vLLM推理框架并发性能测试完整汇总,覆盖Qwen2.5-32B/72B、Qwen1.5-72B/110B与Command R多模型,包含TP=8/4/2张量并行、多输入输出长度下的TTFT/TPOT/ITL延迟与QPS吞吐量对比分析。
- 高性能 GPU 服务器硬件拓扑与集群组网详解详解大模型训练集群的硬件拓扑:8 卡 GPU 主机内 CPU、内存、NVMe 与 GPU 如何通过 PCIe 总线和交换芯片互联,NVLink 各代的演进与监控方式,以及 NVSwitch 与 NVLink Switch 在整机与跨机互联中...
- GPU 通信技术详解:GPUDirect、NVLink、NVSwitch 与 RDMA梳理多卡训练需要的通信技术:单机多卡场景下 GPUDirect、GPUDirect Storage 与 P2P、NVLink 与 NVSwitch 让 GPU 绕过 CPU 直接互连,多机场景则依赖 RDMA 实现跨节点的高效数据传输。
- Qwen2.5与Command R+性能评估报告:推理速度、显存占用与TTFT/TPOT/ITL并发对比Qwen2.5 系列(原始与量化模型)与 Command R+ 模型的效率测试报告:推理速度(tokens/s)、不同上下文长度的显存占用(GB)、TTFT/TPOT/ITL 与 QPS 并发性能对比。
- Qwen2.5-7B-Instruct LoRA 微调实战:从数据构建到权重推理以 Qwen2.5-7B-Instruct 为例走通 LoRA 微调全流程:环境准备与依赖安装、模型下载、指令集构建与数据格式化、加载半精度模型与 tokenizer、定义 LoraConfig 并用 Trainer 训练,最后加载 LoR...
- LLM 推理框架运行时优化:CUDA Graph、分块预填充与投机解码分析主流 LLM 推理框架的运行时开销来源(Python GIL 与多进程通信),并梳理 CUDA Graph、多步调度、Chunked Prefill、投机解码、基于哈希的自动前缀缓存与 vLLM Engine V2 等优化手段。
- 混合专家模型 MoE 详解:稀疏性、负载均衡与 Transformer 结合系统讲解混合专家模型:从 MoE 的发展简史说起,解释条件计算带来的稀疏性、token 级负载均衡的必要性,再讲 MoE 层如何嵌入 Transformer,以及 Switch Transformers 等代表性工作与显存代价。
- NVIDIA A100 GPU 服务器配置详解与三代显卡对比整理 NVIDIA A100 GPU 服务器的详细规格:7nm 工艺 542 亿晶体管、6912 个核心、40GB 或 80GB HBM2 显存与近 1.6TB/s 带宽、NVLink 600GB/s 互联、最多切分为 7 个 MIG 实例...
- Hunyuan-Large 模型解读:3890 亿参数的开源 MoE 与 KV 缓存压缩解读腾讯混元 Large:当时规模最大的开源 Transformer 混合专家模型,总参数 3890 亿、激活 520 亿,支持 256K 上下文,主要贡献包括大规模数据合成、混合专家路由策略、KV 缓存压缩与专家特定学习率策略。
- FP16、BF16 与 FP32 精度详解:位结构、表示范围与 PyTorch 实测拆解三种浮点格式在 IEEE 754 下的符号位、指数位与尾数位结构:FP16 的 5 位指数与 10 位尾数、BF16 用 8 位指数换取更大表示范围、FP32 的 24 位尾数精度,并用 PyTorch 代码实测分辨率、机器精度与二进制...
- 快速下载 HuggingFace 模型的几种方式:从浏览器到 Hf_transfer针对国内网络环境总结 HuggingFace 模型的下载方法:网页与多线程下载器(IDM、Aria2)、git clone 的取舍,以及 huggingface-cli 配合 hf_transfer 与 snapshot_download ...
- 权重量化详解:AWQ与GPTQ原理对比及vLLM部署实践大模型权重量化技术详解,对比AWQ激活感知权重量化与GPTQ近似二阶信息量化的原理、算法流程与性能差异,并给出4-bit/8-bit量化模型在vLLM中的部署实践。
- LLM.int8() 量化详解:混合精度分解的 8-Bit 矩阵乘法讲解 LLM.int8() 的混合精度分解量化:先按列提取激活中的离群特征,对离群维度保留 FP16 高精度计算、对其余部分做 INT8 量化矩阵乘,最后反量化相加,在不掉点的前提下压低显存占用。
- InternLM2 模型卡梳理:20 万字长上下文与全维度能力提升梳理 InternLM2 系列模型的特性:在 20 万字长输入中几乎完美实现长文大海捞针、在 LongBench 与 L-Eval 等长文任务上领先,并给出 Model Zoo、性能表现、依赖安装与半精度及量化加载的使用示例。
- 旋转位置编码 RoPE 详解:从绝对位置编码到旋转变换系统推导旋转位置编码:从绝对位置编码与正弦编码出发,讨论良好位置编码应满足的性质,再用复数与旋转矩阵的形式推导 RoPE 如何用绝对位置的旋转表达相对位置关系。
- 人类对齐与强化学习—DPO 直接偏好优化原理详解解读 DPO 论文:跳过显式奖励模型,把偏好优化直接写成语言模型上的分类损失。文章先梳理 RLHF 的 SFT、奖励建模与 RL 微调三阶段流水线,再展开 PPO 算法总览与 DPO 目标函数的推导。
- 七大 LLM 推理服务框架横向对比与选型横向对比 vLLM、Text Generation Inference、CTranslate2、OpenLLM、Ray Serve 等七个主流大模型推理框架:各自的安装方式、适用场景与优缺点,帮助按批量吞吐、CPU 推理或流水线部署等需求选...
- LLaMA-Factory 使用指南:从环境校验到自定义数据集微调介绍使用 LLaMA-Factory 完成大模型微调的完整流程:硬件与 CUDA、PyTorch 环境校验,模型下载与可用性验证,原始模型推理,构建自定义数据集,以及预训练、指令微调与对齐等全链路训练方式。
- Transformer 机制—结构详解:位置编码、自注意力与残差归一化逐层拆解 Transformer 的结构:位置嵌入如何补入序列顺序信息、自注意力机制的矩阵计算与 Padding Mask、残差连接与 Layer Normalization 的作用,并说明它相比 LSTM 串行训练为何能大幅并行提效。
- DeepSeek-V2 模型梳理:236B 参数 MoE 的架构与部署梳理 DeepSeek-V2 这一以经济训练和高效推理为特点的 MoE 语言模型:总参数 236B、每个 token 激活 21B,并整理其更新日志、模型下载、评估结果、架构说明与本地运行及 API 使用方式。
- Mixtral 8x7B 详解:稀疏专家混合模型的架构与源码分析解读 Mistral AI 发布的 Mixtral 8x7B 稀疏专家混合模型:支持 32K 上下文、多语言与代码生成能力突出,并顺着 transformers 源码逐层分析 MixtralConfig、MixtralModel 的初始化与...
- vLLM 源码解析(一):SequenceGroup 与调度执行链路顺着 vLLM 的入口函数逐层拆解推理内核:SequenceGroup 如何组织一次请求中的多条候选序列,调度器如何决定参与推理的请求并完成逻辑块到物理块的映射,以及 Worker 与 CacheEngine 的分工。
- vLLM 架构解析:离线批处理、在线服务与 LLMEngine 内核解析 vLLM 的两种调用方式——同步的离线批推理与异步的在线 API 服务,并深入其内核引擎 LLMEngine 的整体架构:集中式控制器、调度器与执行模块如何协同完成请求的批处理与调度。
- Baichuan-7B 与 Baichuan-13B 梳理:开源可商用中英双语模型梳理百川智能的 Baichuan 系列:基于 Transformer 结构、在约 1.2 万亿 token 上训练的 70 亿参数中英双语模型,在 C-Eval 与 MMLU 等基准上达到同尺寸最好效果,并给出数据处理方法、推理与量化部署方...
- vLLM Prefix 前缀缓存详解:复用 System Prompt 的计算讲解 vLLM 的 Prefix 特性:把每次推理都重复计算的 System Prompt 前缀缓存下来以避免自注意力阶段的冗余计算,配合 FIFO 或贪心的动态调度策略提升吞吐并降低延迟,并给出使用示例。
- PagedAttention 详解:用虚拟内存思想管理 KV Cache讲解 vLLM 的核心技术 PagedAttention:先说明 LLM 推理的 prefill 与 decode 两阶段以及传统 KV cache 预分配造成的显存浪费,再借操作系统虚拟内存与分页管理把 KV cache 切块按需分配。
- Continuous Batching 详解:动态批处理提升 GPU 利用率讲解大语言模型推理中的连续批处理技术:针对输出长度不可预知、请求耗时差异大的特点,在每个迭代动态调整批大小而不是等整批完成,从而显著提升 GPU 利用率与吞吐并降低延迟。
- Llama-1 与 Llama-2 模型梳理:架构改动与训练数据梳理 Llama 系列模型:基于 Transformer 解码器架构,在原始解码器基础上做了前置归一化、RMSNorm、SwiGLU 与旋转位置编码等改动,并给出 Llama-1 与 Llama-2 的模型架构、训练数据构成与训练方法差异。
- ChatGLM-6B 与 ChatGLM2-6B 梳理:中英双语对话模型与本地部署梳理 ChatGLM-6B 与 ChatGLM2-6B:基于 GLM 架构的 62 亿参数中英双语对话模型,经约 1T token 训练并结合监督微调与人类反馈强化学习,INT4 量化后最低 6GB 显存即可在消费级显卡部署,并给出代码调用...
- Flash Attention 加速详解:分块计算、重计算与算子融合讲解 FlashAttention 如何突破注意力的显存访问瓶颈:用 Tiling 分块把计算搬到 SRAM 中完成、反向传播以重计算换显存、通过 kernel 融合减少显存读写,并延伸到块稀疏 FlashAttention。
- vLLM 与 PagedAttention 详解:显存分页的高吞吐推理框架介绍 vLLM 这一开源大模型推理加速框架:以 PagedAttention 高效管理注意力缓存,把吞吐量做到 HuggingFace Transformers 的 14 到 24 倍,并给出基于 Qwen1.5-7B-Chat 的推理代码...
- DeepSpeed 指南:ZeRO 显存优化与分布式训练实践系统讲解为什么需要 DeepSpeed、分布式训练的通信策略与显存构成,逐层拆解 ZeRO 三个级别的参数切分方式、混合精度训练与显存占用分析,并对比 Accelerate 等方案给出适用场景。