vLLM 推理框架部署 Qwen3-235B-A22B 大语言模型实践 置顶 | 发表于 2026-07-23 | 分类于 大模型全栈知识 , 推理框架 | 10.9k | 66 分钟Qwen3-235B-A22B大语言模型完整部署实践指南,覆盖vLLM与SGLang双框架启动参数、FP8量化优化、Kubernetes部署YAML、多机多卡分布式配置与推理性能调优。阅读全文 »
Mooncake推理框架环境搭建实战:系统依赖、编译安装与Qwen2.5-72B-Instruct部署 置顶 | 发表于 2026-06-04 | 分类于 推理框架 | 6.2k | 35 分钟Mooncake推理框架环境搭建完整指南:Ubuntu系统依赖、cmake/gcc/Python/Go版本要求、基础库安装与编译部署流程。阅读全文 »
vLLM开源模型部署实践汇总:Qwen3-235B、gemma-3-27b、Qwen2.5-72B、QwQ-32B与DeepSeek-R1多卡启动命令 置顶 | 发表于 2025-05-23 | 分类于 推理框架 | 5k | 28 分钟vLLM 推理框架开源模型部署实践汇总,包含 Qwen3-235B-A22B、gemma-3-27b-it、Qwen2.5-72B-Instruct、QwQ-32B、DeepSeek-R1 等模型的 Docker 容器创建与多卡启动命令,以及向量化/分割/重排序模型部署和模型网络结构。阅读全文 »
探秘 Transformer 之(24):KV Cache 优化的原理与方法分类 置顶 | 发表于 2025-04-21 | 分类于 大模型全栈知识 , 大模型推理优化 | 21.7k | 79 分钟分析大语言模型服务中 KV Cache 带来的显存压力:多请求、长序列与束搜索等场景都会放大缓存占用,并系统地按公式角度与特性角度梳理 KV Cache 的优化思路与代表性方案。阅读全文 »
从 MHA、MQA、GQA 到 MLA:注意力机制的 KV Cache 演进 置顶 | 发表于 2025-02-20 | 分类于 大模型推理优化 | 6.1k | 28 分钟系统梳理注意力机制为压缩 KV 缓存所做的演进:从多头注意力 MHA 出发分析其显存瓶颈,依次推导多查询注意力 MQA、分组查询注意力 GQA,直至用低秩键值联合压缩的多头潜在注意力 MLA 及其数学形式。阅读全文 »
vLLM 源码解析(一):SequenceGroup 与调度执行链路 置顶 | 发表于 2024-04-24 | 分类于 大模型推理优化 | 13k | 52 分钟顺着 vLLM 的入口函数逐层拆解推理内核:SequenceGroup 如何组织一次请求中的多条候选序列,调度器如何决定参与推理的请求并完成逻辑块到物理块的映射,以及 Worker 与 CacheEngine 的分工。阅读全文 »
LM Studio部署Qwen3.8-27B实战(GB10):一键安装、GGUF模型加载与OpenAI兼容API服务 发表于 2026-08-28 | 分类于 模型部署 | 512 | 2 分钟在 GB10 上使用 LM Studio 部署 Qwen3.8-27B 的完整步骤:一键安装、启动守护进程、下载 GGUF 模型、加载、启动 OpenAI 兼容 API 服务器,以及本机与远程调用测试。阅读全文 »
MiniCPM-O 4.5 CookBook概览:多模态模型配套文档与使用指南入口 发表于 2026-08-25 | 分类于 模型认知与生态 | 7 | 1 分钟MiniCPM-o 4.5 CookBook 概览入口与配套文档截图。阅读全文 »
Qwen3.6-27B与Qwen3.8-27B部署实战:vLLM Docker镜像、FP8量化与单卡推理 发表于 2026-08-25 | 分类于 模型部署 | 521 | 2 分钟Qwen3.6-27B与Qwen3.8-27B大模型部署实战指南,覆盖vLLM Docker镜像启动、FP8量化配置、FlashInfer后端优化与Chunked预填充参数调优。阅读全文 »
主机DNS解析排查记录:网络连通性与域名解析故障定位(20260723) 发表于 2026-08-20 | 分类于 问题排查 | 7 | 1 分钟主机 DNS 解析排查记录(20260723)。阅读全文 »
H20部署DeepSeek-V4-Flash-0731实战:FP8 KV Cache、DSpark投机解码与专家并行调优 发表于 2026-08-10 | 分类于 模型部署 | 281 | 1 分钟H20 上部署 DeepSeek-V4-Flash-0731 的完整记录:硬件层面、模型权重、vLLM/SGLang 启动脚本与调优配置(FP8 KV Cache、DSpark 投机解码、专家并行等)。阅读全文 »
大模型推理加速三种草稿模型对比:DFlash纯并行、DSpark半自回归与Eagle3纯自回归架构选型 发表于 2026-08-10 | 分类于 大模型推理优化 | 193 | 1 分钟大模型推理加速三种草稿模型方案对比:DFlash(纯并行)、DSpark(半自回归)与 Eagle3(纯自回归)的核心架构、生成机制与选型建议。阅读全文 »