vLLM方式部署
显卡类型:NVIDIA H20-3e 141GB
驱动版本:595.45.04
cuda版本:13.2
镜像版本:vllm/vllm-openai:v0.22.1-cu129-ubuntu2404
vLLM简介
vLLM 是一个快速且易于使用的 LLM 推理和服务库。
vLLM(Very Large Language Model Serving)是由加州大学伯克利分校团队开发的高性能、低延迟的大语言模型(LLM)推理和服务框架。它专为大规模生产级部署设计,尤其擅长处理超长上下文(如8k+ tokens)和高并发请求,同时显著优化显存利用率,是当前开源社区中吞吐量最高的LLM推理引擎之一。
- 高吞吐量:采用先进的服务器吞吐量技术。
- 内存管理:通过PagedAttention高效管理注意力键和值内存。
- 请求批处理:支持连续批处理传入请求。
- 模型执行:利用CUDA/HIP图实现快速模型执行。
- 量化技术:支持GPTQ、AWQ、INT4、INT8和FP8量化。
- 优化内核:包括与FlashAttention和FlashInfer的集成。
- 其他特性:支持推测解码、分块预填充。
推理故障排查
A800 不支持原生 FP8 计算,但后来已经支持在”不原生支持 FP8 计算”的显卡上,以兼容方式运行 FP8 模型——在运行时临时将 FP8 权重扩展到 BF16 再计算。会出现(Worker_TP7_EP7 pid=606) [rank7]:W0425 09:50:09.413000 606 torch/_higher_order_ops/triton_kernel_wrap.py:1026] ValueError("type fp8e4nv not supported in this architecture. The supported fp8 dtypes are ('fp8e4b15', 'fp8e5')")
将 --kv-cache-dtype 设置成 auto,会出现:(Worker_TP3_EP3 pid=409) ERROR 04-25 09:58:38 [multiproc_executor.py:879] AssertionError: DeepseekV4 only supports fp8 kv-cache format for now, got auto,Ampere 架构下的 A100、A800 暂时是别想跑原生的 DeepSeek V4。
若出现torch._inductor.exc.InductorError: AssertionError,则应该是 PyTorch 在尝试对 DeepSeek V4 模型进行图优化时,因某些算子不兼容而导致失败。
加了 --enforce-eager 参数,暂时禁用了编译优化,能启动服务(很慢),去掉--compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE", "custom_ops":["all"]}'
transformers版本冲突升级后报ModuleNotFoundError或ImportError,大概率是transformers还停在v4。直接pip install transformers>=5.0解决。如果其他包依赖v4不想动,建新虚拟环境。
CUDA graph捕获失败v0.22对DeepSeek V4和Qwen3.5/3.6的CUDA graph做了大量改动,首次启动可能捕获失败。加上–enforce-eager参数跳过CUDA graph先用eager模式跑通,确认模型加载没问题后再去掉这个参数。
Model Runner V2回退警告v0.22默认对Qwen3密集模型使用MRv2,但部分特性(如某些LoRA适配器)还不支持,会自动回退到MRv1并打印警告。这不是错误,不影响使用,只是提示你某些功能走的旧路径。
DeepSeek-V4-Flash服务部署
生产环境需要考虑的因素:KV Cache、运行时 buffer、通信 buffer、并发余量、推理框架开销,长上下文、Think Max、多并发 Agent

InfiniBand 网卡生效
常见的命名有 eth0、bond0、eno1 或 enp4s0 等
启动参数(InfiniBand 网卡生效)
1 | export VLLM_ENGINE_READY_TIMEOUT_S=3600 |
InfiniBand 网卡无效
1 | export VLLM_ENGINE_READY_TIMEOUT_S=3600 |
参数调优:vllm serve - vLLM - vLLM 文档、豆包、mp.weixin.qq.com、mp.weixin.qq.com
GLM-5.1-FP8服务部署
生产环境需要考虑的因素:KV Cache、运行时 buffer、通信 buffer、并发余量、推理框架开销,长上下文、Think Max、多并发 Agent
InfiniBand 网卡生效(常见的命名有 eth0、bond0、eno1 或 enp4s0 等)
1 | docker run -d \ |
InfiniBand 网卡无效
1 | docker run -d \ |
参数调优参考:vllm serve - vLLM - vLLM 文档、豆包、mp.weixin.qq.com、mp.weixin.qq.com
SGLang方式部署
1 | docker run -d \ |

