SGLang
SGLang 是一种基于图计算的推理加速框架,通过图结构优化并行计算,支持复杂任务处理和分布式部署,特别适合高并发、低延迟的企业级应用。
sglang==0.4.3.post2
基于sglang_20250303:py311(sglang==0.4.3.post2)首次部署
1 | 创建容器(sglang_20250303:py311中sglang==0.4.3.post2) |
sglang==0.4.2.post4
基于sglang_20250212:py311(**sglang==0.4.2.post4**)首次部署
1 | 创建容器(sglang_20250212:py311中sglang==0.4.2.post4) |
1 | 创建容器(sglang_20250303:py311中sglang==0.4.3.post2) |
(2).默认启用flash attention 3进行分块预填充
版本:0.4.3
(3).MTP
The accept rate of the MTP module is very high (~1.9 avg accept length for draft 2 tokens, e.g. --speculative-num-steps 2 --speculative-eagle-topk 1 --speculative-num-draft-tokens 2).
We try to use it to draft more tokens and achieved better speedup. (2.5~3 avg accept length for draft 4 tokens for 2 steps, e.g. --speculative-num-steps 2 --speculative-eagle-topk 4 --speculative-num-draft-tokens 4)
版本:v0.4.3.post1
1 | 创建容器(sglang_20250303:py311中sglang==0.4.3.post2) |
(4).增加了对 FP8 的 torch.compile 支持,在线推理速度达到 50 token/s
版本:0.4.3
此版本应使用:--enable-torch-compile --torch-compile-max-bs 1
1 | 创建容器(sglang_20250303:py311中sglang==0.4.3.post2) |
vllm
vLLM 是一种高性能的 GPU 推理框架,通过 PagedAttention 技术优化 GPU 内存效率和吞吐量,适用于大规模高并发场景。
vllm==0.7.3
基于llm_management_20250224:py311(vllm==0.7.3)首次部署
1 | 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
vllm==0.6.0
基于llm_management_20240910:py311(vllm==0.6.0)首次部署
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
vllm参数调优
基于llm_management_20250224:py311(vllm==0.7.3)首次部署
To use vLLM V1:
Install the latest version of vLLM with pip install vllm –upgrade.
Set the environment variable export VLLM_USE_V1=1.
Use vLLM’s Python API or OpenAI-compatible server (vllm serve <model-name>). You don’t need any change to the existing API.
1 | 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
LMDeploy
LMDeploy 是一个高效的大模型推理框架,提供低延迟和高吞吐量的推理能力,支持模型量化和多模态任务部署,适用于企业级实时应用。
lmdeploy==0.7.1
1 | 创建容器(lmdeploy_20250304:py311中lmdeploy==0.7.1) |
lmdelploy参数调优

(1).max-batch-size
此版本应使用--max-batch-size 32
1 | 创建容器(lmdeploy_20250304:py311中lmdeploy==0.7.1) |
测试结果
以sglang、vllm方式启用,openai client调用,测试qwen模型并发效果
test_qwen_concurrent.py
1 | # -*- coding: utf-8 -*- |
generate_prompt_util.py
1 | # -*- coding: utf-8 -*- |

