SGLang部署Qwen2.5-72B-Instruct实战:BF16/FP8推理、容器创建与DeepSeek-V3-AWQ部署记录

优势:完全支持 BF16 和 FP8 推理模式下的 DeepSeek-V3 模型。

创建环境

官方文档:Install SGLang — SGLang

DeepSeek-V3-AWQ部署记录**1、创建容器** 参考文档:[sglang/benchmark/deepseek_v3 at main · sgl-project/sglang](https://github.com/sgl-project/sglang/tree/main/benchmark/deepseek_v3#performance-optimization-options) 安装方式:pip install "sglang\[all\]\>=0.4.2.post4" --find-links https://flashinfer.ai/whl/cu124/torch2.5/flashinfer ![安装requirements.txt](https://cdn.jsdelivr.net/gh/gkm0120/CDN/img/notion_77e186b7.png) ![requirements.txt安装成功](https://cdn.jsdelivr.net/gh/gkm0120/CDN/img/notion_3bcd751f.png) **2、开始部署** 模型权重文件:/models/DeepSeek-V3-AWQ 基础镜像:sglang_20250212:py311(基于llm_management_20250210:py311构建) 执行:python3 -m sglang.launch_server --model /models/DeepSeek-V3-AWQ/ --tp 8 --trust-remote-code 服务启动日志如下 ![服务开始启动](https://cdn.jsdelivr.net/gh/gkm0120/CDN/img/notion_360a963a.png) ![服务启动失败](https://cdn.jsdelivr.net/gh/gkm0120/CDN/img/notion_2d08f82c.png) 3、**最终结论** 失败原因:[https://github.com/sgl-project/sglang/issues/3476](https://github.com/sgl-project/sglang/issues/3476) ![AWQ类型的模型暂时不支持](https://cdn.jsdelivr.net/gh/gkm0120/CDN/img/notion_05b7f48d.png)
SGLang安装方式:![](https://cdn.jsdelivr.net/gh/gkm0120/CDN/img/notion_12bffa71.png)
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
# create container
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management_sglang --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models sglang_20250212:py311 /bin/bash

# view sglang version
pip list | grep sglang

# https://flashinfer.ai/whl/cu124/torch2.5/flashinfer-python/
pip install flashinfer_python-0.2.2.post1+cu124torch2.5-cp38-abi3-linux_x86_64.whl

# Install the latest version
pip install "sglang[all]>=0.4.3.post2" -i https://pypi.tuna.tsinghua.edu.cn/simple

# clear cache
pip cache purge

# create images
sudo docker commit 7651a038ca4f sglang_20250303:py311

模型部署

Qwen2.5-72B-Instruct

基于sglang_20250303:py311(sglang=v0.4.3.post2)首次部署

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# create container
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management_sglang --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models sglang_20250212:py311 /bin/bash

# view sglang version
pip list | grep sglang

# deploy Qwen2.5-72B-Instruct
nohup python -m sglang.launch_server \
--model-path /models/Qwen2.5-72B-Instruct \
--served-model-name Qwen2.5-72B-Instruct \
--context-length 16384 \
--mem-fraction-static 0.7 \
--trust-remote-code \
--host 0.0.0.0 \
--port 8996 \
--grammar-backend xgrammar \
--tp 8 \
--disable-radix-cache \
--api-key 669b12de160848509c3a0ba5d7704729 >> /mnt/qwen25.log 2>&1 &

基于sglang_20250212:py311(sglang=v0.4.2.post4)首次部署

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# create container
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management_sglang --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models sglang_20250212:py311 /bin/bash

# view sglang version
pip list | grep sglang

# deploy Qwen2.5-72B-Instruct
nohup python -m sglang.launch_server \
--model-path /models/Qwen2.5-72B-Instruct \
--served-model-name Qwen2.5-72B-Instruct \
--context-length 16384 \
--mem-fraction-static 0.7 \
--trust-remote-code \
--host 0.0.0.0 \
--port 8996 \
--grammar-backend xgrammar \
--tp 8 \
--disable-radix-cache \
--api-key 669b12de160848509c3a0ba5d7704729 >> /mnt/qwen25.log 2>&1 &

Athene-V2-Agent

基于sglang_20250303:py311(sglang=v0.4.3.post2)首次

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# create container(sglang=v0.4.3.post2)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management_sglang --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models sglang_20250303:py311 /bin/bash

# view sglang version
pip list | grep sglang

# deploy Athene-V2-Agent
nohup python -m sglang.launch_server \
--model-path /models/Athene-V2-Agent \
--served-model-name Qwen2.5-72B-Instruct \
--context-length 16384 \
--mem-fraction-static 0.7 \
--trust-remote-code \
--host 0.0.0.0 \
--port 8996 \
--grammar-backend xgrammar \
--tp 8 \
--disable-radix-cache \
--api-key 669b12de160848509c3a0ba5d7704729 >> /mnt/qwen25.log 2>&1

基于sglang_20250212:py311(sglang=v0.4.2.post4)首次部署

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# create container
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management_sglang --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models sglang_20250212:py311 /bin/bash

# view sglang version
pip list | grep sglang

# deploy Athene-V2-Agent
nohup python -m sglang.launch_server \
--model-path /models/Athene-V2-Agent \
--served-model-name Qwen2.5-72B-Instruct \
--context-length 16384 \
--mem-fraction-static 0.7 \
--trust-remote-code \
--host 0.0.0.0 \
--port 8996 \
--grammar-backend xgrammar \
--tp 8 \
--disable-radix-cache \
--api-key 669b12de160848509c3a0ba5d7704729 >> /mnt/qwen25.log 2>&1 &

评测基准

1
2
3
4
5
6
7
8
9
export OPENAI_API_KEY=669b12de160848509c3a0ba5d7704729
python3 -m sglang.bench_serving \
--backend vllm \
--dataset-path ./models/ShareGPT_V3_unfiltered_cleaned_split.json \
--num-prompt 300 \
--request-rate-range 1,2,4,8,16,32 \
--random-input 512 \
--random-output 128 \
--multi >> /mnt/qwen25_vllm.log 2>&1 &
本文结束 感谢您的阅读