Qwen3.6-27B与Qwen3.8-27B部署实战:vLLM Docker镜像、FP8量化与单卡推理

Qwen3.6-27B / Qwen3.8-27B 的 vLLM 部署记录。

由于带宽受限(类似于常规的 LPDDR 内存),在推理大模型时生成速度相对较慢,推理效率会被显著拖慢。

Qwen3.6-27B模型部署

模型下载

1
modelscope download --model Qwen/Qwen3.6-27B-FP8 --local_dir /data/models/Qwen3.6-27B-FP8

镜像下载

1
sudo docker pull vllm/vllm-openai:v0.22.0-cu129-ubuntu2404

服务启动

Qwen/Qwen3.6-27B — 27B · DENSE · 256K ctx

首次启动服务

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
docker run -itd --gpus all \
--privileged --ipc=host -p 8000:8000 \
-e VLLM_DISABLED_KERNELS=CutlassFp8BlockScaledMMKernel,CutlassFP8ScaledMMLinearKernel \
-v /data/models/Qwen3.6-27B-FP8:/model \
vllm/vllm-openai:v0.22.0-cu129-ubuntu2404 \
--model /model \
--served-model-name Qwen3.6-27B \
--trust-remote-code \
--tensor-parallel-size 1 \
--max-num-batched-tokens 8192 \
--max-num-seqs 256 \
--max-model-len 262144 \
--gpu-memory-utilization 0.85 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-encoder-tp-mode data \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}' \
--api-key df444f1463bd4fc3847fd6c50512f7b4 \
--quantization fp8 \
--kv-cache-dtype fp8

启动服务调优(待修改)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
docker run -itd --gpus all \
--privileged --ipc=host -p 8000:8000 \
-v /data/models/Qwen3.6-27B-FP8:/model \
vllm/vllm-openai:v0.22.0-cu129-ubuntu2404 \
--model /model \
--served-model-name Qwen3.6-27B \
--trust-remote-code \
--tensor-parallel-size 1 \
--max-num-batched-tokens 8192 \
--max-num-seqs 256 \
--max-model-len auto \
--gpu-memory-utilization 0.85 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-encoder-tp-mode data \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}'
--api-key df444f1463bd4fc3847fd6c50512f7b4

Qwen3.8-27B模型部署

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
docker run -itd --gpus all \
--privileged --ipc=host -p 8000:8000 \
-e VLLM_DISABLED_KERNELS=CutlassFp8BlockScaledMMKernel,CutlassFP8ScaledMMLinearKernel \
-v /data/models/Qwen3.8-27B-FP8:/model \
vllm/vllm-openai:v0.27.1-cu129-ubuntu2404 \
--model /model \
--served-model-name Qwen3.8-27B \
--trust-remote-code \
--tensor-parallel-size 1 \
--max-num-batched-tokens 8192 \
--max-num-seqs 256 \
--max-model-len 262144 \
--gpu-memory-utilization 0.85 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-encoder-tp-mode data \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}' \
--api-key df444f1463bd4fc3847fd6c50512f7b4 \
--quantization fp8 \
--kv-cache-dtype fp8

补充:vLLM部署Qwen3.6-27B-FP8实战

vLLM 推理框架—Qwen3.6-27B-FP8部署

启动命令

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
CUDA_VISIBLE_DEVICES=0,1,2,3 \
python3 -m vllm.entrypoints.openai.api_server \
--model /data/models/Qwen3.6-27B-FP8/ \
--served-model-name Qwen/Qwen3.6-27B \
--dtype auto \
--disable-custom-all-reduce \
--host 0.0.0.0 \
--port 8080 \
--trust-remote-code \
--max-model-len 204800 \
--tensor-parallel-size 4 \
--gpu-memory-utilization 0.85 \
--max-num-batched-tokens 30720 \
--enable-chunked-prefill \
--enable-prefix-caching \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--max-num-seqs 40 \
--attention-backend FLASHINFER \
--speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}' \
--api-key <YOUR_API_KEY>
本文结束 感谢您的阅读