Qwen3.6-27B / Qwen3.8-27B 的 vLLM 部署记录。

由于带宽受限(类似于常规的 LPDDR 内存),在推理大模型时生成速度相对较慢,推理效率会被显著拖慢。
Qwen3.6-27B模型部署
模型下载
1 | modelscope download --model Qwen/Qwen3.6-27B-FP8 --local_dir /data/models/Qwen3.6-27B-FP8 |
镜像下载
1 | sudo docker pull vllm/vllm-openai:v0.22.0-cu129-ubuntu2404 |
服务启动
Qwen/Qwen3.6-27B — 27B · DENSE · 256K ctx
首次启动服务
1 | docker run -itd --gpus all \ |
启动服务调优(待修改)
1 | docker run -itd --gpus all \ |
Qwen3.8-27B模型部署
1 | docker run -itd --gpus all \ |
补充:vLLM部署Qwen3.6-27B-FP8实战
vLLM 推理框架—Qwen3.6-27B-FP8部署
启动命令
1 | CUDA_VISIBLE_DEVICES=0,1,2,3 \ |

