Docker 启动命令—Qwen3-235B-A22B-Instruct-2507
1 | sudo docker run \ |
裸机启动命令—Qwen3-235B-A22B-Instruct-2507
1 | python3 -m vllm.entrypoints.openai.api_server \ |
裸机启动命令—Qwen3.5-122B-A10B
目前Qwen3.5-122B-A10B模型现状
1 | python3 -m vllm.entrypoints.openai.api_server \ |
优化方案
- 模型与精度选型:FP8 预量化权重 + bf16 计算精度,是 Ampere 架构下性价比最高的组合 —— 权重显存直接减半,腾出大量空间给 KV 缓存提升并发;同时 A100 原生 BF16 算力拉满,无额外精度损失。
- 并行与注意力:TP=8 单实例张量并行 + FLASHINFER 注意力后端,8 卡全 NVLink 互联下通信效率最优;FLASHINFER 针对 Qwen3.5 MoE 架构深度优化,比 FlashAttention-2 计算速度快 10%~20%,显存效率更高。
- 显存与 KV 优化:FP8_E5M2 KV 缓存 + 0.92 显存利用率,KV 显存直接减半,是提升并发性价比最高的手段;0.92 的阈值在 A100 上兼顾了显存利用率和稳定性。
- 调度与增值优化:分块预填充 + 前缀缓存 + MTP 投机解码,三者分别解决长请求阻塞、公共前缀重复计算、解码单步出 Token 少的问题,是混合负载下提升有效吞吐的关键。
- 启动命令
1 | python3 -m vllm.entrypoints.openai.api_server \ |
Docker 启动命令—Qwen3.5-122B-A10B-FP8(128k长度,激进配置)
1 | sudo docker run \ |
Docker 启动命令—Qwen3.5-122B-A10B-FP8(262K 模型 YARN 拓展至 1M)
1 | sudo docker run \ |
benchmark评估
1 | vllm bench serve \ |
服务调用
1 | import time |

