vLLM 推理框架—Qwen2.5-72B-Instruct并发测试
vLLM 是一种高性能的 GPU 推理框架,通过 PagedAttention 技术优化 GPU 内存效率和吞吐量,适用于大规模高并发场景。
QwQ-32B
基于 llm_management_20250224:py311(vllm==0.7.3)首次部署
模型名称:QwQ-32B
1 | # 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
QwQ-32B性能测试结果详情

QwQ-32B性能测试结果


Qwen2.5-72B-Instruct
基于 llm_management_20250224:py311(vllm==0.7.3)首次部署
模型名称:Qwen2.5-72B-Instruct
1 | # 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
Qwen2.5-72B-Instruct性能测试结果详情

Qwen2.5-72B-Instruct性能测试结果


Qwen2.5-32B-Instruct
基于 llm_management_20250224:py311(vllm==0.7.3)首次部署
模型名称:Qwen2.5-32B-Instruct
1 | # 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
Qwen2.5-32B-Instruct性能测试结果详情

Qwen2.5-32B-Instruct性能测试结果


评测基准
1 | # 以vllm方式启用,openai client调用,测试qwq模型并发效果 |

