vLLM 推理框架—qwen25 和 cohere 性能评估
Qwen2.5模型
本部分介绍Qwen2.5系列模型(原始模型和量化模型)的效率测试结果,包括推理速度(tokens/s)与不同上下文长度时的显存占用(GB)。
测试HuggingFace transformers 时的环境配置:
- NVIDIA A100 80GB
- CUDA 12.4
- Pytorch 2.4.0
- Flash Attention 2.6.3
- Transformers 4.43.4
- AutoGPTQ 0.7.1+cu121 (Compiled from source code)
- AutoAWQ 0.2.6
测试vLLM时的环境配置:
- NVIDIA A100 80GB
- CUDA 12.4
- vLLM 0.6.0
- Pytorch 2.4.0
- Flash Attention 2.6.3
- Transformers 4.43.4
基础环境
创建容器:sudo docker run –gpus all -it -d –network llm-management-network –name efficiency_assessment –ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash
统一设定:4个模型都使用四卡部署,在A100上GPU 0,1,2,3这四块卡上部署端口为8997的服务,其中模型最大输出默认为10000,显存占用默认为0.8。
参数说明:TTFT为首个token 响应时长 (Time to first token),TPOT为每个 token 输出时长 (Time per output token),ITL为跨 token 延迟 (Inter-token latency),QPS为每秒请求数(Queries Per Second)。ITL是衡量服务器每次处理请求并返回一定数量token所需的时间,而TPOT是衡量服务器处理单个token所需的时间。
量化模型基准测试报告
为探索qwen2.5量化模型的性能,测试了Qwen2.5不同量化模型,在不同的QPS下的TTFT、TPOT、ITL的性能表现。其中量化模型包括qwen_default(qwen2.5-72B)、qwen2.5_AWQ、qwen2.5_GPTQ_int4、qwen2.5_GPTQ_int8。测试了200个请求在输入长度为1024,输出长度为6,QPS为2,4,6,8情况下,TTFT (Mean TTFT、Midian TTFT、P99 TTFT)、TPOT (Mean TPOT、Midian TPOT、P99 TPOT)、ITL (Mean ITL、Midian ITL、P99 ITL)指标。



图1 4个模型在Mean TTFT、Midian TTFT、P99 TTFT延时(单位:毫秒)



图2 4个模型在Mean TPOT、Midian TPOT、P99 TPOT延时(单位:毫秒)



图3 4个模型在Mean ITL、Midian ITL、P99 ITL延时(单位:毫秒)
上述结果为在同一台A100(80G显存、1000G内存)机器上:qwen2.5-72B相比相应的量化模型在三个指标上延迟更低。
总结: 建议不使用qwen2.5-72B的量化模型。
不同参数模型基准测试报告
为探索 Qwen2.5 大模型在不同参数量下的性能表现,测试了 Qwen2.5 在不同 QPS下的 TTFT、TPOT 和 ITL 指标。测试的量化模型包括:qwen_default(Qwen2.5-72B)、Qwen2.5-32B、Qwen2.5-14B 和 Qwen2.5-7B。
Qwen2.5-72B、Qwen2.5-32B模型使用四卡部署,在A100上GPU 0,1,2,3这四块卡上部署端口为8997的服务。Qwen2.5-14B、Qwen2.5-7B使用单卡部署,在A100上GPU 0这一块卡上部署端口为8997的服务。4个模型最大输出默认为10000,显存占用默认为0.8



图1 4个模型在Mean TTFT、Midian TTFT、P99 TTFT延时(单位:毫秒)



图2 4个模型在Mean TPOT、Midian TPOT、P99 TPOT延时(单位:毫秒)



图3 4个模型在Mean ITL、Midian ITL、P99 ITL延时(单位:毫秒)
上述结果为在同一台A100(80G显存、1000G内存)机器上显示:
在所有三个TTFT、TPOT、ITL指标(平均、中位数、99%尾部延迟)中,Qwen2.5_7B模型表现最佳,具有最低的延迟和最平缓的增长趋势,这表明它在处理高QPS时更为稳定和高效。qwen_default模型在所有指标中表现最差,随着QPS的增加,延迟显著增加,这可能表明它在高负载下的性能不如其他模型。
总结: Qwen2.5_32B和Qwen2.5_14B模型的性能介于两者之间,但Qwen2.5_32B在所有指标中的增长速度略快,这可能意味着在高QPS下,Qwen2.5_14B可能提供更稳定的性能。
Commandr+模型
Commandr+模型不同参数量性能测试报告
为探索Commandr+大模型在不同参数量下的性能表现,测试了 Commandr+ 在不同 QPS和不同输入长度(INPUT_LEN)下的 TTFT、TPOT 和 ITL 指标。测试模型包括:c4ai_32b和c4ai_104b。其中根据Command官方文档,c4ai_7b需要在Transformers(>= 4.48.0.dev0)中才支持Cohere2ForCausalLM 架构,但Transformers目前(2024年12月30日)最新版本为v4.47.1,故暂不支持测试该模型。
c4ai_32b、c4ai_104b模型都使用四卡部署,在A100上GPU 0,1,2,3这四块卡上部署端口为8997的服务。4个模型最大输出默认为10000,显存占用默认为0.8。
固定输入长度:
测试了200个请求在输入长度为1024,输出长度为6,QPS为2,4,8,16,32,64情况下,TTFT (Mean TTFT、Midian TTFT、P99 TTFT)、TPOT (Mean TPOT、Midian TPOT、P99 TPOT)、ITL (Mean ITL、Midian ITL、P99 ITL)指标。



图1 2个模型在Mean TTFT、Midian TTFT、P99 TTFT延时(单位:毫秒)



图2 2个模型在Mean TPOT、Midian TPOT、P99 TPOT延时(单位:毫秒)



图3 2个模型在Mean ITL、Midian ITL、P99 ITL延时(单位:毫秒)
固定QPS
测试了200个请求在QPS为16,输出长度为6,输入长度为1024、2048、4096情况下,TTFT (Mean TTFT、Midian TTFT、P99 TTFT)、TPOT (Mean TPOT、Midian TPOT、P99 TPOT)、ITL (Mean ITL、Midian ITL、P99 ITL)指标。



图4 2个模型在Mean TTFT、Midian TTFT、P99 TTFT延时(单位:毫秒)



图5 2个模型在Mean TPOT、Midian TPOT、P99 TPOT延时(单位:毫秒)



图6 2个模型在Mean ITL、Midian ITL、P99 ITL延时(单位:毫秒)
上述结果为在同一台A100(80G显存、1000G内存)机器上显示:
在固定输入长度下,在所有TTFT和TPOT指标中,c4ai_32b模型在不同QPS下的表现均优于c4ai_104b模型,显示出更低的尾部延迟和尾部概率延时。c4ai_104b模型在高QPS下显示出较高的尾部延迟,这可能意味着在高负载情况下,其性能不如c4ai_32b模型稳定。
在固定QPS情况下,所有TTFT和TPOT指标中,c4ai_32b模型在不同输入长度下的表现均优于c4ai_104b模型,具有更低的尾部延迟和尾部概率延时。c4ai_104b模型虽然在某些情况下可能具有更高的容量或性能,但在这些测试中显示出更高的尾部延迟,这可能意味着在处理高输入长度时,其稳定性和效率不如c4ai_32b模型。在所有ITL指标(平均、中位数、99%事务间延迟)中,c4ai_104b模型在不同输入长度下的表现均优于c4ai_32b模型,显示出更低的延迟和更好的稳定性。c4ai_32b模型在输入长度增加时,其事务间延迟显著增加,尤其是在99%尾部延迟的情况下,这可能意味着在处理高输入长度时,其性能不如c4ai_104b模型稳定。
总结: c4ai_32b模型在尾部延迟方面表现更好,而c4ai_104b模型在事务间延迟方面更为出色,但占用资源多。建议切换为c4ai_32b模型,在高QPS下,c4ai_32b可能提供更稳定的性能。后续等Transformers(>= 4.48.0.dev0)更新后,可以对c4ai_7b模型进行补充测试。

