vLLM 推理框架—开源模型部署
拉取代码
1 | git clone http://gitlab.zvos.zoomlion.com/aigc-paas/aigc-paas-model-management.git |
解决docker内警告以及每次输入密码方法:
1 | git config --global pull.ff only |
更新日志
- 20250327:部署gemma-3-27b-it(vllm0.8.2+v4.49.0-Gemma-3)
- 20250310:部署QwQ-32B(vllm0.7.3)
- 20250306:部署Qwen2.5-72B-Instruct(vllm0.7.3)
- 20250224:部署DeepSeek-R1-Distill-Qwen-32B(vllm0.7.3)
新模型
Qwen3-235B-A22B
1 | 单卡启动Qwen3-235B-A22B |
gemma-3-27b-it
1 | 创建容器(llm_management_20250328:py311中vllm0.8.2+v4.49.0-Gemma-3) |
Qwen2.5-72B-Instruct
部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:Qwen2.5-72B-Instruct
1 | 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
部署环境:llm_management_20240910:py311(vllm==0.6.0)
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
Athene-V2-Agent
部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:Athene-V2-Agent
1 | 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
QwQ-32B
1 | 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
Mistral-Small-24B
部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:Mistral-Small-24B-Instruct-2501
1 | 创建容器(llm_management_20250224:py311中vllm=v0.7.3) |
c4ai-command-r7b
部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:c4ai-command-r7b-12-2024
基于transformer4.50.0.dev0+vllm0.7.3服务启动失败
1 | 创建容器(llm_management_20250224:py311中vllm=v0.7.3) |
DeepSeek-R1
部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:DeepSeek-R1-Distill-Qwen-32B
1 | 创建容器(llm_management_20250224:py311中vllm=v0.7.3) |
Qwen2.5-32B-Instruct
1 | 创建容器(llm_management_20250224:py311中vllm=v0.7.3) |
向量化模型、分割模型
正式环境
环境类别:正式环境(release_sp22_bge_m3分支)
- 向量化模型(GPU1):bge-m3
- 分割模型(GPU2):nlp_bert_document-segmentation_chinese-base、sat-12l-sm
- 重排序模型(GPU3):bge-reranker-v2-m3、bge-reranker-v2.5-gemma2-lightweight
1 | 创建容器(llm_management_20241108:py311中vllm=v0.7.3) |
测试环境
环境类别:测试环境(release_sp22_bge_m3)
模型(GPU2):Qwen2.5-0.5B-Instruct
1 | 创建容器(llm_management_20240910:py311中vllm=v0.6.0) |
意图识别模型(GPU2):Qwen2.5-7B-Instruct
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
重排序模型(GPU0):bge-reranker-v2.5-gemma2-lightweight
1 | 创建容器(llm_management_20241108:py311中vllm==0.6.0) |
向量化模型(GPU0):bge-m3
1 | 创建容器(llm_management_20241108:py311中vllm=v0.7.3) |
模型网络结构
Athene-70B
部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:Athene-70B
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
模型网络结构如下

c4ai-command-r-08-2024
部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:c4ai-command-r-08-2024
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
模型网络结构如下

c4ai-command-r-plus
部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:c4ai-command-r-plus-08-2024
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
模型网络结构如下

DeepSeek-V2-Chat-0628
部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:DeepSeek-V2-Chat-0628
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
模型网络结构如下

DeepSeek-V2.5
部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:DeepSeek-V2.5
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
模型网络结构如下

glm-4-9b-chat
部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:glm-4-9b-chat
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
模型网络结构如下

gemma-2-27b-it
部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:gemma-2-27b-it
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
模型网络结构如下

Mixtral-8x22B-Instruct-v0.1
部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:Mixtral-8x22B-Instruct-v0.1
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
模型网络结构如下

Qwen系列
模型网络结构如下





已弃用模型
agriculture
agriculture_02_accelerate_multi_node第二版(20240531,全量微调14B)
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
codegeex4-all-9b
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
DeepSeek-V2-Lite-Chat
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
DeepSeek-R1-Distill-Llama-70B
1 | 创建容器(llm_management_20250224:py311中vllm==0.7.3) |
Qwen2-7B-Instruct
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
Qwen2-72B-Instruct
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
Qwen2.5-7B-Instruct
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
注意:使用 --gpus '"device=6"' 后,服务器内只会显示一块卡,如 00000000:B6:00.0


Qwen2.5-14B-Instruct
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
Qwen2.5-32B-Instruct
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |
watt-tool-70B
1 | 创建容器(llm_management_20240910:py311中vllm==0.6.0) |

