vLLM开源模型部署实践汇总:Qwen3-235B、gemma-3-27b、Qwen2.5-72B、QwQ-32B与DeepSeek-R1多卡启动命令

vLLM 推理框架—开源模型部署

拉取代码

1
git clone http://gitlab.zvos.zoomlion.com/aigc-paas/aigc-paas-model-management.git

解决docker内警告以及每次输入密码方法:

1
2
git config --global pull.ff only
git config --global credential.helper store

更新日志

  • 20250327:部署gemma-3-27b-it(vllm0.8.2+v4.49.0-Gemma-3)
  • 20250310:部署QwQ-32B(vllm0.7.3)
  • 20250306:部署Qwen2.5-72B-Instruct(vllm0.7.3)
  • 20250224:部署DeepSeek-R1-Distill-Qwen-32B(vllm0.7.3)

新模型

Qwen3-235B-A22B

1
2
3
4
5
6
7
8
9
10
11
12
# 单卡启动Qwen3-235B-A22B
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 python -m vllm.entrypoints.openai.api_server \
--served-model-name qwen3-235b-a22b \
--port 8998 \
--model /models/Qwen3-235B-A22B \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--gpu-memory-utilization 0.90 \
--disable-log-stats \
--enable-reasoning \
--reasoning-parser deepseek_r1 \
--api-key <YOUR_API_KEY>

gemma-3-27b-it

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
# 创建容器(llm_management_20250328:py311中vllm0.8.2+v4.49.0-Gemma-3)
sudo docker run --gpus '"device=7"' -it -d --network llm-management-network --name gemma3-27b --ipc=host -P -p 8998:8998 -v /data/models:/models llm_management_20250328:py311 /bin/bash

# 单卡启动gemma-3-27b-it
CUDA_VISIBLE_DEVICES=0 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name gemma-3-27b-it \
--port 8998 \
--model /models/gemma-3-27b-it \
--tensor-parallel-size 1 \
--max-model-len 16384 \
--gpu-memory-utilization 0.90 \
--disable-log-stats \
--limit_mm_per_prompt 'image=40' \
--api-key <YOUR_API_KEY> > gemma-3-27b-it.log 2>&1 &

# 创建容器(llm_management_20250328:py311中vllm0.8.2+v4.49.0-Gemma-3)
sudo docker run --gpus all -it -d --network llm-management-network --name gemma3-27b --ipc=host -P -p 8998:8998 -v /data/models:/models llm_management_20250328:py311 /bin/bash

# 8卡启动gemma-3-27b-it
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name gemma-3-27b-it \
--port 8998 \
--model /models/gemma-3-27b-it \
--tensor-parallel-size 8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.90 \
--disable-log-stats \
--limit_mm_per_prompt 'image=40' \
--api-key <YOUR_API_KEY> > gemma-3-27b-it.log 2>&1 &

# 创建容器(llm_management_20250328:py311中vllm0.8.2+v4.49.0-Gemma-3)
sudo docker run --gpus '"device=0,1,3,4"' -it -d --network llm-management-network --name gemma3-27b --ipc=host -P -p 8998:8998 -v /data/models:/models llm_management_20250328:py311 /bin/bash

# 4卡启动gemma-3-27b-it
CUDA_VISIBLE_DEVICES=0,1,2,3 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name gemma-3-27b-it \
--port 8998 \
--model /models/gemma-3-27b-it \
--tensor-parallel-size 4 \
--max-model-len 16384 \
--gpu-memory-utilization 0.80 \
--disable-log-stats \
--limit_mm_per_prompt 'image=40' \
--api-key <YOUR_API_KEY> > gemma-3-27b-it.log 2>&1 &

Qwen2.5-72B-Instruct

部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:Qwen2.5-72B-Instruct

1
2
3
4
5
6
7
8
9
10
11
12
13
# 创建容器(llm_management_20250224:py311中vllm==0.7.3)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20250224:py311 /bin/bash

# 8卡启动Qwen2.5-72B-Instruct
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name Qwen2.5-72B-Instruct \
--port 8996 \
--model /models/Qwen2.5-72B-Instruct \
--tensor-parallel-size 8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.80 \
--disable-log-stats \
--api-key <YOUR_API_KEY> > Qwen2.5-72B-Instruct.log 2>&1 &

部署环境:llm_management_20240910:py311(vllm==0.6.0)

1
2
3
4
5
6
7
8
9
10
11
12
13
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 8卡启动Qwen2.5-72B-Instruct
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name Qwen2.5-72B-Instruct \
--port 8996 \
--model /models/Qwen2.5-72B-Instruct \
--tensor-parallel-size 8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.80 \
--disable-log-stats \
--api-key <YOUR_API_KEY> > Qwen2.5-72B-Instruct.log 2>&1 &

Athene-V2-Agent

部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:Athene-V2-Agent

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
# 创建容器(llm_management_20250224:py311中vllm==0.7.3)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20250224:py311 /bin/bash

# 8卡启动Athene-V2-Agent模型
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name Qwen2.5-72B-Instruct \
--port 8996 \
--model /models/Athene-V2-Agent \
--tensor-parallel-size 8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.80 \
--disable-log-stats \
--api-key <YOUR_API_KEY> > Athene-V2-Agent.log 2>&1 &

# 服务地址(本身为Athene-V2-Agent,命名为Qwen2.5-72B-Instruct方便测试)
Qwen2.5-72B-Instruct
http://10.39.214.107:8996/v1/chat/completions
669b12de160848509c3a0ba5d7704729

QwQ-32B

1
2
3
4
5
6
7
8
9
10
11
12
13
# 创建容器(llm_management_20250224:py311中vllm==0.7.3)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20250224:py311 /bin/bash

# 8卡启动Qwen2.5-72B-Instruct
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name QwQ-32B \
--port 8996 \
--model /models/QwQ-32B \
--tensor-parallel-size 8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.80 \
--disable-log-stats \
--api-key <YOUR_API_KEY> > QwQ-32B.log 2>&1 &

Mistral-Small-24B

部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:Mistral-Small-24B-Instruct-2501

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# 创建容器(llm_management_20250224:py311中vllm=v0.7.3)
sudo docker run --gpus '"device=6"' -it -d --network llm-management-network --name Mistral-Small-24B --ipc=host -P -p 8996:8996 -v /data/models:/models llm_management_20250224:py311 /bin/bash

# 单卡启动Mistral-Small-24B-Instruct-2501模型
CUDA_VISIBLE_DEVICES=0 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name Mistral-Small-24B-Instruct-2501 \
--port 8996 \
--model /models/Mistral-Small-24B-Instruct-2501 \
--tensor-parallel-size 1 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--disable-log-stats \
--enable-prefix-caching \
--api-key <YOUR_API_KEY> > Mistral-Small-24B-Instruct-2501.log 2>&1 &

# 服务地址
Mistral-Small-24B-Instruct-2501
http://10.39.214.110:8996/v1/chat/completions
1e007ec712c542159143aa936d14eef1

c4ai-command-r7b

部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:c4ai-command-r7b-12-2024
基于transformer4.50.0.dev0+vllm0.7.3服务启动失败

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# 创建容器(llm_management_20250224:py311中vllm=v0.7.3)
sudo docker run --gpus '"device=5"' -it -d --network llm-management-network --name c4ai-command-r7b --ipc=host -P -p 8995:8995 -v /data/models:/models llm_management_20250224:py311 /bin/bash

# 单卡启动c4ai-command-r7b-12-2024模型
CUDA_VISIBLE_DEVICES=0 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name c4ai-command-r7b-12-2024 \
--port 8995 \
--model /models/c4ai-command-r7b-12-2024 \
--tensor-parallel-size 1 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--disable-log-stats \
--enable-prefix-caching \
--api-key <YOUR_API_KEY> > c4ai-command-r7b-12-2024.log 2>&1 &

# 服务地址
c4ai-command-r7b-12-2024
http://10.39.214.110:8995/v1/chat/completions
1e007ec712c542159143aa936d14eef1

DeepSeek-R1

部署环境:llm_management_20250224:py311(vllm==0.7.3)
模型名称:DeepSeek-R1-Distill-Qwen-32B

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
# 创建容器(llm_management_20250224:py311中vllm=v0.7.3)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20250224:py311 /bin/bash

# 8卡启动DeepSeek-R1-Distill-Qwen-32B模型
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name deepseek-r1 \
--disable-log-stats \
--enable-prefix-caching \
--trust-remote-code \
--api-key <YOUR_API_KEY> \
--port 8996 \
--model /models/DeepSeek-R1-Distill-Qwen-32B \
--tensor-parallel-size 8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 > DeepSeek-R1-Distill-Qwen-32B.log 2>&1 &

# 服务地址
deepseek-r1
http://10.39.214.103:8998/v1/chat/completions
fe21b93dd0234e64a8ab44d4c49cf365

Qwen2.5-32B-Instruct

1
2
3
4
5
6
7
8
9
10
11
12
13
# 创建容器(llm_management_20250224:py311中vllm=v0.7.3)
sudo docker run --gpus '"device=5"' -it -d --network llm-management-network --name Qwen2.5-32B-Instruct --ipc=host -P -p 8995:8995 -v /data/models:/models llm_management_20250224:py311 /bin/bash

# 单卡启动Qwen2.5-32B-Instruct
CUDA_VISIBLE_DEVICES=0 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name Qwen2.5-32B-Instruct \
--port 8995 \
--model /models/Qwen2.5-32B-Instruct \
--tensor-parallel-size 1 \
--max-model-len 16384 \
--gpu-memory-utilization 0.90 \
--disable-log-stats \
--api-key <YOUR_API_KEY> > Qwen2.5-32B-Instruct.log 2>&1 &

向量化模型、分割模型

正式环境

gitlab.zvos.zoomlion.com

环境类别:正式环境(release_sp22_bge_m3分支)

  • 向量化模型(GPU1):bge-m3
  • 分割模型(GPU2):nlp_bert_document-segmentation_chinese-base、sat-12l-sm
  • 重排序模型(GPU3):bge-reranker-v2-m3、bge-reranker-v2.5-gemma2-lightweight
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
# 创建容器(llm_management_20241108:py311中vllm=v0.7.3)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20241108:py311 /bin/bash

# 单卡部署bge-m3向量化模型
CUDA_VISIBLE_DEVICES=1 nohup python /service/embedding_model/bge_m3.py --port 8994 --model /models/bge-m3 > bge-m3.log 2>&1 &

# 单卡部署nlp_bert_document-segmentation_chinese-base分割模型
CUDA_VISIBLE_DEVICES=2 nohup python /service/document_segmentation/doc_segment.py --port 8993 --model /models/nlp_bert_document-segmentation_chinese-base > nlp_bert_document-segmentation_chinese-base.log 2>&1 &

# 单卡部署sat-12l-sm分割模型
CUDA_VISIBLE_DEVICES=2 nohup python /service/document_segmentation/sat_segment.py --port 8992 --model /models/sat-12l-sm

# 单卡部署bge-reranker-v2-m3重排序模型
CUDA_VISIBLE_DEVICES=3 nohup python /service/reranker_model/bge_reranker.py --port 8995 --model /models/bge-reranker-v2-m3 > bge-reranker-v2-m3.log 2>&1 &

# 单卡部署bge-reranker-v2.5-gemma2-lightweight重排序模型
CUDA_VISIBLE_DEVICES=3 nohup python /service/reranker_model/bge_reranker_gemma.py --port 8991 --model /models/bge-reranker-v2.5-gemma2-lightweight > bge-reranker-v2.5-gemma2-lightweight.log 2>&1 &

测试环境

环境类别:测试环境(release_sp22_bge_m3)

模型(GPU2):Qwen2.5-0.5B-Instruct

1
2
3
4
5
6
7
8
9
10
11
# 创建容器(llm_management_20240910:py311中vllm=v0.6.0)
sudo docker run --gpus '"device=1"' -it -d --network llm-management-network --name one-api --ipc=host -P -p 8767:8767 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 单卡启动Qwen2.5-0.5B-Instruct
CUDA_VISIBLE_DEVICES=0 nohup python service/foundation_model/qwen2_chat.py \
--port 8767 \
--model /models/Qwen2.5-0.5B-Instruct \
--tensor-parallel-size 1 \
--max-model-len 16384 \
--gpu-memory-utilization 0.2 \
--api-key <YOUR_API_KEY> > ./logs/Qwen2.5-0.5B-Instruct.log 2>&1 &

意图识别模型(GPU2):Qwen2.5-7B-Instruct

1
2
3
4
5
6
7
8
9
10
11
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus '"device=2"' -it -d --network llm-management-network --name test_qwen25_7b_instruct --ipc=host -P -p 8766:8766 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 单卡部署Qwen2.5-7B-Instruct模型
CUDA_VISIBLE_DEVICES=0 nohup python service/foundation_model/qwen2_chat.py \
--port 8766 \
--model /models/Qwen2.5-7B-Instruct \
--tensor-parallel-size 1 \
--max-model-len 32768 \
--gpu-memory-utilization 0.28 \
--api-key <YOUR_API_KEY> > ./logs/Qwen2.5-7B-Instruct.log 2>&1 &

重排序模型(GPU0):bge-reranker-v2.5-gemma2-lightweight

1
2
3
4
5
6
7
8
9
10
11
# 创建容器(llm_management_20241108:py311中vllm==0.6.0)
sudo docker run --gpus '"device=2"' -it -d --network llm-management-network --name test-bge-reranker-v2.5-gemma2-lightweight --ipc=host -P -p 10006:10006 -v /data/models:/models llm_management_20241108:py311 /bin/bash

# release_sp22_bge_m3
git clone http://gitlab.zvos.zoomlion.com/aigc-paas/aigc-paas-model-management.git
git checkout release_sp22_bge_m3

# 单卡部署bge-reranker-v2.5-gemma2-lightweight重排序模型(release_sp22_bge_m3)
CUDA_VISIBLE_DEVICES=0 nohup python service/reranker_model/bge_reranker_gemma.py \
--model /models/bge-reranker-v2.5-gemma2-lightweight \
--port 10006 > bge-reranker-v2.5-gemma2-lightweight.log 2>&1 &

向量化模型(GPU0):bge-m3

1
2
3
4
5
6
7
8
9
10
11
# 创建容器(llm_management_20241108:py311中vllm=v0.7.3)
sudo docker run --gpus '"device=1"' -it -d --network llm-management-network --name test-bge-m3 --ipc=host -P -p 10005:10005 -v /data/models:/models llm_management_20241108:py311 /bin/bash

# release_sp22_bge_m3
git clone http://gitlab.zvos.zoomlion.com/aigc-paas/aigc-paas-model-management.git
git checkout release_sp22_bge_m3

# 单卡部署bge-m3向量化模型
CUDA_VISIBLE_DEVICES=0 nohup python ./service/embedding_model/bge_m3.py \
--port 10005 \
--model /models/bge-m3 > bge-m3.log 2>&1 &

模型网络结构

Athene-70B

部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:Athene-70B

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 4卡部署Athene-70B模型
CUDA_VISIBLE_DEVICES=0,1,2,3 python -m vllm.entrypoints.openai.api_server \
--served-model-name Athene-70B \
--port 8996 \
--model /models/Athene-70B \
--tensor-parallel-size 4 \
--max-model-len 8192 \
--gpu-memory-utilization 0.75 \
--disable-log-stats \
--enable-prefix-caching

# 打印模型网络结构
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("/models/Athene-70B", device_map="auto", torch_dtype=torch.bfloat16)
print(model)

模型网络结构如下

模型网络结构

c4ai-command-r-08-2024

部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:c4ai-command-r-08-2024

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 4卡部署c4ai-command-r-08-2024模型
CUDA_VISIBLE_DEVICES=0,1,2,3 python -m vllm.entrypoints.openai.api_server \
--served-model-name c4ai-command-r-08-2024 \
--port 8994 \
--model /models/c4ai-command-r-08-2024 \
--tensor-parallel-size 4 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--disable-log-stats \
--enable-prefix-caching \
--enable-chunked-prefill

# 4卡自定义脚本部署c4ai-command-r-08-2024模模型
CUDA_VISIBLE_DEVICES=0,1,2,3 python ./service/foundation_model/cohere_chat.py \
--port 8996 \
--model /models/c4ai-command-r-08-2024 \
--tensor-parallel-size 8 \
--max-model-len 131072 \
--gpu-memory-utilization 0.7

# 打印模型网络结构
from transformers import AutoTokenizer, AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("/models/c4ai-command-r-08-2024")
print(model)

模型网络结构如下

模型网络结构

c4ai-command-r-plus

部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:c4ai-command-r-plus-08-2024

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 4卡部署c4ai-command-r-plus-08-2024模型
CUDA_VISIBLE_DEVICES=0,1,2,3 python -m vllm.entrypoints.openai.api_server \
--served-model-name c4ai-command-r-plus-08-2024 \
--port 8996 \
--model /models/c4ai-command-r-plus-08-2024 \
--tensor-parallel-size 4 \
--max-model-len 32768 \
--gpu-memory-utilization 0.9 \
--disable-log-stats \
--enable-prefix-caching

# 4卡自定义脚本部署c4ai-command-r-plus-08-2024模型
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 python ./service/foundation_model/cohere_chat.py \
--port 8996 \
--model /models/c4ai-command-r-plus-08-2024 \
--tensor-parallel-size 8 \
--max-model-len 131072 \
--gpu-memory-utilization 0.7

# 打印模型网络结构
from transformers import AutoTokenizer, AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("/models/c4ai-command-r-plus-08-2024")
print(model)

模型网络结构如下

模型网络结构

DeepSeek-V2-Chat-0628

部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:DeepSeek-V2-Chat-0628

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 8卡部署DeepSeek-V2-Chat-0628模型
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 python -m vllm.entrypoints.openai.api_server \
--served-model-name DeepSeek-V2-Chat-0628 \
--port 8996 \
--model /models/DeepSeek-V2-Chat-0628 \
--tensor-parallel-size 8 \
--max-model-len 8192 \
--gpu-memory-utilization 0.90 \
--trust-remote-code \
--guided-decoding-backend lm-format-enforcer

# 打印模型网络结构
import torch
max_memory = {i: "75GB" for i in range(8)}
from transformers import AutoTokenizer, AutoModelForCausalLM, GenerationConfig
model = AutoModelForCausalLM.from_pretrained("/models/DeepSeek-V2-Chat-0628", trust_remote_code=True, device_map="sequential", torch_dtype=torch.bfloat16, max_memory=max_memory, attn_implementation="eager")
print(model)

模型网络结构如下

模型网络结构

DeepSeek-V2.5

部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:DeepSeek-V2.5

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 8卡部署DeepSeek-V2.5模型
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 python -m vllm.entrypoints.openai.api_server \
--served-model-name DeepSeek-V2.5 \
--port 8996 \
--model /models/DeepSeek-V2.5 \
--tensor-parallel-size 8 \
--max-model-len 12288 \
--gpu-memory-utilization 0.90 \
--trust-remote-code \
--disable-log-stats \
--enable-prefix-caching \
--api-key <YOUR_API_KEY>

# 8卡自定义部署DeepSeek-V2.5模型
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 python deepseek_25_chat.py \
--port 8996 \
--model /models/DeepSeek-V2.5 \
--tensor_parallel_size 8 \
--max_model_len 12288 \
--gpu_memory_utilization 0.9

# 打印模型网络结构
import torch
max_memory = {i: "75GB" for i in range(8)}
from transformers import AutoTokenizer, AutoModelForCausalLM, GenerationConfig
model = AutoModelForCausalLM.from_pretrained("/models/DeepSeek-V2.5", trust_remote_code=True, device_map="sequential", torch_dtype=torch.bfloat16, max_memory=max_memory, attn_implementation="eager")
print(model)

模型网络结构如下

模型网络结构

glm-4-9b-chat

部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:glm-4-9b-chat

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 单卡部署glm-4-9b-chat模型
CUDA_VISIBLE_DEVICES=5 nohup python ./service/foundation_model/glm4_chat.py \
--port 8994 \
--model /models/glm-4-9b-chat \
--tensor_parallel_size 1 \
--max_model_len 32768 \
--gpu_memory_utilization 0.52 > ./logs/glm4-9b.log 2>&1 &

# 打印模型网络结构
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("/models/glm-4-9b-chat", torch_dtype="auto",device_map="auto", trust_remote_code=True)
print(model)

模型网络结构如下

模型网络结构

gemma-2-27b-it

部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:gemma-2-27b-it

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 单卡部署gemma-2-27b-it模型
CUDA_VISIBLE_DEVICES=5 python -m vllm.entrypoints.openai.api_server \
--served-model-name gemma-2-27b-it \
--port 8995 \
--model /models/gemma-2-27b-it \
--tensor-parallel-size 1 \
--max-model-len 4096 \
--gpu-memory-utilization 0.90 \
--disable-log-stats \
--enable-prefix-caching

# 打印模型网络结构
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
model = AutoModelForCausalLM.from_pretrained("/models/gemma-2-27b-it", device_map="auto", torch_dtype=torch.bfloat16)
print(model)

模型网络结构如下

模型网络结构

Mixtral-8x22B-Instruct-v0.1

部署环境:llm_management_20240910:py311(vllm==0.6.0)
模型名称:Mixtral-8x22B-Instruct-v0.1

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 4卡部署Mixtral-8x22B-Instruct-v0.1模型
CUDA_VISIBLE_DEVICES=0,1,2,3 python -m vllm.entrypoints.openai.api_server \
--served-model-name Mixtral-8x22B-Instruct-v0.1 \
--port 8899 \
--model /models/Mixtral-8x22B-Instruct-v0.1 \
--tensor-parallel-size 4 \
--max-model-len 8192 \
--gpu-memory-utilization 0.90 \
--disable-log-stats \
--enable-prefix-caching

CUDA_VISIBLE_DEVICES=0,1,2,3 python ./service/foundation_model/mistral_chat.py \
--model /models/Mixtral-8x22B-Instruct-v0.1 \
--tensor-parallel-size 4 \
--dtype bfloat16 \
--max-model-len 8192 \
--port 8899 \
--gpu-memory-utilization 0.9

# 打印模型网络结构
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("/models/Mixtral-8x22B-Instruct-v0.1", torch_dtype="auto",device_map="auto")
print(model)

模型网络结构如下

模型网络结构

Qwen系列

模型网络结构如下

Qwen1.5-14B-Chat模型

Qwen1.5-72B-Chat模型

Qwen1.5-110B-Chat模型

Qwen2-72B-Instruct模型

Qwen2.5-32B-Instruct模型

已弃用模型

agriculture

agriculture_02_accelerate_multi_node第二版(20240531,全量微调14B)

1
2
3
4
5
6
7
8
9
10
11
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 单卡部署agricultural_lora_Qwen1.5-14B-Chat模型
CUDA_VISIBLE_DEVICES=6 python -m vllm.entrypoints.openai.api_server \
--served-model-name agricultural_lora_Qwen1.5-14B-Chat \
--port 8986 \
--model /models/custom/agriculture/agriculture_02_accelerate_multi_node \
--tensor-parallel-size 1 \
--max-model-len 4096 \
--gpu-memory-utilization 0.60

codegeex4-all-9b

1
2
3
4
5
6
7
8
9
10
11
12
13
14
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 单卡部署codegeex4-all-9b模型
CUDA_VISIBLE_DEVICES=5 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name codegeex4-all-9b \
--port 8988 \
--model /models/codegeex4-all-9b \
--tensor-parallel-size 1 \
--max-model-len 12288 \
--gpu-memory-utilization 0.52 \
--disable-log-stats \
--enable-prefix-caching \
--trust-remote-code > ./logs/test-20240726-codegeex4-all-9b-8988.log 2>&1 &

DeepSeek-V2-Lite-Chat

1
2
3
4
5
6
7
8
9
10
11
12
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 单卡部署DeepSeek-V2-Lite-Chat模型
CUDA_VISIBLE_DEVICES=7 python -m vllm.entrypoints.openai.api_server \
--served-model-name DeepSeek-V2-Lite-Chat \
--port 8896 --model /models/DeepSeek-V2-Lite-Chat \
--tensor-parallel-size 1 \
--max-model-len 16384 \
--gpu-memory-utilization 0.62 \
--trust-remote-code --disable-log-stats \
--enable-prefix-caching

DeepSeek-R1-Distill-Llama-70B

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
# 创建容器(llm_management_20250224:py311中vllm==0.7.3)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20250224:py311 /bin/bash

# 4卡部署DeepSeek-R1-Distill-Llama-70B模型
CUDA_VISIBLE_DEVICES=0,1,2,3 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name DeepSeek-R1-Distill-Llama-70B \
--port 8898 \
--model /models/DeepSeek-R1-Distill-Llama-70B \
--tensor-parallel-size 4 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--disable-log-stats \
--enable-prefix-caching \
--api-key <YOUR_API_KEY> > DeepSeek-R1-Distill-Llama-70B.log 2>&1 &

# 8卡部署DeepSeek-R1-Distill-Llama-70B模型
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name DeepSeek-R1-Distill-Llama-70B \
--port 8996 \
--model /models/DeepSeek-R1-Distill-Llama-70B \
--tensor-parallel-size 8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--disable-log-stats \
--enable-prefix-caching \
--api-key <YOUR_API_KEY> > DeepSeek-R1-Distill-Llama-70B.log 2>&1 &

# 服务地址
DeepSeek-R1-Distill-Llama-70B
http://10.39.214.103:8898/v1/chat/completions
1e007ec712c542159143aa936d14eef1

Qwen2-7B-Instruct

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 单卡部署Qwen2-7B-Instruct模型
CUDA_VISIBLE_DEVICES=0 python -m vllm.entrypoints.openai.api_server \
--served-model-name Qwen2-7B-Instruct \
--port 8899 \
--model /models/Qwen2-7B-Instruct \
--tensor-parallel-size 1 \
--max-model-len 32768 \
--gpu-memory-utilization 0.9

# 单卡自定义部署Qwen2-7B-Instruct模型(release—sp25)
CUDA_VISIBLE_DEVICES=0 python ./service/foundation_model/qwen_chat.py \
--model /models/Qwen2-7B-Instruct \
--tensor-parallel-size 1 \
--dtype bfloat16 \
--max-model-len 32768 \
--port 8899

Qwen2-72B-Instruct

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 四卡部署Qwen2-72B-Instruct模型
CUDA_VISIBLE_DEVICES=4,5,6,7 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name Qwen2-72B-Instruct \
--port 8995 \
--model /models/Qwen2-72B-Instruct \
--tensor-parallel-size 4 \
--max-model-len 32768 \
--gpu-memory-utilization 0.75 \
--disable-log-stats \
--enable-prefix-caching > logs/test-20240809-Qwen2-72B-Instruct-8995.log 2>&1 &

# 四卡自定义部署Qwen2-72B-Instruct模型(release-sp25)
CUDA_VISIBLE_DEVICES=4,5,6,7 python ./service/foundation_model/qwen2_chat.py \
--model /models/Qwen2-72B-Instruct \
--tensor-parallel-size 4 \
--dtype bfloat16 \
--max-model-len 8192 \
--port 8895 \
--gpu-memory-utilization 0.9

Qwen2.5-7B-Instruct

1
2
3
4
5
6
7
8
9
10
11
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus '"device=6"' -it -d --network llm-management-network --name watt-tool --ipc=host -P -p 8990-8997:8990-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 2卡自定义部署Qwen2.5-14B-Instruct模型(release-sp25)
CUDA_VISIBLE_DEVICES=0 python service/foundation_model/qwen2_chat.py \
--port 8994 \
--model /models/Qwen2.5-14B-Instruct \
--tensor-parallel-size \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--api-key <YOUR_API_KEY>

注意:使用 --gpus '"device=6"' 后,服务器内只会显示一块卡,如 00000000:B6:00.0

单卡显示

单卡显示

Qwen2.5-14B-Instruct

1
2
3
4
5
6
7
8
9
10
11
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name watt-tool --ipc=host -P -p 8990-8997:8990-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 2卡自定义部署Qwen2.5-14B-Instruct模型(release-sp25)
CUDA_VISIBLE_DEVICES=0,1 python service/foundation_model/qwen2_chat.py \
--port 8994 \
--model /models/Qwen2.5-14B-Instruct \
--tensor-parallel-size 2 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--api-key <YOUR_API_KEY>

Qwen2.5-32B-Instruct

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus all -it -d --network llm-management-network --name watt-tool --ipc=host -P -p 8990-8997:8990-8997 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 4卡自定义部署Qwen2.5-32B-Instruct模型(release-sp25)
CUDA_VISIBLE_DEVICES=0,1,2,3 python service/foundation_model/qwen2_chat.py \
--port 8994 \
--model /models/Qwen2.5-32B-Instruct \
--tensor-parallel-size 4 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--api-key <YOUR_API_KEY>

# 8卡自定义部署Qwen2.5-32B-Instruct模型(release-sp25)
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 python service/foundation_model/qwen2_chat.py \
--port 8994 \
--model /models/Qwen2.5-32B-Instruct \
--tensor-parallel-size 8 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--api-key <YOUR_API_KEY>

# 4卡部署Qwen2.5-32B-Instruct模型
CUDA_VISIBLE_DEVICES=0,1,2,3 python -m vllm.entrypoints.openai.api_server \
--served-model-name Qwen2.5-32B-Instruct \
--port 8994 \
--model /models/Qwen2.5-32B-Instruct \
--tensor-parallel-size 4 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--enable-prefix-caching \
--enable-chunked-prefill \
--api-key 669b12de160848509c3a0ba5d770472

watt-tool-70B

1
2
3
4
5
6
7
8
9
10
11
12
13
14
# 创建容器(llm_management_20240910:py311中vllm==0.6.0)
sudo docker run --gpus '"device=4,5,6,7"' -it -d --network llm-management-network --name watt-tool --ipc=host -P -p 8898:8898 -v /data/models:/models llm_management_20240910:py311 /bin/bash

# 4卡部署watt-tool-70B模型
CUDA_VISIBLE_DEVICES=0,1,2,3 nohup python -m vllm.entrypoints.openai.api_server \
--served-model-name watt-tool-70B \
--port 8898 \
--model /models/watt-tool-70B \
--tensor-parallel-size 4 \
--max-model-len 16384 \
--gpu-memory-utilization 0.8 \
--disable-log-stats \
--enable-prefix-caching \
--api-key <YOUR_API_KEY> > ./logs/watt-tool-70B.log 2>&1 &
本文结束 感谢您的阅读