模型地址:deepseek-ai/DeepSeek-V3 · Hugging Face
模型介绍:DeepSeek-V3,是一个强大的混合专家 (MoE) 语言模型,总共有 671B 个参数,每个 token 激活 37B。为了实现高效的推理和经济高效的训练,DeepSeek-V3 采用了多头潜在注意力 (MLA) 和 DeepSeekMoE 架构,这些架构在 DeepSeek-V2 中得到了彻底的验证。此外,DeepSeek-V3 开创了一种无辅助损失的负载平衡策略,并设置了多 token 预测 (MTP) 训练目标以获得更强大的性能。并在 14.8 万亿个多样化和高质量的 token 上对 DeepSeek-V3 进行了预训练,然后进行监督微调和强化学习阶段,以充分利用其功能。
vLLM优势:支持具有 FP8 和 BF16 模式的 DeekSeek-V3 模型,以实现张量并行和流水线并行。
硬件机器:A100(16卡,80G显存)
DeepSeek-V3(FP8)
1、基础镜像:llm_management_20240910
构建镜像名称:llm_management_20250210:py311
GitHub - vllm-project/vllm at v0.7.2, vllm==0.7.2
1 | pip install vllm --upgrade -i https://pypi.tuna.tsinghua.edu.cn/simple |
2、创建容器(主节点和从节点):llm_management
1 | sudo docker run --gpus all -it -d --network host --name llm_management --ipc=host -v /data/models:/models llm_management_20250210:py311 /bin/bash |
3、建立NCCL连接(主节点107上执行)
首先修改/etc/profile来建立NCCL网络通信解决下面问题,然后使用source /etc/profile激活配置
Gloo connectFullMesh failed with [../third_party/gloo/gloo/transport/tcp/pair.cc:144] no error
1 | Network |
然后执行:nohup ray start –disable-usage-stats –head –num-gpus 8 &
同时在从节点111上修改/etc/profile文件,然后使用source /etc/profile激活配置
1 | Network |
最后执行:nohup ray start –disable-usage-stats –num-gpus 8 –address=’10.39.214.107:6379’ &
4、查看ray状态
执行:ray status

5、部署deepseek-v3服务
模型权重文件:/models/DeepSeek-V3(FP8版本)
基础镜像:llm_management_20250210:py311(基于llm_management_20240910:py311构建)
使用vllm直接执行下列命令
1 | vllm serve /models/DeepSeek-V3/ --trust-remote-code --tensor-parallel-size 16 --served-model-name deepseek-v3 deepseek --port 8002 |
服务启动日志如下

6、最终结论
调用失败,失败原因AssertionError: fp8e4nv data type is not supported on CUDA arch < 89

DeepSeek-V3-bf16(BF16)
介绍:模型权重大小为1.4T,为671B的MOE模型
开启网卡ibs16:使用source /etc/profile激活配置(否则报错 Gloo connectFullMesh failed with \[../third_party/gloo/gloo/transport/tcp/pair.cc:144\] no error)
**1. 检查网卡状态** ip addr show ibs16或者ip link set ibs16 up **2. 启用网卡** ip link set ibs16 up或者ifconfig ibs16 up **3.确认网卡状态** ip addr show ibs161 | sudo docker run --gpus all -it -d --network host --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models vllm_20250212:py311 /bin/bash |
2、部署deepseek-v3服务
模型权重文件:/models/DeepSeek-V3-bf16
基础镜像:vllm_20250212:py311(基于llm_management_20250210:py311构建)
使用vllm直接执行下列命令
1 | 20250216首次部署命令 |
部署日志

3、最终结论
vllm 0.7.2版本,4机器集群32卡,成功部署DeepSeekv3完整版本(原生fb8转fb16),4台A100机器模型加载+通讯时间20分钟左右部署,decode速度为10~12token每秒。

