模型地址:deepseek-ai/DeepSeek-V3 · Hugging Face
模型介绍:DeepSeek-V3,是一个强大的混合专家 (MoE) 语言模型,总共有 671B 个参数,每个 token 激活 37B。为了实现高效的推理和经济高效的训练,DeepSeek-V3 采用了多头潜在注意力 (MLA) 和 DeepSeekMoE 架构,这些架构在 DeepSeek-V2 中得到了彻底的验证。此外,DeepSeek-V3 开创了一种无辅助损失的负载平衡策略,并设置了多 token 预测 (MTP) 训练目标以获得更强大的性能。并在 14.8 万亿个多样化和高质量的 token 上对 DeepSeek-V3 进行了预训练,然后进行监督微调和强化学习阶段,以充分利用其功能。
模型性能对比
](https://cdn.jsdelivr.net/gh/gkm0120/CDN/img/notion_970d4ce8.png)1 | pip install vllm --upgrade -i https://pypi.tuna.tsinghua.edu.cn/simple |
2、创建容器(主节点和从节点):llm_management
1 | sudo docker run --gpus all -it -d --network host --name llm_management --ipc=host -v /data/models:/models llm_management_20250210:py311 /bin/bash |
3、建立NCCL连接(主节点107上执行)
首先修改/etc/profile来建立NCCL网络通信解决下面问题,然后使用source /etc/profile激活配置
Gloo connectFullMesh failed with [../third_party/gloo/gloo/transport/tcp/pair.cc:144] no error
1 | Network |
然后执行:nohup ray start –disable-usage-stats –head –num-gpus 8 &
同时在从节点111上修改/etc/profile文件,然后使用source /etc/profile激活配置
1 | Network |
最后执行:nohup ray start –disable-usage-stats –num-gpus 8 –address=’10.39.214.107:6379’ &
4、查看ray状态
执行:ray status

5、部署deepseek-v3服务
模型权重文件:/models/DeepSeek-V3(FP8版本)
基础镜像:llm_management_20250210:py311(基于llm_management_20240910:py311构建)
使用vllm直接执行下列命令
1 | vllm serve /models/DeepSeek-V3/ --trust-remote-code --tensor-parallel-size 16 --served-model-name deepseek-v3 deepseek --port 8002 |
服务启动日志如下

6、最终结论
调用失败,失败原因AssertionError: fp8e4nv data type is not supported on CUDA arch < 89

DeepSeek-V3-AWQ(int4)
1、创建镜像:llm_management_20250210
GitHub - vllm-project/vllm at v0.7.2, vllm==0.7.2
1 | pip install vllm --upgrade -i https://pypi.tuna.tsinghua.edu.cn/simple |
2、创建容器(主节点和从节点):llm_management
1 | sudo docker run --gpus all -it -d --network host --name llm_management --ipc=host -v /data/models:/models llm_management_20250210:py311 /bin/bash |
3、部署deepseek-v3服务
使用vllm直接执行下列命令(8卡最大31440,gpu_util=0.9)
MLA is not supported with awq_marlin quantization. Disabling MLA
1 | vllm serve /models/DeepSeek-V3-AWQ/ --trust-remote-code --tensor-parallel-size 16 --served-model-name deepseek-v3 deepseek --port 8002 --max-model-len 16384 --gpu-memory-utilization 0.8 |
服务启动日志如下


DeepSeek-V3-bf16(BF16)
介绍:模型权重大小为1.4T,为671B的MOE模型
开启网卡ibs16:使用source /etc/profile激活配置(否则报错 Gloo connectFullMesh failed with \[../third_party/gloo/gloo/transport/tcp/pair.cc:144\] no error)
**1. 检查网卡状态** ip addr show ibs16或者ip link set ibs16 up **2. 启用网卡** ip link set ibs16 up或者ifconfig ibs16 up **3.确认网卡状态** ip addr show ibs161 | sudo docker run --gpus all -it -d --network host --name llm_management --ipc=host -P -p 8900-8997:8900-8997 -v /data/models:/models vllm_20250212:py311 /bin/bash |
2、部署deepseek-v3服务
模型权重文件:/models/DeepSeek-V3-bf16
基础镜像:vllm_20250212:py311(基于llm_management_20250210:py311构建)
使用vllm直接执行下列命令
1 | 20250216首次部署命令 |
部署日志

3、最终结论
vllm 0.7.2版本,4机器集群32卡,成功部署DeepSeekv3完整版本(原生fb8转fb16),4台A100机器模型加载+通讯时间20分钟左右部署,decode速度为10~12token每秒。
二、llama.cpp
DeepSeek-V3-AWQ(GUUF)
llama.cpp版本:GitHub - ggerganov/llama.cpp at b4689
使用方法:需在llama.cpp-b4689文件夹目录下,执行
1 | pip install requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple |
python convert_hf_to_gguf.py /models/DeepSeek-V3-AWQ/


DeepSeek-V3-bf16(GUUF)
使用之前的容器:0a112247a6fe
进入到llama.cpp-b4689目录下执行python convert_hf_to_gguf.py /models/DeepSeek-V3-bf16/

llamacpp环境镜像:llamacpp_4689_20250214:py311
1 | 基于llamacpp_4689_20250214:py311创建容器 |
三、SGLang
优势:完全支持 BF16 和 FP8 推理模式下的 DeepSeek-V3 模型。
DeepSeek-V3-AWQ(int4)
1、创建容器
参考文档:sglang/benchmark/deepseek_v3 at main · sgl-project/sglang
安装方式:pip install “sglang[all]>=0.4.2.post4” –find-links https://flashinfer.ai/whl/cu124/torch2.5/flashinfer

2、开始部署
模型权重文件:/models/DeepSeek-V3-AWQ
基础镜像:sglang_20250212:py311(基于llm_management_20250210:py311构建)
执行:python3 -m sglang.launch_server –model /models/DeepSeek-V3-AWQ/ –tp 8 –trust-remote-code
服务启动日志如下

3、最终结论
失败原因:https://github.com/sgl-project/sglang/issues/3476
四、Ktransformers
0.3.0-preview镜像*:ktransformers_v03_20250214:py311*(基于cuda:12.4.1-cudnn-runtime-ubuntu22.04)
0.2.0镜像*:ktransformers_v02_20250214:py311*(基于ktransformers_v03_20250214:py311)
DeepSeek-V2-Lite-Chat
**miniconda镜像**
基础镜像:miniconda:py311 *1、**创建容器***1 | sudo docker load --input /data/docker_images/miniconda_py311.tar |
*2、**安装cmake等工具***
1
2
apt-get update
apt-get install gcc g++ cmake ninja-build
*3、**安装python环境***
whl下载地址:[https://github.com/kvcache-ai/ktransformers/releases/download/v0.1.4/ktransformers-0.3.0rc0+cu126torch26fancy-cp311-cp311-linux_x86_64.whl](https://github.com/kvcache-ai/ktransformers/releases/download/v0.1.4/ktransformers-0.3.0rc0+cu126torch26fancy-cp311-cp311-linux_x86_64.whl)
1
2
pip install torch packaging ninja cpufeature numpy -i https://pypi.tuna.tsinghua.edu.cn/simple
pip install ktransformers-0.3.0rc0+cu126torch26fancy-cp311-cp311-linux_x86_64.whl


*4、**ktransformers部署***
1
python -m ktransformers.local_chat --model_path /models/DeepSeek-V2-Lite-Chat --gguf_path /models/DeepSeek-V2-Lite-Chat-Q4_K_M-GGUF --max_new_tokens 10000 --cpu_infer 120
- `-model_path`(必填):模型地址。
> 注意:目录中不需要.safetensors文件。我们只需要配置文件来构建模型和 tokenizer。
- `-gguf_path`(必填):GGUF 文件的目录路径。请注意,该目录应仅包含当前模型的 GGUF,这意味着每个模型都需要一个单独的目录。
- `-optimize_rule_path`(除 Qwen2Moe 和 DeepSeek-V2 外必需):包含优化规则的 YAML 文件的路径。ktransformers /optimize/optimize_rules目录中预先编写了两个规则文件,用于优化 DeepSeek-V2 和 Qwen2-57B-A14 这两个 SOTA MoE 模型。
- `-max_new_tokens`:Int(默认值=1000)。要生成的新token的最大数量。
- `-cpu_infer`:Int(默认值=10)。用于推理的 CPU 数量。理想情况下应设置为(核心总数 - 2)。1 | 拉取镜像 |
docker 镜像解决GLIBCXX_3.4.32问题
1 | apt-get install -y software-properties-common |
2、ktransformers(0.3.0-preview)
1 | ktransformers安装 |
3、*ktransformers部署(离线)***
模型配置文件:/models/DeepSeek-V2-Lite-Chat
模型gguf文件:/models/DeepSeek-V2-Lite-Chat-Q4_K_M-GGUF
基础镜像:ktransformers_v03_20250214:py311
1 | sudo docker run --gpus all -it -d --network llm-management-network --name ktransformers_v03 --ipc=host -P -p 10000-10004:10000-10004 -v /data/models:/models ktransformers_v03_20250214:py311 /bin/bash |
4、创建镜像(ktransformers=0.2.0)
指定版本:ktransformers-0.2.0+cu125torch24avx512-cp311-cp311-linux_x86_64.whl
服务地址:https://github.com/kvcache-ai/ktransformers/releases/tag/v0.2.0
1 | ktransformers环境安装(基于已创建的0.3.0-preview环境) |
5、*ktransformers部署(v0.2在线)***
模型配置文件:/models/DeepSeek-V2-Lite-Chat
模型gguf文件:/models/DeepSeek-V2-Lite-Chat-Q4_K_M-GGUF
基础镜像:ktransformers_v02_20250214:py311
1 | 基于ktransformers_v02_20250214:py311创建容器 |
ktransformers部署日志如下

DeepSeek-V3-bf16
ktransformers restful部署(v0.3.0在线)
模型配置文件:/models/DeepSeek-V3-bf16
模型gguf文件:/models/DeepSeek-V3-Bf16-256x20B-F16
基础镜像:ktransformers_v03_20250214:py311
1 | 基于ktransformers_v03_20250214:py311创建容器 |
ktransformers 部署(v0.2.0)
基础镜像:ktransformers_v02_20250214:py311
1 | 创建容器 |
DeepSeek-V3-Q4_K_M
ktransformers 在线部署(v0.2.0)
基础镜像:ktransformers_v02_20250214:py311
1 | 创建容器 |
ktransformers 离线部署(v0.2.0)
1 | v0.2.0离线(gpu-marlin.yaml + 65) |
五、LMdeploy
支持单机多卡并行,不支持多机并行
8*H200(8*141GB HBM)可执行
1 | lmdeploy serve api_server deepseek-ai/DeepSeek-V3-FP8 --tp 8 --backend pytorch |
调用方式:参考Quick Start — lmdeploy
六、评测基准
1 | ## vLLM的bench测试 |

