整理 NVIDIA A100 GPU 服务器的详细规格:7nm 工艺 542 亿晶体管、6912 个核心、40GB 或 80GB HBM2 显存与近 1.6TB/s 带宽、NVLink 600GB/s 互联、最多切分为 7 个 MIG 实例,并对比 V100 与 H100。
规格参数
NVIDIA A100 GPU服务器的详细配置:
- 架构与工艺:NVIDIA A100采用了7nm工艺制造,具有542亿个晶体管。
- 核心数量:它拥有6912个核心。
- 显存:A100提供两种显存配置,分别为40GB和80GB HBM2显存。
- 显存带宽:其显存带宽接近1.6TB/s。
- 计算能力:
- 互联接口:支持PCIe 4.0和NVLink,其中NVLink提供600 GB/s的吞吐量。
- 多实例GPU (MIG):一个A100 GPU最多可分割成7个GPU实例。
- 功耗:最大功耗为400瓦。
- 散热解决方案:被动式散热。
- 计算API:支持CUDA、DirectCompute、OpenCL、OpenACC。
A100 40GB PCIE A100 80GB PCIE A100 40GB SXM A100 80GB SXM FP64 9.7 TFLOPS 9.7 TFLOPS 9.7 TFLOPS FP64 Tensor Core 19.5 TFLOPS 19.5 TFLOPS 19.5 TFLOPS FP32 19.5 TFLOPS 19.5 TFLOPS 19.5 TFLOPS Tensor Float 32 (TF32) 156 TFLOPS 312 TFLOPS* 156 TFLOPS BFLOAT16 Tensor Core 312 TFLOPS 624 TFLOPS* 312 TFLOPS FP16 Tensor Core 312 TFLOPS 624 TFLOPS* 312 TFLOPS INT8 Tensor Core 624 TOPS 1248 TOPS* 624 TOPS GPU 显存 40GB HBM2 80GB HBM2e 40GB HBM2 GPU 显存带宽 1,555GB/s 1,935GB/s 1,555GB/s 最大热设计功耗 (TDP) 250W 300W 400W 多实例 GPU 最大为 7 MIG @ 5GB 最大为 7 MIG @ 10GB 最大为 7 MIG @ 5GB 外形规格 PCIe PCIe SXM 互联 NVIDIA® NVLink® 桥接器(可桥接 2 个 GPU): 600GB/s **PCIe 4.0:64GB/s NVIDIA® NVLink® 桥接器(可桥接 2 个 GPU): 600GB/s **PCIe 4.0:64GB/s NVLink: 600GB/sPCIe Gen4: 64GB/s
A100 提供 40GB 和 80GB 两种显存版本,80GB 版本将 GPU 显存增加了一倍,并提供超快速的显存带宽(超过 2TB/s),可处理超大型模型和数据集。它还具有强大的第三代 Tensor Core 技术,支持多种数据类型,包括 TF32、FP64、BF16 和 INT8 等。
A100 的多实例 GPU (MIG) 技术可以提高 GPU 的硬件利用率,为每个用户提供隔离的 GPU 资源。此外,A100 还具有新的 NVLink 技术,提供更高的多 GPU 拓展性和性能。
A100 的峰值性能包括双精度浮点运算(FP64)为 9.7 TFLOPS,单精度浮点运算(FP32)为 19.5 TFLOPS,Tensor Float 32 (TF32) 运算性能为 156 TFLOPS,整数运算性能为 INT8 624 TOPS。
GPU 的核心架构及参数
GPU 的差别和各自的优势
- CUDA Core:CUDA Core 是 NVIDIA GPU上的计算核心单元,用于执行通用的并行计算任务,是最常看到的核心类型。NVIDIA 通常用最小的运算单元表示自己的运算能力,CUDA Core 指的是一个执行基础运算的处理元件,我们所说的 CUDA Core 数量,通常对应的是 FP32 计算单元的数量。
- Tensor Core:Tensor Core 是 NVIDIA Volta 架构及其后续架构(如Ampere架构)中引入的一种特殊计算单元。它们专门用于深度学习任务中的张量计算,如矩阵乘法和卷积运算。Tensor Core 核心特别大,通常与深度学习框架(如 TensorFlow 和 PyTorch)相结合使用,它可以把整个矩阵都载入寄存器中批量运算,实现十几倍的效率提升。
- RT Core:RT Core 是 NVIDIA 的专用硬件单元,主要用于加速光线追踪计算。正常数据中心级的 GPU 核心是没有 RT Core 的,主要是消费级显卡才为光线追踪运算添加了 RTCores。RT Core 主要用于游戏开发、电影制作和虚拟现实等需要实时渲染的领域。
NVIDIA GPU 架构的演进
| 架构名称 | Volta-伏特 | Turing-图灵 | Ampere-安培 | Hopper-赫柏 |
|---|---|---|---|---|
| 发布时间 | 2017 | 2018 | 2020 | 2022 |
| 核心参数 | 80个SM, 每个SM包括32个FP64+64个Int32+64个FP32+8个Tensor Cores | 102核心92个SM, SM重新设计每个SM包含64个Int32+64个FP32+8个Tensor Cores | 108个SM, 每个SM包含64个FP32+64个INT32+32个FP64+4个Tensor Cores | 132个SM, 每个SM包含128个FP32+64个INT32+64个FP64+4个Tensor Cores |
| 特点 | NVLink2.0, Tensor Cores第一代, 支持AI运算 | Tensor Core2.0, RT Core第一代 | Tensor Core3.0, RT Core2.0 NVLink3.0, 结构稀疏性矩阵MIG1.0 | Tensor Core4.0, NVlink4.0结构稀疏性矩阵MIG2.0 |
| 纳米制程 | 12nm 211亿晶体管 | 12nm 186亿晶体管 | 7nm 283亿晶体管 | 4nm 800亿晶体管 |
| 代表产品 | V100Titan V | T4, 2080TI RTX 5000 | A100、A800 A30系列 | H100、H800 |
- Volta 架构:Volta 架构是 NVIDIA GPU 的第六代架构,发布于 2017 年。Volta 架构专注于深度学习和人工智能应用,并引入了 Tensor Core。
- Turing 架构:Turing 架构是 NVIDIA GPU 的第七代架构,发布于 2018 年。Turing 架构引入了实时光线追踪(RTX)和深度学习超采样(DLSS)等重要功能。
- Ampere 架构:Ampere 架构是 NVIDIA GPU 的第八代架构,2020 年发布。Ampere 架构在计算能力、能效和深度学习性能方面都有重大提升。Ampere 架构的 GPU 采用了多个流多处理器(SM)和更大的总线宽度,提供了更多的 CUDA Core 和更高的频率。它还引入了第三代 Tensor Core,提供更强大的深度学习计算性能。Ampere 架构的 GPU 还具有更高的内存容量和带宽,适用于大规模的数据处理和机器学习任务。
- Hopper 架构:Hopper 架构是 NVIDIA GPU 的第九代架构,2022 年发布。相较于 Ampere,Hopper 架构支持第四代 Tensor Core,且采用新型流式处理器,每个 SM 能力更强。Hopper 架构在计算能力、深度学习加速和图形功能方面带来新的创新和改进。
V100 vs A100 vs H100
| 性能参数 | V100 PCle | A100 80GB PCIe | A800 80GB PCIe | H100 80GB PCIe |
|---|---|---|---|---|
| 微架构 | Volta | Ampere | Ampere | Hopper |
| FP64 | 7TFLOPS | 9.7TFLOPS | 9.7TFLOPS | 26 TFLOPS |
| FP32 | 14TFLOPS | 19.5TFLOPS | 19.5TFLOPS | 51 TFLOPS |
| FP16 Tensor Core | 312TFLOPS | 312TFLOPS | 756.5 TFLOPS | |
| INT8 Tensor Core | 62 TOPS | 624 TOPS | 624 TOPS | 1513 TOPS |
| GPU显存 | 32/16GB HBM2 | 80GB HBM2e | 80GB HBM2e | 80GB |
| GPU显存带宽 | 900 GB/s | 1935GB/s | 1935GB/s | 2TB/s |
| 最大热设计功耗 (TDP) | 250W | 300W | 300W | 300-350W |
| 多实例GPU | 最多7个MIG 每个10GB | 最多7个MIG 每个10GB | 最多7个MIG 每个10GB | |
| 外形规格 | PCle双插槽风冷式 或单插槽液冷式 | PCle双插槽风冷式 或单插槽液冷式 | PCle双插槽风冷式 | |
| 互连技术 | NVLink: 300 GB/s PCIE: 32 GB/s | 搭载2个GPU的 NVIDIA” NVLink” 桥接器:600GB/s PCle 4.0: 64GB/s | 搭载2个GPU的 NVIDIA” NVLink”桥接器:400GB/s PCle 4.0: 64GB/s | NVLink: 600GB/s PCle 5.0: 128GB/s |
| 服务器选项 | 搭载1至8个GPU的合作伙伴认证系统和NVIDIA认证系统 | 搭载1至8个GPU的合作伙伴认证系统和NVIDIA认证系统 | 搭载1至8个GPU的合作伙伴认证系统和NVIDIA认证系统 |

