NVIDIA A100 GPU 服务器配置详解与三代显卡对比

整理 NVIDIA A100 GPU 服务器的详细规格:7nm 工艺 542 亿晶体管、6912 个核心、40GB 或 80GB HBM2 显存与近 1.6TB/s 带宽、NVLink 600GB/s 互联、最多切分为 7 个 MIG 实例,并对比 V100 与 H100。

规格参数

NVIDIA A100 GPU服务器的详细配置:

  • 架构与工艺:NVIDIA A100采用了7nm工艺制造,具有542亿个晶体管。
  • 核心数量:它拥有6912个核心。
  • 显存:A100提供两种显存配置,分别为40GB和80GB HBM2显存。
  • 显存带宽:其显存带宽接近1.6TB/s。
  • 计算能力:
  • 互联接口:支持PCIe 4.0和NVLink,其中NVLink提供600 GB/s的吞吐量。
  • 多实例GPU (MIG):一个A100 GPU最多可分割成7个GPU实例。
  • 功耗:最大功耗为400瓦。
  • 散热解决方案:被动式散热。
  • 计算API:支持CUDA、DirectCompute、OpenCL、OpenACC。
    A100 40GB PCIEA100 80GB PCIEA100 40GB SXMA100 80GB SXM
    FP649.7 TFLOPS9.7 TFLOPS9.7 TFLOPS
    FP64 Tensor Core19.5 TFLOPS19.5 TFLOPS19.5 TFLOPS
    FP3219.5 TFLOPS19.5 TFLOPS19.5 TFLOPS
    Tensor Float 32 (TF32)156 TFLOPS312 TFLOPS*156 TFLOPS
    BFLOAT16 Tensor Core312 TFLOPS624 TFLOPS*312 TFLOPS
    FP16 Tensor Core312 TFLOPS624 TFLOPS*312 TFLOPS
    INT8 Tensor Core624 TOPS1248 TOPS*624 TOPS
    GPU 显存40GB HBM280GB HBM2e40GB HBM2
    GPU 显存带宽1,555GB/s1,935GB/s1,555GB/s
    最大热设计功耗 (TDP)250W300W400W
    多实例 GPU最大为 7 MIG @ 5GB最大为 7 MIG @ 10GB最大为 7 MIG @ 5GB
    外形规格PCIePCIeSXM
    互联NVIDIA® NVLink® 桥接器(可桥接 2 个 GPU):
    600GB/s **PCIe 4.0:64GB/sNVIDIA® NVLink® 桥接器(可桥接 2 个 GPU):
    600GB/s **PCIe 4.0:64GB/sNVLink: 600GB/sPCIe Gen4: 64GB/s

A100 提供 40GB 和 80GB 两种显存版本,80GB 版本将 GPU 显存增加了一倍,并提供超快速的显存带宽(超过 2TB/s),可处理超大型模型和数据集。它还具有强大的第三代 Tensor Core 技术,支持多种数据类型,包括 TF32、FP64、BF16 和 INT8 等。

A100 的多实例 GPU (MIG) 技术可以提高 GPU 的硬件利用率,为每个用户提供隔离的 GPU 资源。此外,A100 还具有新的 NVLink 技术,提供更高的多 GPU 拓展性和性能。

A100 的峰值性能包括双精度浮点运算(FP64)为 9.7 TFLOPS,单精度浮点运算(FP32)为 19.5 TFLOPS,Tensor Float 32 (TF32) 运算性能为 156 TFLOPS,整数运算性能为 INT8 624 TOPS。

GPU 的核心架构及参数

GPU 的差别和各自的优势

  • CUDA Core:CUDA Core 是 NVIDIA GPU上的计算核心单元,用于执行通用的并行计算任务,是最常看到的核心类型。NVIDIA 通常用最小的运算单元表示自己的运算能力,CUDA Core 指的是一个执行基础运算的处理元件,我们所说的 CUDA Core 数量,通常对应的是 FP32 计算单元的数量。
  • Tensor Core:Tensor Core 是 NVIDIA Volta 架构及其后续架构(如Ampere架构)中引入的一种特殊计算单元。它们专门用于深度学习任务中的张量计算,如矩阵乘法和卷积运算。Tensor Core 核心特别大,通常与深度学习框架(如 TensorFlow 和 PyTorch)相结合使用,它可以把整个矩阵都载入寄存器中批量运算,实现十几倍的效率提升。
  • RT Core:RT Core 是 NVIDIA 的专用硬件单元,主要用于加速光线追踪计算。正常数据中心级的 GPU 核心是没有 RT Core 的,主要是消费级显卡才为光线追踪运算添加了 RTCores。RT Core 主要用于游戏开发、电影制作和虚拟现实等需要实时渲染的领域。
    NVIDIA GPU 架构的演进
架构名称Volta-伏特Turing-图灵Ampere-安培Hopper-赫柏
发布时间2017201820202022
核心参数80个SM, 每个SM包括32个FP64+64个Int32+64个FP32+8个Tensor Cores102核心92个SM, SM重新设计每个SM包含64个Int32+64个FP32+8个Tensor Cores108个SM, 每个SM包含64个FP32+64个INT32+32个FP64+4个Tensor Cores132个SM, 每个SM包含128个FP32+64个INT32+64个FP64+4个Tensor Cores
特点NVLink2.0, Tensor Cores第一代, 支持AI运算Tensor Core2.0, RT Core第一代Tensor Core3.0, RT Core2.0 NVLink3.0, 结构稀疏性矩阵MIG1.0Tensor Core4.0, NVlink4.0结构稀疏性矩阵MIG2.0
纳米制程12nm 211亿晶体管12nm 186亿晶体管7nm 283亿晶体管4nm 800亿晶体管
代表产品V100Titan VT4, 2080TI RTX 5000A100、A800 A30系列H100、H800
  • Volta 架构:Volta 架构是 NVIDIA GPU 的第六代架构,发布于 2017 年。Volta 架构专注于深度学习和人工智能应用,并引入了 Tensor Core。
  • Turing 架构:Turing 架构是 NVIDIA GPU 的第七代架构,发布于 2018 年。Turing 架构引入了实时光线追踪(RTX)和深度学习超采样(DLSS)等重要功能。
  • Ampere 架构:Ampere 架构是 NVIDIA GPU 的第八代架构,2020 年发布。Ampere 架构在计算能力、能效和深度学习性能方面都有重大提升。Ampere 架构的 GPU 采用了多个流多处理器(SM)和更大的总线宽度,提供了更多的 CUDA Core 和更高的频率。它还引入了第三代 Tensor Core,提供更强大的深度学习计算性能。Ampere 架构的 GPU 还具有更高的内存容量和带宽,适用于大规模的数据处理和机器学习任务。
  • Hopper 架构:Hopper 架构是 NVIDIA GPU 的第九代架构,2022 年发布。相较于 Ampere,Hopper 架构支持第四代 Tensor Core,且采用新型流式处理器,每个 SM 能力更强。Hopper 架构在计算能力、深度学习加速和图形功能方面带来新的创新和改进。

    V100 vs A100 vs H100

性能参数V100 PCleA100 80GB PCIeA800 80GB PCIeH100 80GB PCIe
微架构VoltaAmpereAmpereHopper
FP647TFLOPS9.7TFLOPS9.7TFLOPS26 TFLOPS
FP3214TFLOPS19.5TFLOPS19.5TFLOPS51 TFLOPS
FP16 Tensor Core312TFLOPS312TFLOPS756.5 TFLOPS
INT8 Tensor Core62 TOPS624 TOPS624 TOPS1513 TOPS
GPU显存32/16GB HBM280GB HBM2e80GB HBM2e80GB
GPU显存带宽900 GB/s1935GB/s1935GB/s2TB/s
最大热设计功耗 (TDP)250W300W300W300-350W
多实例GPU最多7个MIG 每个10GB最多7个MIG 每个10GB最多7个MIG 每个10GB
外形规格PCle双插槽风冷式 或单插槽液冷式PCle双插槽风冷式 或单插槽液冷式PCle双插槽风冷式
互连技术NVLink: 300 GB/s PCIE: 32 GB/s搭载2个GPU的 NVIDIA” NVLink” 桥接器:600GB/s PCle 4.0: 64GB/s搭载2个GPU的 NVIDIA” NVLink”桥接器:400GB/s PCle 4.0: 64GB/sNVLink: 600GB/s PCle 5.0: 128GB/s
服务器选项搭载1至8个GPU的合作伙伴认证系统和NVIDIA认证系统搭载1至8个GPU的合作伙伴认证系统和NVIDIA认证系统搭载1至8个GPU的合作伙伴认证系统和NVIDIA认证系统
本文结束 感谢您的阅读