首页 / 技术地图 / AI Infra 基础设施

AI Infra 基础设施

GPU 集群 · 容器化 · 编排调度 · 监控运维
大模型服务稳定高效运行的基础设施能力:GPU 硬件(A100/H20)与 NVLink/NVSwitch/NCCL 通信、Docker/Kubernetes 容器化编排、模型服务化与负载均衡、GPU 监控与推理指标(TTFT/TPOT/Throughput)、容量规划与高可用部署。
19 篇深度文章 返回技术地图
全部子文章(19 篇)