跳到主要内容

客户案例

区域云服务提供商

4,000 个 GPU 集群互联网络部署。

行业
云与 AI 基础设施
区域
亚太地区
部署规模
4,000 已部署 gpu 数量
所用产品
G6400, G4400-C, S6700-32CQ 另有 3 款
部署总览示意图

项目挑战

该云服务提供商计划将 GPU 训练集群扩展至 4,000 个 GPU,分布于多个数据中心机房,但其互联网络由三家供应商共同交付,分别负责交换设备、光模块和集成支持。

每轮扩容前,Spine-Leaf 交换机软件版本与第三方布线之间的互操作性问题都会占用数周集成时间。当互联网络故障涉及多家供应商时,也缺乏统一的责任归属和升级处理渠道。

解决方案

互联网络统一采用运行 SONiC 的 S6700 Spine 系列交换机,配套使用来自同一经过验证的光互联产品线的 400G MPO 光模块和 1.6T ACC 机架内线缆组件。

部署由 G6400 风冷节点组成的 GPU 机柜列,并在机房功率密度要求较高的区域配套部署 G4400-C 液冷机柜列,计算、互联网络和布线均由同一供应商提供。

部署 Apollo Cloud AI,实现互联网络实时遥测,将集群健康状态监控和端口级诊断整合到统一界面,无需切换三家供应商的工具。

项目成效

  • 采用单一供应商的互联网络物料清单,使 4,000 个 GPU 上线,并提供统一的保修服务窗口和升级处理渠道。
  • 各批次扩容不再受跨厂商互通验收制约;经过验证的线缆兼容性矩阵省去了每批次的光互连验证。
  • 通过 Apollo 获取的交换网络遥测数据,缩短了训练任务期间端口级故障的平均诊断时间。

下一个案例: 高校园区网络, 40 栋楼宇的无线与交换网络升级。