Caso studio
Cloud provider regionale
Implementazione della fabric per un cluster da 4,000 GPU.
- Settore
- Infrastruttura cloud e AI
- Regione
- Asia-Pacifico
- Portata del deployment
- 4,000 gpu implementate
- Prodotti utilizzati
- G6400, G4400-C, S6700-32CQ+ altri 3
Sfida
Il provider stava scalando un cluster di addestramento GPU fino a 4,000 GPU distribuite su più sale datacenter, ma la sua fabric era assemblata con tre fornitori: uno per lo switching, uno per le ottiche, uno per il supporto all'integrazione.
I ticket di interoperabilità tra le versioni software spine-leaf e il cablaggio di terze parti consumavano settimane di integrazione prima di ogni ondata di espansione, e non esisteva un unico referente responsabile quando un incidente sulla fabric coinvolgeva più fornitori.
Soluzione
Standardizzazione della fabric sulla famiglia spine S6700 con SONiC, con ottiche MPO 400G e cablaggi ACC in-rack 1.6T provenienti dalla stessa linea di ottiche qualificate.
File GPU di nodi G6400 raffreddati ad aria affiancate a file G4400-C raffreddati a liquido dove la densità di potenza della sala lo richiedeva, mantenendo un unico fornitore per calcolo, fabric e cablaggio.
Implementazione di Apollo Cloud AI per la telemetria della fabric in tempo reale, così che lo stato del cluster e la diagnosi a livello di porta risiedano in un'unica console invece che negli strumenti di tre fornitori.
Risultati
- 4,000 GPU messe in servizio con una distinta base della fabric a fornitore unico, un unico riferimento per la garanzia e un unico percorso di escalation.
- Le ondate di espansione non si bloccano più in attesa dell'approvazione dell'interoperabilità tra fornitori; la matrice di cavi qualificati elimina la validazione delle ottiche a ogni ondata.
- La telemetria della fabric tramite Apollo ha ridotto il tempo medio di diagnosi degli incidenti a livello di porta durante le sessioni di addestramento.
Caso studio successivo: Rete campus universitaria, Rinnovo wireless + switching per 40 edifici.

