Studi Kasus
Penyedia Cloud Regional
Penerapan fabric klaster 4,000 GPU.
- Industri
- Infrastruktur Cloud & AI
- Wilayah
- Asia-Pasifik
- Skala implementasi
- 4,000 gpu yang diterapkan
- Produk yang digunakan
- G6400, G4400-C, S6700-32CQ+3 lainnya
Tantangan
Penyedia tersebut sedang menskalakan klaster pelatihan GPU hingga 4,000 GPU di beberapa ruang pusat data, namun fabric-nya dirangkai dari tiga vendor: satu untuk switching, satu untuk modul optik, dan satu untuk dukungan integrasi.
Tiket interoperabilitas antara versi perangkat lunak spine-leaf dan kabel pihak ketiga menghabiskan waktu integrasi berminggu-minggu sebelum setiap gelombang ekspansi, dan tidak ada jalur pertanggungjawaban yang tunggal ketika insiden fabric melintasi batas antar vendor.
Solusi
Menstandarkan fabric pada keluarga spine S6700 yang menjalankan SONiC, dengan modul optik MPO 400G dan harness ACC 1.6T dalam rak dari lini modul optik berkualifikasi yang sama.
Memadankan baris GPU node G6400 berpendingin udara dengan baris node G4400-C berpendingin cair di ruangan dengan kepadatan daya yang menuntutnya, sehingga tetap menggunakan satu vendor untuk komputasi, fabric, dan kabel.
Menerapkan Apollo Cloud AI untuk telemetri fabric secara real-time, sehingga kesehatan klaster dan diagnosis tingkat port berada dalam satu dasbor, bukan tersebar di alat tiga vendor.
Hasil
- 4,000 GPU berhasil diaktifkan dengan bill of materials fabric dari vendor tunggal, hanya dengan satu meja garansi dan satu jalur eskalasi.
- Gelombang ekspansi tidak lagi terhambat oleh persetujuan interoperabilitas antar vendor; matriks kabel yang telah berkualifikasi menghilangkan validasi modul optik di setiap gelombang.
- Telemetri fabric melalui Apollo memperpendek waktu rata-rata diagnosis untuk insiden tingkat port selama sesi pelatihan berlangsung.
Studi kasus berikutnya: Jaringan Kampus Universitas, Pembaruan wireless + switching untuk 40 gedung.

