Studium przypadku
Regionalny dostawca chmury
Wdrożenie sieci fabric klastra 4000 GPU.
- Branża
- Infrastruktura chmury i AI
- Region
- Azja-Pacyfik
- Skala wdrożenia
- 4,000 wdrożone gpu
- Wykorzystane produkty
- G6400, G4400-C, S6700-32CQ+3 więcej
Wyzwanie
Dostawca skalował klaster treningowy GPU do 4000 GPU w wielu salach data center, jednak jego sieć fabric była zbudowana z rozwiązań trzech dostawców: jednego dla przełącznictwa, jednego dla optyki i jednego dla wsparcia integracji.
Zgłoszenia problemów z interoperacyjnością między wersjami oprogramowania spine-leaf a okablowaniem stron trzecich pochłaniały tygodnie prac integracyjnych przed każdą falą rozbudowy, a gdy incydent w sieci fabric przekraczał granice między dostawcami, brakowało jednej ścieżki odpowiedzialności.
Rozwiązanie
Ustandaryzowano sieć fabric na rodzinie przełączników spine S6700 z systemem SONiC, z modułami optycznymi 400G MPO oraz wiązkami ACC 1.6T w szafach, pochodzącymi z tej samej kwalifikowanej linii optyki.
Rzędy GPU węzłów chłodzonych powietrzem G6400 uzupełniono rzędami węzłów chłodzonych cieczą G4400-C tam, gdzie gęstość mocy w sali tego wymagała, zachowując jednego dostawcę dla obliczeń, sieci fabric i okablowania.
Wdrożono Apollo Cloud AI do telemetryi sieci fabric w czasie rzeczywistym, dzięki czemu kondycja klastra i diagnostyka na poziomie portów znajdują się w jednym panelu zamiast w narzędziach trzech dostawców.
Wyniki
- 4000 GPU uruchomiono w oparciu o jednodostawczą listę materiałową (BOM) sieci fabric, z jednym biurem gwarancyjnym i jedną ścieżką eskalacji.
- Fale rozbudowy nie są już blokowane przez zatwierdzanie interoperacyjności między dostawcami; kwalifikowana macierz kablowa eliminuje walidację optyki przy każdej fali.
- Telemetria sieci fabric za pośrednictwem Apollo skróciła średni czas diagnozy incydentów na poziomie portów podczas przebiegów treningowych.
Następne studium przypadku: Sieć kampusowa uniwersytetu, Modernizacja sieci bezprzewodowej i przełączania w 40 budynkach.

