본문 바로가기

고객 사례

지역 클라우드 사업자

4,000 GPU 클러스터 패브릭 구축.

산업 분야
클라우드 및 AI 인프라
지역
아시아 태평양
구축 규모
4,000 배치된 gpu
사용 제품
G6400, G4400-C, S6700-32CQ+3개 더보기
구축 개요 및 구성도

과제

해당 사업자는 여러 데이터센터 홀에 걸쳐 GPU 학습 클러스터를 4,000 GPU 규모로 확장하고 있었지만, 패브릭은 스위칭, 광모듈, 통합 지원을 각각 담당하는 3개 벤더의 제품으로 구성되어 있었습니다.

스파인-리프 소프트웨어 버전과 서드파티 케이블링 간 상호 운용성 티켓 처리가 확장 단계마다 통합에 수 주를 소요하게 만들었고, 패브릭 장애가 벤더 경계를 넘을 경우 단일한 책임 경로도 없었습니다.

솔루션

SONiC를 구동하는 S6700 스파인 제품군으로 패브릭을 표준화하고, 동일한 검증된 광모듈 라인에서 400G MPO 광모듈과 1.6T ACC 랙 내 케이블 하네스를 조달했습니다.

홀의 전력 밀도가 요구하는 구역에는 G4400-C 수랭식 로우를 배치하여 G6400 공랭식 노드의 GPU 로우와 함께 구성했으며, 컴퓨트, 패브릭, 케이블링 전반을 단일 벤더로 유지했습니다.

Apollo Cloud AI를 배포하여 실시간 패브릭 텔레메트리를 확보했으며, 클러스터 상태와 포트 단위 진단을 3개 벤더의 도구 대신 단일 콘솔에서 처리할 수 있게 되었습니다.

결과

  • 단일 벤더의 패브릭 BOM으로 4,000 GPU를 온라인화했으며, 단일 보증 창구와 단일 에스컬레이션 경로를 확보했습니다.
  • 확장 단계가 벤더 간 상호 운용성 승인에 더 이상 지연되지 않으며, 검증된 케이블 매트릭스로 단계별 광모듈 검증이 필요 없어졌습니다.
  • Apollo를 통한 패브릭 텔레메트리로 학습 실행 중 포트 단위 장애의 평균 진단 시간(MTTD)이 단축되었습니다.

다음 고객 사례: 대학 캠퍼스 네트워크, 40개 동 무선 + 스위칭 환경 전면 교체.