Кейс
Региональный облачный провайдер
Развёртывание сетевой фабрики кластера на 4000 GPU.
- Отрасль
- Облачная и ИИ-инфраструктура
- Регион
- Азиатско-Тихоокеанский регион
- Масштаб внедрения
- 4,000 развёрнуто gpu
- Использованное оборудование
- G6400, G4400-C, S6700-32CQещё 3
Задача
Провайдер масштабировал обучающий GPU-кластер до 4000 GPU в нескольких залах дата-центра, однако сетевая фабрика была собрана из решений трёх поставщиков: один — коммутация, второй — оптика, третий — поддержка интеграции.
Заявки на устранение проблем совместимости между версиями ПО архитектуры spine-leaf и сторонней кабельной продукцией отнимали недели интеграционной работы перед каждой волной расширения, а при инцидентах на фабрике, затрагивающих несколько поставщиков, не было единого канала ответственности.
Решение
Фабрика стандартизирована на семействе коммутаторов S6700 уровня spine под управлением SONiC с оптикой 400G MPO и внутристоечными кабельными сборками ACC 1.6T из той же квалифицированной линейки оптических модулей.
Ряды GPU-узлов G6400 с воздушным охлаждением дополнялись рядами узлов G4400-C с жидкостным охлаждением там, где плотность энергопотребления зала этого требовала, при сохранении одного поставщика для вычислений, фабрики и кабельной системы.
Развёрнута платформа Apollo Cloud AI для телеметрии фабрики в реальном времени: состояние кластера и диагностика на уровне портов доступны в едином интерфейсе вместо инструментов трёх разных поставщиков.
Результаты
- 4000 GPU введены в эксплуатацию на фабрике со спецификацией от одного поставщика, с единой службой гарантийной поддержки и единым каналом эскалации.
- Волны расширения больше не блокируются на этапе согласования межвендорной совместимости; квалифицированная кабельная матрица исключает валидацию оптики для каждой волны.
- Телеметрия фабрики через Apollo сократила среднее время диагностики инцидентов на уровне портов во время сеансов обучения.
Следующий кейс: Кампусная сеть университета, Модернизация беспроводной сети и коммутации в 40 корпусах.

