Сетевое оборудование для ИИ
Сетевая инфраструктура для ИИ-кластеров и лабораторий
Главный критерий выбора сетевого оборудования для ИИ — задержка и отсутствие потерь пакетов при обмене данными между ускорителями, а не только скорость отдельного порта. В распределённом обучении GPU постоянно синхронизируют градиенты, и самый медленный участок сети тормозит весь кластер.
В категорию входят четыре группы. Коммутаторы InfiniBand и Ethernet с поддержкой RoCE образуют фабрику между серверами. Сетевые адаптеры и DPU разгружают процессор, обрабатывая сетевой трафик и безопасность на себе. Оптические трансиверы, кабели DAC и AOC соединяют порты на разных расстояниях. Межкарточные шины вроде NVLink и коммутаторы для них связывают ускорители внутри узла.
Принято считать, что Ethernet всегда проще и дешевле InfiniBand, поэтому его берут по умолчанию. Для небольших стендов и инференса это верно. Но в обучении больших моделей обычный Ethernet без настройки lossless-режима теряет пакеты, и коллективные операции замедляются. InfiniBand даёт предсказуемую задержку, однако требует отдельной фабрики и профильных навыков администрирования. Поэтому для учебных лабораторий и инференса подходит Ethernet с RoCE, а для постоянного обучения крупных моделей выбирают InfiniBand или тщательно настроенный Ethernet-кластер.
Учебному классу с несколькими рабочими станциями достаточно управляемого коммутатора с быстрыми портами. Корпоративному ИИ-контуру нужна многоуровневая фабрика с запасом по портам для расширения.
Параметры выбора перед покупкой
- Тип фабрики: InfiniBand или Ethernet с RoCE, с учётом квалификации команды.
- Топология: количество уровней и соотношение портов к серверам и к магистрали, без «бутылочного горлышка».
- Совместимость адаптеров, коммутаторов и трансиверов по скорости и типу разъёма.
- Среда передачи: DAC для коротких линий внутри стойки, AOC и оптика для длинных соединений между рядами.
- Охлаждение и направление воздушного потока, совпадающие с конструкцией стойки.
- Поддержка драйверов и библиотек обмена данными между GPU в используемых фреймворках.