Сетевое оборудование для ИИ

Сортировать:

Сетевая инфраструктура для ИИ-кластеров и лабораторий

Главный критерий выбора сетевого оборудования для ИИ — задержка и отсутствие потерь пакетов при обмене данными между ускорителями, а не только скорость отдельного порта. В распределённом обучении GPU постоянно синхронизируют градиенты, и самый медленный участок сети тормозит весь кластер.

В категорию входят четыре группы. Коммутаторы InfiniBand и Ethernet с поддержкой RoCE образуют фабрику между серверами. Сетевые адаптеры и DPU разгружают процессор, обрабатывая сетевой трафик и безопасность на себе. Оптические трансиверы, кабели DAC и AOC соединяют порты на разных расстояниях. Межкарточные шины вроде NVLink и коммутаторы для них связывают ускорители внутри узла.

Принято считать, что Ethernet всегда проще и дешевле InfiniBand, поэтому его берут по умолчанию. Для небольших стендов и инференса это верно. Но в обучении больших моделей обычный Ethernet без настройки lossless-режима теряет пакеты, и коллективные операции замедляются. InfiniBand даёт предсказуемую задержку, однако требует отдельной фабрики и профильных навыков администрирования. Поэтому для учебных лабораторий и инференса подходит Ethernet с RoCE, а для постоянного обучения крупных моделей выбирают InfiniBand или тщательно настроенный Ethernet-кластер.

Учебному классу с несколькими рабочими станциями достаточно управляемого коммутатора с быстрыми портами. Корпоративному ИИ-контуру нужна многоуровневая фабрика с запасом по портам для расширения.

Параметры выбора перед покупкой
  • Тип фабрики: InfiniBand или Ethernet с RoCE, с учётом квалификации команды.
  • Топология: количество уровней и соотношение портов к серверам и к магистрали, без «бутылочного горлышка».
  • Совместимость адаптеров, коммутаторов и трансиверов по скорости и типу разъёма.
  • Среда передачи: DAC для коротких линий внутри стойки, AOC и оптика для длинных соединений между рядами.
  • Охлаждение и направление воздушного потока, совпадающие с конструкцией стойки.
  • Поддержка драйверов и библиотек обмена данными между GPU в используемых фреймворках.
Во время посещения сайта вы соглашаетесь с тем, что мы обрабатываем ваши персональные данные с использованием метрических программ и даете согласие на использование файлов «cookie». Подробнее