
Сеть ЦОД с программным управлением собирается из тех же коммутаторов, что и сеть, настроенная руками. Разница в том, где лежит эталон конфигурации и как изменение доезжает до железа. Физический уровень остаётся маршрутизируемой матрицей, поверх него работает оверлей на VXLAN, а адреса разносит протокол MP-BGP EVPN. Контроллер (у Huawei это iMaster NCE-Fabric) описывает сервис один раз и раскатывает конфигурацию на все устройства сразу.
Ниже разобрано, из каких уровней состоит такая сеть, что настраивается на каждом и что меняет программное управление. Процентов экономии в тексте нет: эффект от автоматизации зависит от числа устройств и частоты изменений и без данных площадки не считается.
| Уровень | Что делает | Чем задаётся | Что меняет программное управление |
|---|---|---|---|
| Физическая матрица (underlay) | Доставляет пакет между коммутаторами по кратчайшему пути | IP-адресация стыков, протокол маршрутизации (OSPF или BGP), балансировка ECMP | Адреса стыков и номера AS назначаются из пула по шаблону, а не подбираются вручную |
| Транспорт оверлея (VXLAN) | Переносит кадры канального уровня между стойками поверх маршрутизируемой сети | Номера VNI, адреса точек инкапсуляции, MTU линков | Соответствие сегмента и номера VNI ведётся централизованно, пересечений не возникает |
| Плоскость управления (MP-BGP EVPN) | Разносит MAC- и IP-адреса между коммутаторами | Сессии BGP, номера AS, признаки принадлежности маршрутов | Сессии и признаки генерируются по типовой схеме на всю фабрику |
| Сервисы и политики | Сегменты, шлюзы, изоляция между группами серверов | Экземпляры маршрутизации, интерфейсы шлюзов, списки доступа | Сервис описывается один раз и раскатывается на нужную группу устройств |
| Наблюдаемость | Показывает состояние портов, очередей и потерь | Опрос по SNMP, журналы устройств, счётчики интерфейсов | Потоковая телеметрия по подписке вместо опроса с интервалом |
Уровни разделены намеренно. Физическая матрица не знает про виртуальные машины и подсети: она маршрутизирует пакеты между адресами коммутаторов, и её конфигурация после сдачи меняется редко. Оверлею физическая топология тоже не нужна, ему достаточно достижимости соседней точки инкапсуляции. Новый сегмент маршрутизацию не трогает.
Программное управление добавляется сверху и не отменяет ни одного уровня. Оно не выбирает топологию, не считает полосу вверх и не решает, сколько портов нужно в стойке. Контроллер повторяет решение проектировщика на всех устройствах сразу, включая ошибочное.
Классическая схема доступ, агрегация, ядро строилась под обмен с клиентом за пределами ЦОД. Трафик между серверами в ней поднимается на уровень агрегации и спускается обратно, а число переходов зависит от того, в какие коммутаторы включены собеседники. В матрице каждый коммутатор доступа подключён ко всем коммутаторам верхнего уровня: путь между двумя стойками занимает два перехода, и задержка не зависит от места сервера в зале. В документации Huawei эта схема называется Leaf-Spine.
Второе отличие в резервных линках. STP оставляет активной одну ветку дерева и блокирует остальные, а перестроение занимает время, в течение которого часть сети недоступна. В маршрутизируемом underlay петель на канальном уровне нет: ECMP раскладывает потоки по всем равнозначным путям, а новый коммутатор наверху добавляет путь для всех стоек.
Полосу вверх считают до выбора моделей, иначе фабрика упрётся в аплинки на приёмке:
Разбор серий и индексов конкретных моделей собран в статье про коммутаторы Huawei: уровень устройства читается по аплинкам, а число и тип портов доступа зашиты в название.
Номер VLAN занимает 12 бит, из 4 096 значений рабочими остаются 4 094. Для одного зала этого достаточно, для среды с изолированным сегментом под каждого потребителя уже нет. Идентификатор VNI в VXLAN занимает 24 бита, то есть 16 777 216 значений, и вопрос нумерации снимается.
Плата за инкапсуляцию считается точно. Кадр из оверлея упаковывается во внешний Ethernet (14 байт), внешний IP (20 байт), UDP (8 байт) и заголовок VXLAN (8 байт), итого 50 байт сверх исходного кадра. MTU на линках underlay поднимают минимум на 50 байт над MTU виртуальной машины, на практике ставят 9 000. Один пропущенный линк с MTU 1500 даёт выборочный отказ: пинги ходят, а передача крупных блоков встаёт.
MP-BGP EVPN отвечает за то, откуда коммутатор узнаёт, за каким соседом находится нужный MAC-адрес. Без него сеть выясняет это затоплением: кадр с неизвестным адресом рассылается во все порты. EVPN разносит MAC- и IP-адреса маршрутами BGP, поэтому адрес известен до первого пакета, а ARP-запрос гасится на коммутаторе доступа. Шлюз подсети при этом одинаков на всех коммутаторах доступа, и машина при переезде в другую стойку сохраняет и адрес, и шлюз.
Контроллер принимает описание сервиса (какие сегменты нужны, между чем разрешён трафик, где стоит шлюз) и превращает его в конфигурацию. Доставка идёт по NETCONF на моделях данных YANG, а не командами в консоли. Отсюда четыре следствия:
Наблюдаемость меняется отдельно от конфигурации. Опрос по SNMP даёт срез с периодом опроса, и всплеск заполнения буфера между двумя опросами в него не попадает. Потоковая телеметрия работает по подписке: коммутатор сам отдаёт счётчики очередей и отбрасываний, поэтому короткие всплески видны в отчёте, а не в жалобах на потери.
За инженером остаётся всё, что из описания сервиса не выводится: топология, схема адресации underlay, расчёт полосы вверх, выбор моделей под скорость серверных портов, порядок стыка с работающей сетью. Результат оформляется документами HLD и LLD, и контроллер их не заменяет.
Эти вопросы проектировщик задаст в любом случае, и от полноты ответов зависит число переделок схемы.
Отдельно стоит связь между площадками. Растянуть сегмент канального уровня между двумя ЦОД VXLAN позволяет, но задержку и полосу стыка задаёт транспорт: по этой части есть разбор оптических транспортных сетей DWDM и DCI. Канал считают до того, как на растянутый домен посадят кластер.
Набором протоколов и местом, где хранится эталон конфигурации. Физически это те же устройства, но underlay настроен как маршрутизируемая сеть без STP, сервисы вынесены в оверлей на VXLAN, а адреса разносит MP-BGP EVPN. Конфигурация собирается контроллером и раскатывается сразу на группу коммутаторов.
Да, VXLAN и EVPN работают на самих коммутаторах и контроллера не требуют. Без него каждое устройство настраивается отдельно, а роль эталона выполняют шаблоны и ваш инструмент автоматизации. Разница проявляется на масштабе: чем чаще меняется состав сервисов, тем дороже ручная раскатка.
Нет. Новый сегмент строится рядом с работающей сетью и стыкуется с ней через пограничные коммутаторы, где оверлей заканчивается и трафик уходит в существующую маршрутизацию. Порядок переноса сервисов и момент отключения старого сегмента определяют на этапе проектирования.
Минимум на 50 байт больше максимального кадра внутри оверлея: столько добавляют внешние заголовки Ethernet, IP, UDP и VXLAN. На практике на всех линках underlay ставят 9 000 байт, включая стыки между коммутаторами и порты в сторону пограничных устройств. Если один линк остался с MTU 1500, мелкие пакеты пройдут, а крупные передачи встанут.
RoCEv2 переносит операции RDMA поверх Ethernet, его берут под трафик хранения (NVMe over Fabric) и под обмен между ускорителями. Такой трафик проседает на повторных передачах, поэтому сеть настраивают на отсутствие потерь через PFC и ECN, а к буферам коммутаторов добавляются требования. Под обычные приложения эти настройки не нужны.