
Сданный проект фиксирует состояние сети на один день: конфигурации совпадают с рабочей документацией, версии ПО на однотипных узлах одинаковы, схемы отражают факт. Дальше документы и факт расходятся, потому что сеть продолжают менять: подключают рабочие места, открывают доступы подрядчикам, переносят серверы. Обслуживание без найма штата это договор, по которому регулярные работы закреплены за внешней командой, а у заказчика остаётся постановка задач и приёмка результата.
Ниже разобрано, что происходит с корпоративной сетью на первом, шестом и двенадцатом месяце после сдачи и какие работы это требует, чем гарантия отличается от обслуживания, какие счётчики ловят деградацию до отказа и как обновлять ПО без тестового стенда.
Изменения накапливаются неравномерно. В первые недели парк совпадает с проектом, к середине года расходятся конфигурации и документация, к концу года истекают сроки, привязанные к дате запуска.
| Срок после сдачи | Что меняется в инфраструктуре | Какие работы это требует |
|---|---|---|
| Первый месяц | Парк работает на версиях ПО, зафиксированных при сдаче, конфигурации совпадают с рабочей документацией. Обращения касаются доступов и новых подключений. | Снять эталонный слепок конфигураций, завести узлы в мониторинг с порогами, убедиться, что резервные копии конфигураций забираются и разворачиваются, отработать переключение на резервный путь в согласованное окно. |
| Шестой месяц | Накопились правки вне проекта: новые VLAN, правила доступа под подрядчиков, переназначенные порты. Схемы и матрица доступов отстали от факта. Пошли первые отказы расходных узлов. Вышли релизы ПО с исправленными дефектами. | Сверка конфигураций с эталоном и разбор расхождений, ревизия правил доступа с удалением временных, актуализация схем и матрицы доступов, план обновления ПО с окнами и порядком узлов. |
| Двенадцатый месяц | Истекают сроки, привязанные к дате запуска: подписки на функции, контракт поддержки, сертификаты на интерфейсах управления. Версии ПО в парке разошлись. Свободных портов и запаса по питанию в стойке осталось меньше, чем закладывали. | Инвентаризация с фактическими версиями и серийными номерами, продление подписок и перевыпуск сертификатов, расчёт остатка по портам, питанию и охлаждению, пересмотр состава подменного фонда по отказам за год. |
Годовая отметка важна двумя вещами. Подписки и контракты поддержки считаются от даты активации, поэтому пропущенное продление вскрывается в момент, когда поддержка понадобилась. К этому же сроку набирается фактическая статистика отказов по конкретному парку, и состав подменного фонда пересчитывается по ней, а не по предположениям на сдаче. Как считается такой состав, разобрано в статье про склад ЗИП.
Гарантия обязывает заменить узел, признанный неисправным. Работы между отказом и заменой в неё не входят: подтвердить, что виноват именно этот узел, собрать выгрузки для обращения, принять и смонтировать подменный узел, залить на него конфигурацию и вернуть в схему.
Отдельная точка это версия ПО на подменном узле. Коммутатор приезжает с той версией, что была залита на нём при отгрузке, и в стек с остальными узлами он не встанет, пока версии не совпадут. Значит, к моменту замены нужен образ работающей в стеке версии и способ залить его на узел, у которого ещё нет сетевого доступа.
Доступ к новым версиям ПО у части производителей привязан не к гарантии на железо, а к отдельному контракту поддержки. Без него парк остаётся на версии, с которой его сдали, вместе с уже исправленными дефектами. Сроки реакции и восстановления живут не в гарантии, а в договоре на обслуживание: разбор этих условий в статье про обслуживание по SLA.
Расхождение начинается с правок, которые делают быстро и не записывают. Новый VLAN под переговорную, правило доступа для подрядчика на время работ, отключённый порт после переезда отдела. Через полгода никто не скажет, какие из них ещё нужны, а какие держат забытый открытый доступ.
Вторая часть расхождения чисто техническая. Команда применяется к текущей конфигурации и работает до перезагрузки, а в стартовую конфигурацию её сохраняют не всегда. Узел после планового отключения питания поднимается с последней сохранённой версией, и сеть ведёт себя иначе, чем накануне вечером.
Ловится это сверкой по расписанию: текущая конфигурация каждого узла сравнивается с эталонным слепком и с последней резервной копией, отличия сводятся в отчёт. По отчёту видно, где правка не сохранена и где работает правило, которого нет в документации. Саму резервную копию проверяют разворачиванием на подменный узел, иначе её пригодность остаётся предположением.
Проверка доступности отвечает на вопрос, жив ли узел, и не отвечает на вопрос, как он работает. Оптический линк деградирует постепенно: мощность принимаемого сигнала падает, растут ошибки CRC на интерфейсе, включается коррекция ошибок. Отклик по ICMP при этом сохраняется, а база данных на другом конце линка уже работает с повторными передачами.
Поэтому на обслуживании снимают счётчики, а не только доступность:
Правило отбора простое: срабатывание либо требует действия, либо его порог переносят. Система, которая шлёт сотни сообщений в сутки, перестаёт читаться целиком, и критическое сообщение теряется среди фоновых.
Без стенда обновление ядра сети откладывают, и парк остаётся на версии, с которой его сдали. Проверить совместимость можно и без копии топологии: читают примечания к релизу и список исправленных дефектов, сверяют версию с поддерживаемыми моделями трансиверов и плат, проверяют, что системы управления и мониторинга работают с этой веткой ПО.
Отдельно смотрят, меняется ли в релизе поведение по умолчанию: такие правки ломают конфигурацию тише всего, команда осталась прежней, а результат её применения стал другим.
Порядок работ снижает риск сильнее, чем наличие стенда. Сначала обновляется один узел уровня доступа с резервным путём, затем остальные узлы этого уровня, и только после них уровень агрегации и ядро. Предыдущий образ оставляют в памяти устройства, чтобы откат сводился к перезагрузке с выбором образа, а не к заливке по консоли в аварийном режиме.
Стек обновляется с перезагрузкой узлов, и порядок перезагрузки решает, будет перерыв или нет. Если оба линка сервера собраны в агрегированный канал через разные узлы стека, перезагрузка узлов по одному проходит без потери сервиса, а одновременная перезагрузка стека кладёт сегмент целиком. Принять чужую сеть на обслуживание без обследования нельзя: подрядчику нужны фактические версии и конфигурации, а не проектные. Что входит в такое обследование, разобрано в статье про аудит ИТ-инфраструктуры.
Регулярные работы и обработка обращений. К регулярным относятся сверка конфигураций, контроль счётчиков и оптических параметров модулей, план обновления ПО, ревизия правил доступа. По обращениям идут диагностика, восстановление сервиса и замена отказавшего узла.
Гарантия обязывает заменить узел, признанный неисправным, и не обязывает восстановить работу сети. В ней нет диагностики, выезда, настройки подменного узла и срока возврата сервиса. Договор на обслуживание задаёт именно эти работы и сроки, поэтому одно не заменяет другое.
Режим выбирают по времени, в течение которого простой недопустим, а не по графику офиса. Ночью идут регламентные задания, обмен с внешними системами и резервное копирование, и отказ обнаружится только утром. Если ночью критичного в сети нет, дневного покрытия хватает.
По документам, которые остаются после каждого периода: отчёт о расхождениях конфигураций с эталоном, история срабатываний мониторинга с отметкой, что по ним сделано, журнал изменений с датами и авторами. Если за квартал не появилось ни одного из них, наблюдения за сетью не было.
Действующие схемы L1, L2 и L3, выгрузки конфигураций всех узлов, перечень оборудования с серийными номерами и версиями ПО, доступы к управлению и список сервисов с приоритетом. Недостающее восстанавливают обследованием, и до этого момента срок восстановления подрядчик не подтвердит.