закрыть меню
Перейти в раздел
Перейти в раздел
закрыть меню
Перейти в раздел
Перейти в раздел
Отправить
спецификацию
на расчет
назад

Проект сдан, а что дальше? Как выстроить ИТ-обслуживание Enterprise-сетей без найма штата

Время прочтения: 7 минут

Сданный проект фиксирует состояние сети на один день: конфигурации совпадают с рабочей документацией, версии ПО на однотипных узлах одинаковы, схемы отражают факт. Дальше документы и факт расходятся, потому что сеть продолжают менять: подключают рабочие места, открывают доступы подрядчикам, переносят серверы. Обслуживание без найма штата это договор, по которому регулярные работы закреплены за внешней командой, а у заказчика остаётся постановка задач и приёмка результата.

Ниже разобрано, что происходит с корпоративной сетью на первом, шестом и двенадцатом месяце после сдачи и какие работы это требует, чем гарантия отличается от обслуживания, какие счётчики ловят деградацию до отказа и как обновлять ПО без тестового стенда.

Первый, шестой и двенадцатый месяц после сдачи

Изменения накапливаются неравномерно. В первые недели парк совпадает с проектом, к середине года расходятся конфигурации и документация, к концу года истекают сроки, привязанные к дате запуска.

Срок после сдачиЧто меняется в инфраструктуреКакие работы это требует
Первый месяцПарк работает на версиях ПО, зафиксированных при сдаче, конфигурации совпадают с рабочей документацией. Обращения касаются доступов и новых подключений.Снять эталонный слепок конфигураций, завести узлы в мониторинг с порогами, убедиться, что резервные копии конфигураций забираются и разворачиваются, отработать переключение на резервный путь в согласованное окно.
Шестой месяцНакопились правки вне проекта: новые VLAN, правила доступа под подрядчиков, переназначенные порты. Схемы и матрица доступов отстали от факта. Пошли первые отказы расходных узлов. Вышли релизы ПО с исправленными дефектами.Сверка конфигураций с эталоном и разбор расхождений, ревизия правил доступа с удалением временных, актуализация схем и матрицы доступов, план обновления ПО с окнами и порядком узлов.
Двенадцатый месяцИстекают сроки, привязанные к дате запуска: подписки на функции, контракт поддержки, сертификаты на интерфейсах управления. Версии ПО в парке разошлись. Свободных портов и запаса по питанию в стойке осталось меньше, чем закладывали.Инвентаризация с фактическими версиями и серийными номерами, продление подписок и перевыпуск сертификатов, расчёт остатка по портам, питанию и охлаждению, пересмотр состава подменного фонда по отказам за год.

Годовая отметка важна двумя вещами. Подписки и контракты поддержки считаются от даты активации, поэтому пропущенное продление вскрывается в момент, когда поддержка понадобилась. К этому же сроку набирается фактическая статистика отказов по конкретному парку, и состав подменного фонда пересчитывается по ней, а не по предположениям на сдаче. Как считается такой состав, разобрано в статье про склад ЗИП.

Гарантия производителя закрывает железо, а не работу сети

Гарантия обязывает заменить узел, признанный неисправным. Работы между отказом и заменой в неё не входят: подтвердить, что виноват именно этот узел, собрать выгрузки для обращения, принять и смонтировать подменный узел, залить на него конфигурацию и вернуть в схему.

Отдельная точка это версия ПО на подменном узле. Коммутатор приезжает с той версией, что была залита на нём при отгрузке, и в стек с остальными узлами он не встанет, пока версии не совпадут. Значит, к моменту замены нужен образ работающей в стеке версии и способ залить его на узел, у которого ещё нет сетевого доступа.

Доступ к новым версиям ПО у части производителей привязан не к гарантии на железо, а к отдельному контракту поддержки. Без него парк остаётся на версии, с которой его сдали, вместе с уже исправленными дефектами. Сроки реакции и восстановления живут не в гарантии, а в договоре на обслуживание: разбор этих условий в статье про обслуживание по SLA.

Конфигурации расходятся с проектом, и это ловится сверкой

Расхождение начинается с правок, которые делают быстро и не записывают. Новый VLAN под переговорную, правило доступа для подрядчика на время работ, отключённый порт после переезда отдела. Через полгода никто не скажет, какие из них ещё нужны, а какие держат забытый открытый доступ.

Вторая часть расхождения чисто техническая. Команда применяется к текущей конфигурации и работает до перезагрузки, а в стартовую конфигурацию её сохраняют не всегда. Узел после планового отключения питания поднимается с последней сохранённой версией, и сеть ведёт себя иначе, чем накануне вечером.

Ловится это сверкой по расписанию: текущая конфигурация каждого узла сравнивается с эталонным слепком и с последней резервной копией, отличия сводятся в отчёт. По отчёту видно, где правка не сохранена и где работает правило, которого нет в документации. Саму резервную копию проверяют разворачиванием на подменный узел, иначе её пригодность остаётся предположением.

Мониторинг ловит деградацию, а не только отказ

Проверка доступности отвечает на вопрос, жив ли узел, и не отвечает на вопрос, как он работает. Оптический линк деградирует постепенно: мощность принимаемого сигнала падает, растут ошибки CRC на интерфейсе, включается коррекция ошибок. Отклик по ICMP при этом сохраняется, а база данных на другом конце линка уже работает с повторными передачами.

Поэтому на обслуживании снимают счётчики, а не только доступность:

  • Ошибки на интерфейсе. Порог ставится на скорость роста счётчика за интервал, а не на ненулевое значение: единичные ошибки за год работы линка не значат ничего, десятки в час означают физическую проблему.
  • Оптические параметры модуля: мощность передачи и приёма, температура, ток смещения. Тренд по этим величинам показывает выработку модуля до того, как линк упадёт, и позволяет заменить его в окно, а не по аварии.
  • Смены состояния соседства протоколов маршрутизации. Одиночная переустановка сессии пользователю не видна, серия за сутки означает нестабильный канал или перегруженный процессор управления.
  • Загрузка процессора и памяти узла, счётчики отброшенных пакетов на очередях. По ним видно, что сеть подошла к границе по нагрузке.

Правило отбора простое: срабатывание либо требует действия, либо его порог переносят. Система, которая шлёт сотни сообщений в сутки, перестаёт читаться целиком, и критическое сообщение теряется среди фоновых.

Обновление ПО без собственного тестового стенда

Без стенда обновление ядра сети откладывают, и парк остаётся на версии, с которой его сдали. Проверить совместимость можно и без копии топологии: читают примечания к релизу и список исправленных дефектов, сверяют версию с поддерживаемыми моделями трансиверов и плат, проверяют, что системы управления и мониторинга работают с этой веткой ПО.

Отдельно смотрят, меняется ли в релизе поведение по умолчанию: такие правки ломают конфигурацию тише всего, команда осталась прежней, а результат её применения стал другим.

Порядок работ снижает риск сильнее, чем наличие стенда. Сначала обновляется один узел уровня доступа с резервным путём, затем остальные узлы этого уровня, и только после них уровень агрегации и ядро. Предыдущий образ оставляют в памяти устройства, чтобы откат сводился к перезагрузке с выбором образа, а не к заливке по консоли в аварийном режиме.

Стек обновляется с перезагрузкой узлов, и порядок перезагрузки решает, будет перерыв или нет. Если оба линка сервера собраны в агрегированный канал через разные узлы стека, перезагрузка узлов по одному проходит без потери сервиса, а одновременная перезагрузка стека кладёт сегмент целиком. Принять чужую сеть на обслуживание без обследования нельзя: подрядчику нужны фактические версии и конфигурации, а не проектные. Что входит в такое обследование, разобрано в статье про аудит ИТ-инфраструктуры.

Частые вопросы

Что входит в обслуживание сети, если своих инженеров нет?

Регулярные работы и обработка обращений. К регулярным относятся сверка конфигураций, контроль счётчиков и оптических параметров модулей, план обновления ПО, ревизия правил доступа. По обращениям идут диагностика, восстановление сервиса и замена отказавшего узла.

Чем гарантия производителя отличается от договора на обслуживание?

Гарантия обязывает заменить узел, признанный неисправным, и не обязывает восстановить работу сети. В ней нет диагностики, выезда, настройки подменного узла и срока возврата сервиса. Договор на обслуживание задаёт именно эти работы и сроки, поэтому одно не заменяет другое.

Нужен ли круглосуточный режим, если компания работает днём?

Режим выбирают по времени, в течение которого простой недопустим, а не по графику офиса. Ночью идут регламентные задания, обмен с внешними системами и резервное копирование, и отказ обнаружится только утром. Если ночью критичного в сети нет, дневного покрытия хватает.

Как проверить, что подрядчик действительно следит за сетью?

По документам, которые остаются после каждого периода: отчёт о расхождениях конфигураций с эталоном, история срабатываний мониторинга с отметкой, что по ним сделано, журнал изменений с датами и авторами. Если за квартал не появилось ни одного из них, наблюдения за сетью не было.

Что передать подрядчику, чтобы он принял сеть на обслуживание?

Действующие схемы L1, L2 и L3, выгрузки конфигураций всех узлов, перечень оборудования с серийными номерами и версиями ПО, доступы к управлению и список сервисов с приоритетом. Недостающее восстанавливают обследованием, и до этого момента срок восстановления подрядчик не подтвердит.


1 марта
Читайте также