
Спор о ЗИП сводится к одному вопросу: какие узлы должны лежать в двух шагах от стойки, а какие можно ждать по сервисному договору. Ответ не выводится из доли бюджета проекта, он выводится из того, что происходит с сервисом в момент отказа конкретного узла. Часть отказов сервер и дисковый массив переживают на ходу, потому что узел зарезервирован конструктивно, а часть выключает работу до приезда замены.
Ниже разбор по узлам сервера и СХД: что ломается, как отказ отражается на работе сервиса, какой узел имеет смысл держать на объекте и почему. Дальше идёт перечень данных, без которых состав ЗИП не считается, и ответы на вопросы, которые возникают при согласовании сервисного договора.
Деталь попадает на полку в серверной, когда совпадают четыре условия. Одного условия мало: накопитель проходит по всем четырём, а контроллер массива не проходит ни по одному, хотя ломаются оба.
Всё, что не проходит по этим признакам, уезжает в зону ответственности подрядчика и описывается в договоре сроком реакции и сроком восстановления. Как эти сроки формулируются и чем срок реакции отличается от срока восстановления, разобрано в статье про сервисное обслуживание серверов и СХД по SLA.
Таблица собрана для типовой стойки: серверы с резервированными блоками питания и вентиляторами, дисковые группы под RAID-контроллером, двухконтроллерный массив с полками расширения. Третья колонка отвечает на вопрос, держать ли деталь на объекте, а не на вопрос, где её взять.
| Узел | Что происходит при отказе | ЗИП на объекте | Почему так |
|---|---|---|---|
| Блок питания сервера | Второй блок принимает всю нагрузку, сервер не перезагружается, запаса по питанию больше нет | Да | Меняется на ходу, одна модель закрывает все шасси с таким же блоком |
| Модуль вентиляторов | Соседние модули поднимают обороты, при дальнейшем росте температуры процессор снижает частоты, затем сервер уходит в защиту | Да | Замена занимает один визит, номенклатура на весь парк небольшая |
| Накопитель в дисковой группе | RAID 5 переживает отказ одного накопителя, RAID 6 двух. Группа отдаёт данные, идёт перестроение, скорость падает | Да | Накопители расходуют ресурс в работе, замена делается без остановки сервера |
| Суперконденсатор RAID-контроллера | Контроллер отключает кэш на запись и переходит в сквозную запись, запись в RAID 5 и RAID 6 резко замедляется | Да | Расходуемый элемент, деталь общая для всех контроллеров одной модели |
| RAID-контроллер | Дисковая группа недоступна, данные на накопителях сохраняются, конфигурацию читает новая плата | Да, если контроллеры в парке одинаковые | Замена возвращает сервер в работу без восстановления из резервной копии |
| Модуль памяти | Сервер либо не стартует, либо стартует с уменьшенным объёмом после отключения сбойного модуля | Да | Планки в парке совпадают по типу и объёму, замена в один визит |
| Процессор | Узел не работает до замены | Нет | Снятие радиатора и термоинтерфейса, это работа не дежурного; сервис поднимают на соседнем узле |
| Материнская плата, шасси сервера | Узел выключен целиком | Нет | Отказ такого масштаба закрывают кластером или вторым сервером, а не полкой в серверной |
| Контроллер дискового массива | Второй контроллер подхватывает тома, кэш переходит в сквозную запись, скорость записи падает | Нет | Узел привязан к версии микрокода массива, меняется силами сервисной службы |
| Модуль ввода-вывода дисковой полки | Остаётся второй путь к полке, тома доступны | Нет | Работа продолжается, замену закрывает сервисный договор |
| Оптический трансивер | Падает один линк. При агрегации портов и двух путях к массиву сервис остаётся на ногах | Да | Мелкая номенклатура, деградацию лазера видно заранее по счётчикам DOM |
| Кабель SAS, кабель DAC, патч-корд | Пропадает один путь либо один линк | Да | Повреждается при перекоммутации, замена мгновенная |
Строки с ответом Нет не означают, что узел не нужен вовсе. Они означают, что запас по нему держит подрядчик, а заказчик получает в договоре срок восстановления и проверяет его на плановых учениях, а не в ночь аварии.
Целый запасной узел оправдан там, где сервис живёт на одном сервере и не переносится на соседний. В остальных случаях капитал замораживается в шасси, которое лежит и теряет пригодность сразу по нескольким линиям.
Отсюда рабочее правило: на объекте держат модули, а непрерывность сервиса обеспечивают схемой. Кластер, второй сервер, второй контроллер массива и второй путь к дискам закрывают отказ узла быстрее любой полки, потому что переключение происходит без участия человека и без поиска ключей от серверной.
Состав запаса считается по конкретной конфигурации, а не по общей доле от проекта. Подрядчику нужны данные, которые заказчик собирает сам или получает по итогам аудита ИТ-инфраструктуры.
Границы ответственности за замену стоит зафиксировать письменно: кто выезжает, что считается отказом, кто оплачивает диагностику и чем подтверждается факт восстановления. Разбор ролей в этой цепочке собран в статье про то, кто несёт ответственность за упавший ЦОД. Номенклатуру по расходуемым узлам удобно сверять по разборам блоков питания xFusion и модулей вентиляторов.
Запас считают по числу разных моделей блоков в парке, а не по числу серверов. Один модуль закрывает все шасси, где стоит такая же модель, поэтому при двух типах блоков в стойках на полке лежат оба типа. Отдельно проверяют мощность: серверы с ускорителями и плотными дисковыми корзинами укомплектованы более мощными блоками, и такой блок не заменяется младшим.
Нужен по мелкой номенклатуре, которая меняется руками дежурного за один визит: вентиляторы, блоки питания, накопители, трансиверы, кабели. Смысл не в цене детали, а в том, что оформление заявки и выезд занимают больше времени, чем сама замена. Крупные узлы остаются за подрядчиком, потому что их всё равно нельзя поставить в работу без специалиста.
Обновлять его до версии парка перед установкой, а не в момент аварии. Чтобы не заниматься этим ночью, лежащий запас проверяют на плановых работах: поднимают узел на стенде, обновляют микрокод, сверяют совместимость с текущей конфигурацией. Такую проверку записывают в журнал вместе с датой и версией.
Это оправдано, когда сервис привязан к одной машине и не переносится на соседнюю: изолированный контур, машина с ключом лицензии, стенд с редкой платой расширения. Если приложение уже живёт в кластере, отказ узла закрывает сама схема, и запасная машина просто стареет на полке. Тогда полезнее вложиться во вторую ноду в кластере, чем в коробку про запас.
По счётчикам, которые железо ведёт само. У накопителей это атрибуты SMART и счётчики ошибок в контроллере, у оптики цифровой мониторинг DOM с падением мощности лазера, у блоков питания и вентиляторов записи в журнале контроллера управления сервером. Эти счётчики выводят в систему мониторинга и настраивают оповещение по превышению порога, иначе журнал читают уже после остановки.