закрыть меню
Перейти в раздел
Перейти в раздел
закрыть меню
Перейти в раздел
Перейти в раздел
Отправить
спецификацию
на расчет
назад

Склад ЗИП: что обязано лежать в вашей серверной, а за что должен отвечать интегратор

Время прочтения: 8 минут

Спор о ЗИП сводится к одному вопросу: какие узлы должны лежать в двух шагах от стойки, а какие можно ждать по сервисному договору. Ответ не выводится из доли бюджета проекта, он выводится из того, что происходит с сервисом в момент отказа конкретного узла. Часть отказов сервер и дисковый массив переживают на ходу, потому что узел зарезервирован конструктивно, а часть выключает работу до приезда замены.

Ниже разбор по узлам сервера и СХД: что ломается, как отказ отражается на работе сервиса, какой узел имеет смысл держать на объекте и почему. Дальше идёт перечень данных, без которых состав ЗИП не считается, и ответы на вопросы, которые возникают при согласовании сервисного договора.

Признаки узла, который держат на объекте

Деталь попадает на полку в серверной, когда совпадают четыре условия. Одного условия мало: накопитель проходит по всем четырём, а контроллер массива не проходит ни по одному, хотя ломаются оба.

  • Отказ либо сразу бьёт по сервису, либо снимает резервирование. Пока сервер тянет нагрузку на одном блоке питания вместо двух, следующая неприятность по питанию гасит узел целиком.
  • Замена делается руками дежурного инженера. Модуль вынимается и ставится обратно без снятия сервера со стойки и без разборки: блок питания, вентилятор, накопитель, трансивер.
  • Деталь одинаковая на весь парк. Один модуль закрывает десяток шасси, поэтому запас получается небольшим, а покрытие широким. Если в стойках собраны четыре поколения серверов, номенклатура запаса разрастается и смысл теряется.
  • Узел не привязан к версии микрокода конкретной системы. Накопитель или вентилятор встанет в любое совместимое шасси, а контроллер массива перед вводом приводят к версии, на которой работает второй контроллер.

Всё, что не проходит по этим признакам, уезжает в зону ответственности подрядчика и описывается в договоре сроком реакции и сроком восстановления. Как эти сроки формулируются и чем срок реакции отличается от срока восстановления, разобрано в статье про сервисное обслуживание серверов и СХД по SLA.

Узлы сервера и СХД: отказ, последствие, решение по ЗИП

Таблица собрана для типовой стойки: серверы с резервированными блоками питания и вентиляторами, дисковые группы под RAID-контроллером, двухконтроллерный массив с полками расширения. Третья колонка отвечает на вопрос, держать ли деталь на объекте, а не на вопрос, где её взять.

УзелЧто происходит при отказеЗИП на объектеПочему так
Блок питания сервераВторой блок принимает всю нагрузку, сервер не перезагружается, запаса по питанию больше нетДаМеняется на ходу, одна модель закрывает все шасси с таким же блоком
Модуль вентиляторовСоседние модули поднимают обороты, при дальнейшем росте температуры процессор снижает частоты, затем сервер уходит в защитуДаЗамена занимает один визит, номенклатура на весь парк небольшая
Накопитель в дисковой группеRAID 5 переживает отказ одного накопителя, RAID 6 двух. Группа отдаёт данные, идёт перестроение, скорость падаетДаНакопители расходуют ресурс в работе, замена делается без остановки сервера
Суперконденсатор RAID-контроллераКонтроллер отключает кэш на запись и переходит в сквозную запись, запись в RAID 5 и RAID 6 резко замедляетсяДаРасходуемый элемент, деталь общая для всех контроллеров одной модели
RAID-контроллерДисковая группа недоступна, данные на накопителях сохраняются, конфигурацию читает новая платаДа, если контроллеры в парке одинаковыеЗамена возвращает сервер в работу без восстановления из резервной копии
Модуль памятиСервер либо не стартует, либо стартует с уменьшенным объёмом после отключения сбойного модуляДаПланки в парке совпадают по типу и объёму, замена в один визит
ПроцессорУзел не работает до заменыНетСнятие радиатора и термоинтерфейса, это работа не дежурного; сервис поднимают на соседнем узле
Материнская плата, шасси сервераУзел выключен целикомНетОтказ такого масштаба закрывают кластером или вторым сервером, а не полкой в серверной
Контроллер дискового массиваВторой контроллер подхватывает тома, кэш переходит в сквозную запись, скорость записи падаетНетУзел привязан к версии микрокода массива, меняется силами сервисной службы
Модуль ввода-вывода дисковой полкиОстаётся второй путь к полке, тома доступныНетРабота продолжается, замену закрывает сервисный договор
Оптический трансиверПадает один линк. При агрегации портов и двух путях к массиву сервис остаётся на ногахДаМелкая номенклатура, деградацию лазера видно заранее по счётчикам DOM
Кабель SAS, кабель DAC, патч-кордПропадает один путь либо один линкДаПовреждается при перекоммутации, замена мгновенная

Строки с ответом Нет не означают, что узел не нужен вовсе. Они означают, что запас по нему держит подрядчик, а заказчик получает в договоре срок восстановления и проверяет его на плановых учениях, а не в ночь аварии.

Почему запасное шасси стареет быстрее, чем ломается

Целый запасной узел оправдан там, где сервис живёт на одном сервере и не переносится на соседний. В остальных случаях капитал замораживается в шасси, которое лежит и теряет пригодность сразу по нескольким линиям.

  • Микрокод. Узел приезжает с версией, которая была актуальной в день поставки. Перед вводом его приводят к версии парка, и это отдельная работа, а не распаковка коробки.
  • Совместимость. За время хранения парк получает новые платы расширения и накопители, и лежащее шасси может не поддерживать часть из них.
  • Гарантия. Заводской срок идёт с момента поставки, а не с момента распаковки. Скрытый заводской брак вскроется в аварийную ночь, когда менять деталь по гарантии уже некогда.
  • Элементы питания кэша. Батареи и суперконденсаторы теряют ёмкость при хранении без нагрузки, поэтому запас по ним ревизуют вместе с плановыми работами по парку.

Отсюда рабочее правило: на объекте держат модули, а непрерывность сервиса обеспечивают схемой. Кластер, второй сервер, второй контроллер массива и второй путь к дискам закрывают отказ узла быстрее любой полки, потому что переключение происходит без участия человека и без поиска ключей от серверной.

Что передать подрядчику, чтобы состав ЗИП посчитался

Состав запаса считается по конкретной конфигурации, а не по общей доле от проекта. Подрядчику нужны данные, которые заказчик собирает сам или получает по итогам аудита ИТ-инфраструктуры.

  • Точный состав каждого шасси: модель сервера, количество и модель блоков питания, тип и объём модулей памяти, модели накопителей и контроллеров.
  • Схема резервирования каждого сервиса: где кластер, где одиночный сервер, какой уровень RAID собран, выделен ли накопитель горячей замены в группе.
  • Версии микрокода на серверах, контроллерах и массиве. По ним видно, встанет ли запасной узел в парк без предварительной подготовки.
  • Окно обслуживания и допустимый простой по каждому сервису. Система без окна и с круглосуточной нагрузкой требует другого запаса, чем тестовый контур.
  • Кто физически меняет деталь на объекте и в какие часы у него есть доступ в помещение. Полка с запасом не работает, если ключи от серверной лежат у одного человека.
  • Что уже лежит на полке и когда закуплено. Часть старого запаса теряет смысл вместе с выводом шасси, под которые он покупался.

Границы ответственности за замену стоит зафиксировать письменно: кто выезжает, что считается отказом, кто оплачивает диагностику и чем подтверждается факт восстановления. Разбор ролей в этой цепочке собран в статье про то, кто несёт ответственность за упавший ЦОД. Номенклатуру по расходуемым узлам удобно сверять по разборам блоков питания xFusion и модулей вентиляторов.

Частые вопросы

Сколько запасных блоков питания держать на объекте?

Запас считают по числу разных моделей блоков в парке, а не по числу серверов. Один модуль закрывает все шасси, где стоит такая же модель, поэтому при двух типах блоков в стойках на полке лежат оба типа. Отдельно проверяют мощность: серверы с ускорителями и плотными дисковыми корзинами укомплектованы более мощными блоками, и такой блок не заменяется младшим.

Нужен ли свой ЗИП, если уже есть сервисный договор?

Нужен по мелкой номенклатуре, которая меняется руками дежурного за один визит: вентиляторы, блоки питания, накопители, трансиверы, кабели. Смысл не в цене детали, а в том, что оформление заявки и выезд занимают больше времени, чем сама замена. Крупные узлы остаются за подрядчиком, потому что их всё равно нельзя поставить в работу без специалиста.

Что делать, если запасной узел пролежал год и не совпадает по прошивке?

Обновлять его до версии парка перед установкой, а не в момент аварии. Чтобы не заниматься этим ночью, лежащий запас проверяют на плановых работах: поднимают узел на стенде, обновляют микрокод, сверяют совместимость с текущей конфигурацией. Такую проверку записывают в журнал вместе с датой и версией.

Стоит ли держать в запасе целый сервер?

Это оправдано, когда сервис привязан к одной машине и не переносится на соседнюю: изолированный контур, машина с ключом лицензии, стенд с редкой платой расширения. Если приложение уже живёт в кластере, отказ узла закрывает сама схема, и запасная машина просто стареет на полке. Тогда полезнее вложиться во вторую ноду в кластере, чем в коробку про запас.

Как заранее увидеть, что узел начал деградировать?

По счётчикам, которые железо ведёт само. У накопителей это атрибуты SMART и счётчики ошибок в контроллере, у оптики цифровой мониторинг DOM с падением мощности лазера, у блоков питания и вентиляторов записи в журнале контроллера управления сервером. Эти счётчики выводят в систему мониторинга и настраивают оповещение по превышению порога, иначе журнал читают уже после остановки.


1 марта
Читайте также