Когда минута стоит дорого: как устроена техподдержка критической ИТ-инфраструктуры

Жесткие SLA, «горячие» склады запчастей и экспертные команды: практики, которые не дают бизнесу остановиться

Остановка элемента критической ИТ-инфраструктуры (КИИ) может означать остановку бизнеса или процессов, важных для всего общества, например, когда речь идет о системах видеонаблюдения на дорогах. Поэтому обслуживание КИИ строится не по принципу «починим, когда получится», а на системе жестких стандартов: от SLA с фиксацией времени восстановления до проактивных проверок, аварийных сценариев и особых регламентов работы инженеров.

Директор департамента технического сервиса «Мобиус Технологии» Дмитрий Брумирский рассказывает, какие практики реально обеспечивают непрерывность работы и с какими сложностями сталкиваются сервисные команды.

Что делает инфраструктуру «критической» — и почему к ней нельзя применять обычные правила сервиса

Критическая ИТ-инфраструктура отличается от обычной не столько типом оборудования, сколько последствиями его отказа, ведь на этих системах работают бизнес-важные приложения, от которых зависит операционная деятельность.

Если в рядовой инфраструктуре время восстановления может измеряться днями, то для КИИ это часы, а время реакции — порой минуты. На практике используют жесткие SLA с фиксацией времени: 4, 8 или 24 часа на устранение инцидента. Причем 4 часа — это уже серьезный уровень обязательств, когда инженер должен быть готов выехать немедленно, а запчасти находятся в «горячем» резерве поблизости. Нужно отметить, что SLA фиксирует не только время, но и целевые показатели, например такие как восстановление сервиса, доступность кластера и другие. Все эти метрики становятся основой для тщательного планирования сценариев по устранению аварий.

При этом сама техника может быть той же самой: серверы, системы хранения данных, системы резервного копирования. Разница в подходе к обслуживанию, когда любая, даже незначительная поломка на КИИ трактуется как серьезная, автоматически получая высший приоритет (severity 1) и требуя особых регламентов реагирования.

Инженерия надежности: избыточность, бэкапы и «горячий» запас запчастей

Надежность критической инфраструктуры закладывается еще на этапе проектирования — и главный принцип здесь избыточность (redundancy). Речь идет о дублировании ключевых узлов: сетевых путей, блоков питания, контроллеров. В идеальной конфигурации выход из строя одного узла не должен приводить к остановке системы: кластеры серверов, дублированные компоненты и резервные маршруты позволят инфраструктуре продолжать работу.

Не менее важна и защита данных. Все элементы критической инфраструктуры должны иметь регулярные бэкапы, включая не только сами данные, но и конфигурационные файлы, настройки и дополнительные параметры. При этом ответственность за организацию бэкапов обычно лежит на стороне заказчика, а сервисная компания может дать рекомендации и помочь внедрить лучшие практики.

Еще один элемент надежности — «горячий» склад запчастей (ЗИП-склад), который находится в быстрой доступности и позволяет в течение нескольких часов доставить необходимые компоненты на площадку заказчика. При заключении контракта проводится обследование инфраструктуры и формируется список критичных компонентов: системные платы, контроллеры, блоки питания, модули памяти, диски.

Как выстраивают систему оперативного реагирования

Когда на КИИ возникает проблема, то запускается особый процесс. В сервисной системе открывается «критсит» — отдельный тикет с выделенным сервис-менеджером и экспертной командой. Перед началом любых действий эксперты коллегиально прорабатывают сценарии, чтобы минимизировать риски потери данных и остановки системы. Такой подход позволяет заранее просчитать последствия каждого шага и выбрать оптимальный план ремонта.

В зависимости от ситуации ремонт может проводиться удаленно или с выездом инженера на площадку. Если у заказчика есть опытная внутренняя IT-команда, сервисная компания часто работает удаленно — в связке с ней. Если же требуется физическое присутствие, инженер может выезжать сразу, иногда даже вместе с нужными деталями. Особенно это актуально при авариях, затрагивающих незадублированные узлы, где риск потери данных или остановки сервисов максимален.

Вставка: кейс из практики

Даже выход из строя одного из жестких дисков становится поводом для тикета со срочным приоритетом номер один. Но массовый отказ жестких дисков на СХД у крупного добывающего предприятия — это уже не рядовой инцидент, а предельно опасная ситуация. Причины аварии могут быть разные, например, изменение температуры или микрокодная ошибка.

Наш инженер экстренно выехал на площадку и параллельно взаимодействовал с удаленными экспертами. По логам специалисты восстановили хронологию отказов и затем в обратном порядке «реанимировали» диски. Необходимые компоненты заменили, а остальные восстановили с помощью специальных системных команд. В результате оборудование вернулось в строй, данные были сохранены.

Профилактика вместо аварий: зачем нужны «хелс-чеки» и мониторинг

Один из самых эффективных способов избежать крупных инцидентов — проактивная диагностика. Практика периодических «хелс-чеков», профилактических визитов инженеров позволяет выявлять скрытые ошибки и потенциальные проблемы до того, как они приведут к аварии. Во время таких визитов инженер снимает логи, проверяет состояние оборудования и обращает внимание на те неполадки, которые локальные администраторы могли не заметить. Оптимальная частота таких проверок — раз в квартал, при условии, что инфраструктура находится под постоянным мониторингом.

Система мониторинга — еще один обязательный элемент поддержки критической инфраструктуры. Она позволяет в режиме реального времени отслеживать состояние серверов и оперативно реагировать на отклонения. Как правило, за мониторингом следят либо внутренняя команда заказчика, либо совместно с сервисным провайдером, в том числе с привлечением IT-консалтинга.

Сложности на практике: регламенты, безопасность и работа в бункере

Обслуживание критической инфраструктуры — это не только продуманные планы реагирования, но и сложная координация с заказчиком. На объектах КИИ как правило действуют дополнительные регламенты. На практике сервисные инженеры сталкиваются с десятками ограничений, которые превращают типовой ремонт в многоходовую операцию.

Согласование любых изменений, обновлений микрокодов и даже перезагрузки оборудования происходит по цепочке. Как правило, все ремонтные работы проводятся в выделенные сервисные окна — ночью или в выходные дни, чтобы не влиять на операционную деятельность.

Особые требования предъявляют и службы информационной безопасности заказчиков. Инженерам часто нужно оформлять документы на внос и вынос оборудования и инструментов — вплоть до перечня отверток.

Встречаются заказчики, которые не разрешают выносить со своей территории накопители данных, такие как жесткие диски, флеш-модули. С ними подписывается дополнительный контракт на то, что элементы и модули памяти остаются после ремонта на стороне заказчика и подлежат потом дальнейшему уничтожению. Бывает, что ИБ-службы ограничивают выгрузку системных логов, что, конечно, тоже усложняет удаленную диагностику.

Иногда на некоторых объектах нет связи и интернета — такие площадки условно называют «бункерами». Инженеру приходится выходить на поверхность, чтобы связаться с командой и выгрузить логи для анализа, а затем возвращаться к оборудованию.

Все это требует от сервисной команды не только технических навыков, но и умения работать с регламентами, заранее готовить документы и терпеливо согласовывать каждый шаг.

Квалификация и внутренние процессы: как сервисная компания обеспечивает качество

Работа с КИИ требует высокой квалификации инженеров. Как правило, к таким задачам привлекают самых опытных специалистов, с вендорским опытом и подтвержденными сертификатами по работе с конкретным классом оборудования. Внутри сервисных компаний также проводятся регулярные воркшопы, где опытные инженеры делятся наработками с командой — это особенно важно в условиях ограниченного доступа к зарубежным курсам вендоров.

Важную роль играет и внутренняя инфраструктура самого сервис-провайдера, например, собственная лаборатория. Она позволяет тестировать запчасти перед отправкой заказчику — это особенно критично, учитывая то, какое неоднородное качество компонентов сейчас встречается на рынке.

Кроме того, в лабораториях у ведущих сервисных компаний как правило формируется свой парк машин, который используется для проверки совместимости и в отдельных случаях — для предоставления подменного оборудования.

Отраслевые различия: где инфраструктура надежнее

Уровень зрелости практик поддержки КИИ заметно различается по отраслям. Наиболее продвинутыми считаются телеком-операторы и банки: они, как правило, применяют лучшие стандарты проектирования, используют оборудование класса Midrange и High End, а процессы обслуживания у них выстроены максимально четко. В таких системах компоненты изначально задублированы: два контроллера, несколько блоков питания, резервные сетевые пути. Это снижает риски и упрощает обслуживание.

Мобиус Технологии
Автор: Мобиус Технологии
Компания «Мобиус Технологии» основана в 2013 году. Всего за два года она вошла в число премиальных партнеров компании IBM по сервису и смогла составить конкуренцию ведущим компаниям в сегменте технической поддержки ИТ-инфраструктуры. В 2015 году получила статус золотого партнера IBM и заключила ряд важных партнерских соглашений, в том числе с известными международными вендорами – HPE, Oracle, Lenovo, NetApp, DELL, EMC, Microsoft и др.
Комментарии: