Когда минута стоит дорого: как устроена техподдержка критической ИТ-инфраструктуры
Жесткие SLA, «горячие» склады запчастей и экспертные команды: практики, которые не дают бизнесу остановиться
Остановка элемента критической ИТ-инфраструктуры (КИИ) может означать остановку бизнеса или процессов, важных для всего общества, например, когда речь идет о системах видеонаблюдения на дорогах. Поэтому обслуживание КИИ строится не по принципу «починим, когда получится», а на системе жестких стандартов: от SLA с фиксацией времени восстановления до проактивных проверок, аварийных сценариев и особых регламентов работы инженеров.
Директор департамента технического сервиса «Мобиус Технологии» Дмитрий Брумирский рассказывает, какие практики реально обеспечивают непрерывность работы и с какими сложностями сталкиваются сервисные команды.
Что делает инфраструктуру «критической» — и почему к ней нельзя применять обычные правила сервиса
Критическая ИТ-инфраструктура отличается от обычной не столько типом оборудования, сколько последствиями его отказа, ведь на этих системах работают бизнес-важные приложения, от которых зависит операционная деятельность.
Если в рядовой инфраструктуре время восстановления может измеряться днями, то для КИИ это часы, а время реакции — порой минуты. На практике используют жесткие SLA с фиксацией времени: 4, 8 или 24 часа на устранение инцидента. Причем 4 часа — это уже серьезный уровень обязательств, когда инженер должен быть готов выехать немедленно, а запчасти находятся в «горячем» резерве поблизости. Нужно отметить, что SLA фиксирует не только время, но и целевые показатели, например такие как восстановление сервиса, доступность кластера и другие. Все эти метрики становятся основой для тщательного планирования сценариев по устранению аварий.
При этом сама техника может быть той же самой: серверы, системы хранения данных, системы резервного копирования. Разница в подходе к обслуживанию, когда любая, даже незначительная поломка на КИИ трактуется как серьезная, автоматически получая высший приоритет (severity 1) и требуя особых регламентов реагирования.
Инженерия надежности: избыточность, бэкапы и «горячий» запас запчастей
Надежность критической инфраструктуры закладывается еще на этапе проектирования — и главный принцип здесь избыточность (redundancy). Речь идет о дублировании ключевых узлов: сетевых путей, блоков питания, контроллеров. В идеальной конфигурации выход из строя одного узла не должен приводить к остановке системы: кластеры серверов, дублированные компоненты и резервные маршруты позволят инфраструктуре продолжать работу.
Не менее важна и защита данных. Все элементы критической инфраструктуры должны иметь регулярные бэкапы, включая не только сами данные, но и конфигурационные файлы, настройки и дополнительные параметры. При этом ответственность за организацию бэкапов обычно лежит на стороне заказчика, а сервисная компания может дать рекомендации и помочь внедрить лучшие практики.
Еще один элемент надежности — «горячий» склад запчастей (ЗИП-склад), который находится в быстрой доступности и позволяет в течение нескольких часов доставить необходимые компоненты на площадку заказчика. При заключении контракта проводится обследование инфраструктуры и формируется список критичных компонентов: системные платы, контроллеры, блоки питания, модули памяти, диски.
Как выстраивают систему оперативного реагирования
Когда на КИИ возникает проблема, то запускается особый процесс. В сервисной системе открывается «критсит» — отдельный тикет с выделенным сервис-менеджером и экспертной командой. Перед началом любых действий эксперты коллегиально прорабатывают сценарии, чтобы минимизировать риски потери данных и остановки системы. Такой подход позволяет заранее просчитать последствия каждого шага и выбрать оптимальный план ремонта.
В зависимости от ситуации ремонт может проводиться удаленно или с выездом инженера на площадку. Если у заказчика есть опытная внутренняя IT-команда, сервисная компания часто работает удаленно — в связке с ней. Если же требуется физическое присутствие, инженер может выезжать сразу, иногда даже вместе с нужными деталями. Особенно это актуально при авариях, затрагивающих незадублированные узлы, где риск потери данных или остановки сервисов максимален.
Вставка: кейс из практики
Даже выход из строя одного из жестких дисков становится поводом для тикета со срочным приоритетом номер один. Но массовый отказ жестких дисков на СХД у крупного добывающего предприятия — это уже не рядовой инцидент, а предельно опасная ситуация. Причины аварии могут быть разные, например, изменение температуры или микрокодная ошибка.
Наш инженер экстренно выехал на площадку и параллельно взаимодействовал с удаленными экспертами. По логам специалисты восстановили хронологию отказов и затем в обратном порядке «реанимировали» диски. Необходимые компоненты заменили, а остальные восстановили с помощью специальных системных команд. В результате оборудование вернулось в строй, данные были сохранены.
Профилактика вместо аварий: зачем нужны «хелс-чеки» и мониторинг
Один из самых эффективных способов избежать крупных инцидентов — проактивная диагностика. Практика периодических «хелс-чеков», профилактических визитов инженеров позволяет выявлять скрытые ошибки и потенциальные проблемы до того, как они приведут к аварии. Во время таких визитов инженер снимает логи, проверяет состояние оборудования и обращает внимание на те неполадки, которые локальные администраторы могли не заметить. Оптимальная частота таких проверок — раз в квартал, при условии, что инфраструктура находится под постоянным мониторингом.
Система мониторинга — еще один обязательный элемент поддержки критической инфраструктуры. Она позволяет в режиме реального времени отслеживать состояние серверов и оперативно реагировать на отклонения. Как правило, за мониторингом следят либо внутренняя команда заказчика, либо совместно с сервисным провайдером, в том числе с привлечением IT-консалтинга.
Сложности на практике: регламенты, безопасность и работа в бункере
Обслуживание критической инфраструктуры — это не только продуманные планы реагирования, но и сложная координация с заказчиком. На объектах КИИ как правило действуют дополнительные регламенты. На практике сервисные инженеры сталкиваются с десятками ограничений, которые превращают типовой ремонт в многоходовую операцию.
Согласование любых изменений, обновлений микрокодов и даже перезагрузки оборудования происходит по цепочке. Как правило, все ремонтные работы проводятся в выделенные сервисные окна — ночью или в выходные дни, чтобы не влиять на операционную деятельность.
Особые требования предъявляют и службы информационной безопасности заказчиков. Инженерам часто нужно оформлять документы на внос и вынос оборудования и инструментов — вплоть до перечня отверток.
Встречаются заказчики, которые не разрешают выносить со своей территории накопители данных, такие как жесткие диски, флеш-модули. С ними подписывается дополнительный контракт на то, что элементы и модули памяти остаются после ремонта на стороне заказчика и подлежат потом дальнейшему уничтожению. Бывает, что ИБ-службы ограничивают выгрузку системных логов, что, конечно, тоже усложняет удаленную диагностику.
Иногда на некоторых объектах нет связи и интернета — такие площадки условно называют «бункерами». Инженеру приходится выходить на поверхность, чтобы связаться с командой и выгрузить логи для анализа, а затем возвращаться к оборудованию.
Все это требует от сервисной команды не только технических навыков, но и умения работать с регламентами, заранее готовить документы и терпеливо согласовывать каждый шаг.
Квалификация и внутренние процессы: как сервисная компания обеспечивает качество
Работа с КИИ требует высокой квалификации инженеров. Как правило, к таким задачам привлекают самых опытных специалистов, с вендорским опытом и подтвержденными сертификатами по работе с конкретным классом оборудования. Внутри сервисных компаний также проводятся регулярные воркшопы, где опытные инженеры делятся наработками с командой — это особенно важно в условиях ограниченного доступа к зарубежным курсам вендоров.
Важную роль играет и внутренняя инфраструктура самого сервис-провайдера, например, собственная лаборатория. Она позволяет тестировать запчасти перед отправкой заказчику — это особенно критично, учитывая то, какое неоднородное качество компонентов сейчас встречается на рынке.
Кроме того, в лабораториях у ведущих сервисных компаний как правило формируется свой парк машин, который используется для проверки совместимости и в отдельных случаях — для предоставления подменного оборудования.
Отраслевые различия: где инфраструктура надежнее
Уровень зрелости практик поддержки КИИ заметно различается по отраслям. Наиболее продвинутыми считаются телеком-операторы и банки: они, как правило, применяют лучшие стандарты проектирования, используют оборудование класса Midrange и High End, а процессы обслуживания у них выстроены максимально четко. В таких системах компоненты изначально задублированы: два контроллера, несколько блоков питания, резервные сетевые пути. Это снижает риски и упрощает обслуживание.



