При обсуждении мониторинга серверной чаще всего говорят о температуре, загрузке оборудования или доступности сервисов. Всё это действительно важно, но такие параметры уже отражают последствия происходящего. Источник проблемы нередко находится в инженерной инфраструктуре, обеспечивающей работу серверов.
Типичный сценарий начинается с пропадания внешнего электропитания, неисправности ИБП, отключения кондиционера или срабатывания защитной автоматики. Пока серверы продолжают работать в штатном режиме, развитие аварии может оставаться незаметным. Лишь спустя некоторое время появляются первые признаки перегрева, а затем начинают возникать проблемы с оборудованием.
Чем раньше система мониторинга обнаружит изменение состояния инженерной инфраструктуры, тем больше времени останется на предотвращение аварии.
Как развивается авария
Представим небольшую серверную, где всё оборудование подключено через ИБП.
Внешнее электропитание исчезает, и ИБП переводит нагрузку на аккумуляторы. Пользователи продолжают работать как обычно, поэтому может показаться, что ничего серьёзного не произошло.
Однако кондиционер, не подключённый к резервному питанию, останавливается. В помещении постепенно начинает накапливаться тепло. Через несколько минут температура выходит за пределы нормы, а ещё позже система мониторинга сообщает о перегреве оборудования.
К этому моменту причина уже давно возникла. Температурный датчик фиксирует уже последствия произошедшей аварии.
Рис. 1. Типичная последовательность развития аварии в серверной.
Почему важно контролировать инженерную инфраструктуру первой
В большинстве случаев первым о проблеме сообщает не сервер и не температурный датчик, а инженерная инфраструктура.
Именно поэтому мониторинг должен начинаться с контроля электропитания. Исчезновение напряжения на основном вводе, отключение автоматического выключателя или переход на резервный источник позволяют практически сразу понять, что серверная работает уже не в штатном режиме.
Для инженера это значительно полезнее, чем получить уведомление о перегреве через несколько минут. Пока температура ещё не изменилась, есть возможность проверить состояние ИБП, восстановить питание или убедиться, что охлаждение продолжает работать.
Контроль электропитания позволяет обнаружить начало аварии раньше, чем её последствия станут заметны для серверов.
Что показывает ИБП
После исчезновения внешнего питания именно ИБП становится главным источником информации о состоянии объекта.
Переход на аккумуляторы сам по себе не означает критическую ситуацию. Это штатный режим работы. Гораздо важнее понимать, сколько времени оборудование сможет продолжать работу, нет ли перегрузки и исправны ли аккумуляторные батареи.
Эти данные позволяют оценить запас времени на восстановление электропитания и понять, насколько срочно необходимо вмешательство.
Для инженера ИБП — это прежде всего индикатор оставшегося времени, а не просто резервный источник питания.
Почему важно контролировать сам кондиционер
Температура редко начинает расти сразу после отказа охлаждения. Некоторое время помещение сохраняет накопленный запас холода, поэтому температурные датчики продолжают показывать нормальные значения.
Именно этот период особенно ценен для эксплуатации. Если система мониторинга уже знает, что кондиционер отключился, перешёл в аварийный режим или работает неэффективно, персонал получает возможность отреагировать до появления перегрева.
Поэтому при эксплуатации серверной зачастую важнее своевременно обнаружить отказ системы охлаждения, чем ждать изменения температуры.
Рост температуры является следствием отказа охлаждения, а не его причиной.
Почему одного температурного датчика недостаточно
Температурный датчик показывает только конечный результат. По нему невозможно определить, почему температура начала расти.
Причиной может быть отключение кондиционера, ухудшение эффективности его работы, исчезновение питания, неисправность ИБП, нарушение циркуляции воздуха или даже перегрузка отдельной стойки. Если мониторинг получает информацию только от температурных датчиков, инженеру приходится искать источник проблемы уже после появления тревоги.
Гораздо эффективнее анализировать связанные события. Когда система фиксирует отключение питания, переход ИБП на батареи и остановку кондиционера, рост температуры становится ожидаемым развитием ситуации, а не неожиданной аварией.
Рис. 2. Мониторинг инженерной инфраструктуры серверной.
Практический сценарий
Подобная последовательность характерна не только для серверных, но и для телекоммуникационных шкафов, небольших ЦОД и других объектов, где ИТ-оборудование зависит от локальной инженерной инфраструктуры.
Предположим, что в серверной пропадает внешнее питание.
Через несколько секунд ИБП принимает нагрузку на себя, поэтому работа сервисов не нарушается. Одновременно останавливается кондиционер, поскольку он подключён только к основному вводу. Температура ещё остаётся нормальной, и никаких предупреждений по ней пока нет.
Если система мониторинга контролирует только климат, персонал узнает о проблеме лишь после того, как помещение начнёт перегреваться.
При комплексном мониторинге последовательность выглядит иначе. Сначала фиксируется потеря питания, затем переход ИБП на батареи, после этого — отказ системы охлаждения. Инженер понимает развитие ситуации ещё до того, как температура достигнет критических значений, и получает дополнительное время для восстановления электропитания, запуска резервного охлаждения или контролируемого завершения работы оборудования.
На что обратить внимание при проектировании мониторинга
При построении системы мониторинга важно контролировать не только параметры окружающей среды, но и состояние инженерных подсистем, от которых эти параметры зависят.
Практика показывает, что наиболее полезную информацию дают события, связанные с электропитанием, состоянием ИБП и работой системы охлаждения. Именно они позволяют увидеть начало развития аварии и понять её причину. Температура, влажность и другие параметры остаются необходимыми, но они должны дополнять общую картину, а не быть единственным источником информации.
Большинство инженерных аварий развивается последовательно: сначала появляются события в системе электроснабжения, затем меняется режим работы ИБП, после чего начинают проявляться последствия в системе охлаждения и температурном режиме помещения.
Эффективный мониторинг должен показывать не только факт перегрева или отключения сервера, но и последовательность событий, которая привела к этой ситуации. Такой подход позволяет раньше обнаруживать аварии, быстрее находить их причину и сокращать время реакции персонала.
При проектировании системы мониторинга важно контролировать не только сами серверы, но и инженерную инфраструктуру, обеспечивающую их бесперебойную работу.
По вопросам подбора оборудования, проектирования систем мониторинга и контроля инженерной инфраструктуры серверных можно обратиться к специалистам ООО «Алентис Электроникс».
Отдел продаж: sales@alentis.ru
Pre-sale-консультации: pre-sales@alentis.ru
Техническая поддержка: support@netping.ru