Мониторинг
Что такое классический ИТ-мониторинг и зачем он нужен
ИТ-мониторинг сравним с пожарной сигнализацией, которая срабатывает при определенных происшествиях или опасности. Только в случае с ИТ это «пожары» в инфраструктуре. В режиме реального времени отслеживаются и фиксируются сбои в работе оборудования, нарушения сетевых соединений, системные ошибки, перегрузки серверов или виртуальных машин и прочие отклонения. Специалисты оперативно узнают о проблемах и устраняют их.
При этом следить за состоянием различных инфраструктурных элементов вручную не требуется. Такие функции выполняют специализированные системы инфраструктурного мониторинга. Они получают информацию с серверов, виртуальных машин, локальных сетей и других объектов наблюдения. В систему собираются метрики работы оборудования и задаются определенные пороги (триггеры), отклонения от которых говорят о сбоях или о том, что они возможны. При достижении критических значений автоматически генерируются оповещения для
Почему классический мониторинг недостаточен для управления ИТ-услугами
Поломка оборудования сама по себе не дает представления о том, какая
Тем временем на техподдержку обрушивается вал обращений, так как у множества клиентов «падают» сайты и базы данных. Но там не знают о вышедшем из строя коммутаторе. Они начинают вручную пинговать серверы сайтов и подозревать
Также зачастую в компании параллельно используется несколько систем мониторинга. Например, одна контролирует работу сетевого оборудования, другая — серверов и виртуальных машин на базе Linux, третья —
Ответственные за целостные

В результате формируется целый комплекс проблем. Обозначим основные.
Нет понимания, как события в инфраструктуре влияют на услуги. Допустим, обнаружен перегруз мощностей виртуальной машины. Угрожает ли это работе корпоративного портала или другого сервиса? Специалистам необходимо проанализировать, с какими услугами связана эта виртуальная машина и последовательно проверить доступность. В итоге индиденты устраняются недостаточно оперативно, а сервисы подолгу простаивают.
Нет приоритетов, какие услуги и инфраструктурные элементы наиболее критичные. Допустим, одновременно пострадали разные сервисы.
Поток дублирующих сигналов из разных систем мониторинга. Каждая из них генерирует свои оповещения о сбоях. Они могут пересекаться и дублироваться. Кроме того, даже в рамках одного решения формируются, так называемые, «ложные» алерты. Это события, которые не связаны с реальной угрозой, проблемой и не требуют срочного вмешательства. Тем не менее операторы вынуждены их проверять. В определенный момент число «ложных» алертов, скорее всего, превысит пропускную способность операторов по их обработке. Это явление называется усталостью от уведомлений (alert fatigue) и ведет к рискам пропуска критических событий.
Нет возможности предотвращать простои услуг. Об отклонениях и сбоях приходится узнавать постфактум вместо того, чтобы действовать превентивно и предотвращать угрозы. Ведь работоспособность каждой услуги может обеспечиваться несколькими инфраструктурными элементами, события по которым фиксируют отдельные системы мониторинга. Данные не получается связать воедино, чтобы комплексно оценить состояние сервиса и вовремя узнать о возможных проблемах.
Нет заданного алгоритма, как реагировать на фиксируемые отклонения и сбои в работе сервисов. Система мониторинга лишь сообщает о событиях, но решить проблему с ее помощью нельзя. Даже если коренная причина прерывания сервиса обнаружена, нужен четкий алгоритм действий в таких ситуациях.
Для достижения высокого качества
Как обеспечить целостный подход к ИТ-услугам
Чтобы контролировать состояние сервисов и услуг, необходимо понимать, как и с какими объектами инфраструктуры они связаны. Для этого формируются следующие источники информации.
Configuration Management Database (CMDB) — это централизованная база конфигурационных единиц, которая должна обеспечивать исчерпывающие и актуальные данные о каждом элементе
- автоматическое сканирование сети — дискаверинг. Реализуется специализированными автоматизированными решениями;
- интеграция
ИТ-систем — импорт необходимых данных из различных источников, входящих в инфраструктуру; - ручной ввод — ввод уникальных данных, которые невозможно получить с помощью инструментов автоматизации.
Ресурсно-сервисная модель (РСМ) — строится на базе CMDB. Она как раз и содержит сведения, какие конкретно составляющие инфраструктуры обеспечивают конкретную услугу. В ней можно найти любой сервис и сразу понять, от какого оборудования он зависит. Кроме того, модель позволяет структурировать информацию о сервисах, классифицировать и приоритизировать. РСМ — ключевой и необходимый элемент целостного мониторинга
Таким образом, есть все необходимые составляющие для определения состояния услуг: технические данные мониторинга о состоянии объектов

Эти решения аккумулируют информацию из всех источников и сопоставляют. Результатом становится определение здоровья каждого сервиса.
Что дает комплексный мониторинг ИТ-услуг
Перечислим основные выгоды комплексного мониторинга
Получение сводных данных из разных источников. Собранные в ходе мониторинга сведения концентрируются в едином пространстве. Это дает информационную базу для формирования
Понятная взаимосвязь между элементами инфраструктуры и
Прогнозирование отклонений в предоставлении
Построение процесса управления событиями. Формируются единые правила реагирования на отклонения и автоматизируется реакция на них. Если компания использует решение Service Desk для управления поддержкой пользователей, то из зонтичного мониторинга можно отправлять туда критичные события, влияющие на услуги. Там автоматически будут создаваться и направляться нужным специалистам заявки на устранение зафиксированных инцидентов.
Повышение точности данных. Зонтичный мониторинг автоматически фильтрует события, поступающие от систем инфраструктурного мониторинга, отделяя «ложные» или избыточные. Для этого в решении настраиваются правила: типизации — для унификации данных из внешних источников, и корреляции — для определения критичности сбоя.
Аналитика и визуализация состояния
Менеджеры услуг могут узнавать о проблемах с сервисами не от пользователей, когда уже ничего не работает, а заранее. По данным, полученным от инфраструктурного мониторинга, зонтичное решение «понимает», что тот или иной объект работает на пределе возможностей, и формирует статус «Предупреждение» для зависящей от него услуги. Это видят и менеджер, и ответственный
Что может помешать изменить подход к мониторингу
Проблемы классического мониторинга очевидны не всегда. Некоторые компании стараются сохранить этот подход, при котором внимание уделяется исключительно инфраструктурным компонентам. На предложения поменять привычную схему работы обычно приводят следующие контраргументы:
- Это наша зона ответственности, сами знаем, как правильно.
- Менять подход нет времени, поскольку нужно постоянно реагировать на сбои и управлять инфраструктурой.
- Все и так нормально работает.
Не все специалисты имеют мотивацию к изменениям. Менеджер услуги оказывается в непростой ситуации, ведь из-за частых прерываний сервисов страдает профессиональная репутация. Он задается логичным вопросом: а зачем вообще нужен мониторинг, который не дает понимания работы
Как обосновать необходимость мониторинга ИТ-услуг
Чтобы начать контролировать состояние
Другое дело, если менеджер услуг и
- Никто не собирается лезть в чужую зону ответственности и вмешиваться в управление инфраструктурой. Задача — понять, как работает услуга в связке с оборудованием и ПО.
- Нехватка времени и аврал в управлении инфраструктурой связаны с отсутствием комплексного мониторинга услуг. В случае прерывания сервисов
ИТ-специалистам приходится долго разбираться, где именно произошел сбой. - Даже если в конкретной системе мониторинга все четко налажено, возможны ложные срабатывания и ошибки. Настройка триггеров для метрик в нескольких системах зачастую приводят к повторяющимся или противоречащим друг другу реакциям. Если менеджер услуг будет видеть точную картину по состоянию сервисов, он не станет отвлекать
ИТ-специалистов в подобных ситуациях.
Для бизнеса же основной аргумент в пользу мониторинга услуг заключается в том, что
К выводам
Построение мониторинга
Переходите на новый уровень управления инфраструктурой с зонтичным мониторингом. Опишите ваши задачи, и мы покажем, как их решить с помощью Naumen BSM.