Вы успешно подписались на блог Naumen
Статьи доступны к чтению
Добро пожаловать! Регистрация прошла успешно.
Отлично! Ваш аккаунт активирован, контент доступен.
Success! Your billing info is updated.
Billing info update failed.
Что должна уметь система корневого мониторинга: 7 параметров, на которые стоит ориентироваться

Что должна уметь система корневого мониторинга: 7 параметров, на которые стоит ориентироваться

8 минут чтения

Любой ИТ-сервис, который получают сотрудники компании или ее клиенты, базируется на определенном оборудовании и программном обеспечении. Чтобы сервисы всегда были доступны, необходимо следить за работоспособностью каждого объекта ИТ-инфраструктуры, как можно быстрее узнавать о неполадках и оперативно их устранять. Справиться с этой задачей помогает система корневого мониторинга. Посмотрим, на какие параметры стоит обратить особое внимание при выборе такого программного продукта, чтобы он решал максимум задач.

1. Обнаруживать объекты разного типа

Инфраструктура включает огромное количество разных устройств. Чем больше из них может опросить мониторинг, тем лучше.

Naumen Network Manager (NNM) получает данные об оборудовании с помощью агентов, установленных на серверах, рабочих станциях и мобильных терминалах, включая виртуальные. Система работает с готовыми шаблонами подключения и поддерживает все основные протоколы: ICMP, SNMP, SSH, Telnet, HTTP, ODBC, IPMI, Modbus и другие.

Если в инфраструктуре появляется устройство без готового шаблона, в NNM предусмотрена возможность подключения к новому устройству и получения атрибутов и метрик без доработок. При плановом внедрении оборудования можно заранее сформировать шаблон опроса, который затем будет применяться автоматически с нужной периодичностью.

Такие шаблоны используются как при агентском, так и безагентском мониторинге и пополняют общую библиотеку системы. Это особенно важно, так как бизнес все чаще предпочитает отечественное оборудование. Не все системы мониторинга корректно собирают с него данные, а разработчики не всегда оперативно добавляют поддержку новых моделей. Например, библиотека NNM регулярно пополняется устройствами Yadro, S-Terra, ViPNet, Nateks, b4com и другими.

Библиотека шаблонов NNM постоянно пополняется, поэтому система охватывает новые объекты инфраструктуры для мониторинга

Для подключения к внешним источникам данных — средам виртуализации, DWDM, VoIP, инженерным системам, Kubernetes — используются API-коннекторы.

Из полученных данных автоматически создаются и регулярно обновляются карточки оборудования в CMDB.

Скорость устранения неполадок в ИТ-инфраструктуре зависит от трех факторов:

  • насколько быстро о них узнает ответственное лицо;
  • насколько быстро будет обнаружена причина;
  • насколько быстро будет решена проблема.

Корневой мониторинг умеет сообщать о событиях — ненормативных показателях на объекте — и помогает находить причины.

Для этого в Naumen Network Manager реализована модель Root Cause Analysis (RCA). Она содержит данные о различных объектах, событиях, которые с ними происходили, причинах и взаимосвязях. Благодаря этому система не просто сообщает информацию об отклонении от нормы, но и собирает данные со смежных устройств и связывает друг с другом.

Допустим, одна из систем мониторинга видит перегрев сервера и оповещает ответственного. Сотруднику не приходится тратить время на поиск причины проблемы. NNM уведомляет, что температура в ЦОД, где находится сервер, выше нормы. Значит, нужно обратить внимание на климат-контроль в ЦОД.

3. Автоматизировать управление событиями

События в ИТ-инфраструктуре можно условно разделить на две группы: плановые и внеплановые.

При работе с повторяющимися и запланированными событиями удобно, если система умеет выполнять задачи по расписанию. Например, проводить дискаверинг, создавать связи и строить ресурсно-сервисные модели, составлять и экспортировать отчеты.

Критическое событие формируется при изменении метрики, для которой задано пороговое значение, стандартное или пользовательское. Триггер и реакции системы должны гибко настраиваться.

Чтобы работа с событиями была удобной, в NNM для визуализации инфраструктуры используются виджеты. «Топология» отображает схему всех элементов сети и помогает определить, какой сегмент затронут инцидентом. «ГИС» показывает состояние объектов в привязке к географическим координатам, что особенно важно для телеком-компаний.

Также для сложной инфраструктуры критически важна омниканальность, чтобы оповещения о сбоях приходили через push, мессенджеры и электронную почту, а не только в окне системы.

4. Обрабатывать данные с помощью ИИ

Инфраструктура любой компании со временем усложняется, и ручной анализ данных мониторинга становится неэффективным. Поэтому NNM использует ML-модели для диагностики сбоев, прогнозирования инцидентов, корреляции событий и автоматического реагирования в соответствии с бизнес-приоритетами.

Самый востребованный ИИ-инструмент в системах корневого мониторинга — предиктивная аналитика. Она решает две задачи: прогнозирование значений метрик и выявление аномалий.

Для прогнозирования используются модели ARIMA и RNN, которые обучаются на исторических данных за весь период мониторинга. Чем больше данных, тем точнее прогноз. Выявление аномалий работает иначе: модель анализирует текущие показатели и сигнализирует о резких отклонениях от нормального поведения метрики, даже если пороговые значения формально не превышены.

Рассчитывать можно колебания любых метрик: физические показатели (температура устройств или воздуха в ЦОД), загрузка ресурсов сервера (CPU, RAM, HDD), нагрузка на систему. Если модель предсказывает превышение критической отметки (например, рост числа пользователей приложения до порогового значения), система заранее уведомляет специалистов, и они успевают предотвратить сбой.

5. Масштабироваться под новые задачи бизнеса

Если компания развивается, важно, чтобы система мониторинга была достаточно производительна и легко масштабировалась. Здесь два аспекта, на которые стоит обратить внимание:

  1. Возможность масштабирования самой системы.
  2. Распространение правил на новые устройства.

Возможности масштабирования Naumen Network Manager обеспечены тем, что для обращения к устройствам используются коллекторы и агенты. Они взаимодействуют напрямую с ядром. Если есть необходимость выделить отдельный сегмент, у которого нет сетевой связанности с другой частью инфраструктуры, разворачивается дополнительное ядро с коллекторами и агентами. Данные мониторинга в дальнейшем объединяются в общем интерфейсе.

Что касается масштабирования правил, которые применяются к новым объектам инфраструктуры, то здесь важно, чтобы система корректно распознавала новый объект:

  • понимала, что это за устройство, от какого производителя;
  • определяла его в нужном сегменте;
  • понимала связи в инфраструктуре;
  • ставила на мониторинг и реагировала на события с ним, исходя из преднастроенных для этого типа объектов фактов и действий.

Компания может менять и усложнять инфраструктуру без пересмотра процессов мониторинга, а новые объекты включаются в управление автоматически, без ручной настройки каждого устройства. Это сокращает операционные затраты и время реакции на изменения бизнеса.

6. Предоставлять аналитику на основе собираемых данных

Информация об объектах инфраструктуры и событиях с ними, которые хранятся в системе мониторинга, представляют собой полезный материал для анализа. Необходимо, чтобы система предоставляла удобные инструменты для работы с данными.

Например, интеллектуальный поиск. Так, Naumen Network Manager умеет находить и собирать информацию по устройству, вендору, ID и т. д. Можно посмотреть, сколько свободной памяти на серверах, сколько виртуальных машин, где они базируются: в облаке или на железе. И далее с помощью предиктивной аналитики рассчитывать требуемые объемы в ресурсах или заранее спрогнозировать какие-либо события. А за счет того, что NNM общается с каждым устройством напрямую, полученные данные можно детализировать, в т.ч. в наглядном виде.

7. Интегрироваться с Service Desk, ITAM, SAM и другими системами

Система корневого мониторинга не может существовать изолированно. Она работает в окружении других ИТ-решений, и ценность данных раскрывается при интеграции. Например, NNM поставляет информацию в смежные системы, замыкая цикл комплексной поддержки инфраструктуры. Рассмотрим на примере экосистемы управления цифровым ландшафтом Naumen.

Naumen Service Desk получает данные о неполадках. Далее автоматически создаются инциденты с назначением ответственного, а в NNM отображается статус обработки заявки.

Naumen Business Service Monitoring собирает данные из разных источников, в том числе NNM, для комплексной оценки здоровья инфраструктуры.

Naumen ITAM обменивается с корневым мониторингом инвентарными сведениями. Например, передает тип устройства, производителя, модель, серийный номер, компоненты. Это помогает в управлении активами и построении сервисно-финансовой модели. SAM использует те же данные для контроля бюджетов, договоров и лицензий на ПО.

Naumen Inventory собирает из корневого мониторинга информацию обо всех устройствах для учета и планирования будущего состава инфраструктуры.

Отдельное направление — интеграция систем мониторинга с ITOps и SecOps. Рост кибератак и утечек данных требует объединения мониторинга и защиты для целостной картины происходящего. Security Data Pipelines становится здесь ключевым инструментом. Он фильтрует шум, коррелирует события из разных источников и обеспечивает чистый поток данных для аналитики.

Таким образом интеграция NNM с другими системами превращает мониторинг из точечного инструмента в часть общей ИТ-экосистемы, где данные не теряются, а работают на управление инфраструктурой в целом.

Комплексное управление ИТ-ландшафтом


Дискаверинг, прогнозная аналитика, управление событиями, сбор и нормализация данных

Главное

  1. Система корневого мониторинга должна подключаться к разным типам устройств, поддерживать основные протоколы и API-коннекторы, пополнять библиотеку шаблонов без доработок. Это позволяет автоматически обнаруживать новые объекты и собирать с них данные.
  2. RCA-модель в корневом мониторинге умеет находить причины инцидентов и выявляет взаимосвязи событий. Благодаря этому время диагностики сокращается, и специалисты сразу приступают к устранению сбоев.
  3. Обработка событий в мониторинге должна быть автоматизированной: система назначает приоритеты и статусы, отправляет уведомления через разные каналы и выполняет рутинные задачи по расписанию.
  4. ML-модели обеспечивают прогнозирование метрик и выявление аномалий, позволяя предотвращать инциденты до того, как они повлияют на бизнес-сервисы.
  5. Интеграции с Service Desk, ITAM и SAM, системами безопасности и другими смежными решениями превращают мониторинг из точечного инструмента в часть общей ИТ-экосистемы, где данные работают на управление инфраструктурой в целом.

Хотите узнать, как работает Naumen Network Manager для задач мониторинга инфраструктуры? Оставьте заявку, и мы проведем демо.