
Комментарии 4
Павел, вы описали самую обычную систему мониторинга. Ничего "зонтичного" тут нет.
Prometheus из коробки закроет почти все ваши хотелки, за исключением, может быть dumb USP - тут придется добавить дополнительные сенсоры.
Основная задача, как вы уже отметили, не техническая.
Нужно сделать чтобы все алерты были, при этом они были именно алертами (чтобы не притуплять внимание).
Комплексный dash для руководства - тоже штука обычная. Просто четыре квадрата, по одному для (из вашей задачи):
тот, кто отвечает за мониторинг инженерного оборудования,
системный администратор,
сетевой администратор,
специалист по информационной безопасности.
Нет проблем- зеленый. Началник счастли. Если есть проблемы - желтый, критические - красный.
Ну и правильная система эскалации, чтобы исключить случай на корпоративе, описанный вами: алерт дежурному, потом его руководителю, потом CTO (условно). Можно экалацию дублировать по SMS, чтобы повысить надежность.
В общем - это уже классика.
В городе при этом не оказывается человека, который мог бы сразу начать корректно останавливать виртуальные машины.
А это уже точно не техническая проблема.
Несколько вопросов:
Как в системе решали корреляцию событий? Если одновременно упали питание, серверы, сеть и несколько приложений, оператор получает один инцидент или десятки независимых тревог?
Использовалась ли CMDB или какая-то единая модель инфраструктуры? Или связи между объектами хранятся непосредственно в самописной системе?
Почему решили писать свою верхнеуровневую систему самостоятельно, а не посмотреть в сторону готовых решений для зонтичного мониторинга и корреляции?
Отличные вопросы.
Корреляция была жестко заскриптована и полностью прописать все зависимости триггеров было максимально трудоемко. В некоем светлом будущем было бы очень круто решать проблемы корреляций с помощью генеративного ИИ. Да и не только корреляций - взглянув на список сообщений в секунду более-менее крупного SIEM становится страшно.
CMDB как информация о цифровых активах была, но речь шла именно о цифровых активах. Какой то общей информационной/семантической модели там к сожалению не было. Но было бы очень интересно посмотреть на систему с семантической моделью данных.
Конкретно в том случае специалисты заказчика частично евангелистами сработали: систему начали реализовывать плюс/минус в момент первого упоминания зонтичных систем мониторинга. То есть на тот момент готовых решений не было, но не смотря на то что внедрение затянулось, «менять коня на переправе» не стали.
Зонтичный мониторинг: зачем следить за теми, кто следит за ЦОДами