Обновить
4K+
3
Дмитрий@esdmitrii

Пользователь

4
Рейтинг
Отправить сообщение

Как я перестал гадать, какая пара нод сломалась после апдейта CNI, и написал для этого свой мониторинг

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели5.2K

98% успешных проверок в дашборде выглядят прекрасно. Ровно до момента, когда доходит: недостающие 2% это одна пара нод, один протокол, и так каждый день. Обновили CNI или ядро, и между двумя конкретными нодами начал теряться UDP, а агрегат всё ещё зелёный.

kconmon‑ng ставит агента на каждую ноду и гоняет TCP, UDP, ICMP, DNS и HTTP‑пробы между всеми парами каждые 5 секунд, а при сбое сам снимает MTR‑трейс, пока проблема ещё жива.

К версии 2.0.0 у проекта выросла веб‑консоль: матрица N×N, расследование с ранжированием причин без ML, машина времени для разбора ночных инцидентов и алертинг, который сводит правила в настоящий PrometheusRule. Под капотом всё тот же Prometheus.

Читать далее

Информация

В рейтинге
1 423-й
Зарегистрирован
Активность

Специализация

DevOps-инженер
Старший