Обновить

Комментарии 1

Доброго времени суток! Отличный разбор) Плюс за честность, детальный таймлайн аварии и чистую команду ремонта через compose с запретом трогать зависимости! Отдельный плюс за тезис про то, что "healthy контейнера - не доказательство работоспособности бизнес-цепочки"!)

Обычно все успокаиваются на зелёной плашке в мониторинге, а тут такая засада. Знакомая ситуация...бррр.. Недавно на self-hosted n8n ловили отказ точно такого же класса: снаружи всё выглядело как просто случайный сетевой таймаут, а внутри оказалась гонка данных на общем Redis-ключе. И как у Вас один в один похоже - "очень похоже на медленную базу", да и логи идеальные. Раскрутить получилось только когда сел руками сопоставлять таймстампы двух параллельных экзекушн.

По поводу Вашего техдолга)) хочу спросить: Служебные воркфлоу (тот же SQL-мост) в отдельный пул планируете выделять вообще отдельной инсталляцией n8n или просто разнесением очередей по разным воркерам внутри той же самой инсталляции? Я такое видел в проде на нагруженных проектах, и у каждого, мягко говоря, свои специфические затыки... Интересно, в какую сторону вы смотрите?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации