Comments 2
Забавно наблюдать, как все обсуждают, переживёт ли очередь отключение хранилища, а настоящий инцидент чаще случается через пять минут после того, как всё "починилось": хранилище получает залпом накопленный за простой объём сразу с нескольких агентов и падает второй раз, уже с красивыми уведомлениями о восстановлении на экране.
У vmagent, vlagent и vtagent есть параметр -remoteWrite.rateLimit, который ограничивает поток данных на эндпоинт. Его как раз можно использовать после восстановления работы бэкэнда. В Vector есть возможность настройки условий "не более 5 запросов в секунду", "не более 2 одновременных запросов" и "до 1 MiB несжатых данных в одном полном batch". И у него есть еще одна фича — Adaptive Request Concurrency, который уже смотрит на задержку бэкэнда. Остальные агенты прямых ограничений не имеют.
Спасибо за ваше замечание, дополнил статью информацией по этому поводу.
Что будет с телеметрией, если хранилище исчезнет: сравниваем очереди и батчинг семи агентов