Не просто дашборд: как мы внедрили DORA-метрики и сократили число критичных инцидентов

DORA-метрики легко обсуждать как что-то довольно очевидное: выбрал четыре показателя, подключил данные, построил графики — готово. На практике все интересное начинается в тот момент, когда пытаешься сделать это не в презентации, а в живой компании с сотнями сервисов, разными сценариями деплоя и командами, у каждой из которых свой способ довозить код до прода.
В Островке из этой задачи в итоге вырос отдельный сервис: он собирает события о релизах, связывает их с изменениями в GitLab, сопоставляет с инцидентами и отдаёт данные в Grafana. На MVP мы покрыли 90% проектов. После того как команды начали регулярно разбирать метрики и автоматизировать узкие места, критичных сбоев стало заметно меньше: в зависимости от месяца снижение доходило до 80% год к году.
Под катом — история о том, как мы к этому пришли. Откуда брали данные для DORA-метрик, как считали показатели при очень разных релизных процессах и почему самой сложной частью оказались не графики, а попытка собрать все это в одну рабочую модель.


















