Комментарии 4
Я думаю, всё просто. Если что-то ломается каждый день, то людям всё равно, что это быстро чинят. Намного лучше, когда поломок почти нет. Тогда и люди довольны, и проблем меньше.
Да, ровно это мы и увидели на своих данных. Парадоксально, но с точки зрения клиентского опыта лучше один раз хорошенько упасть, чем сбоить по чуть-чуть, но постоянно. Разовую аварию клиент прощает и забывает. А при регулярных мелких сбоях он просто перестаёт полагаться на сервис. Причём восстанавливается это доверие заметно медленнее, чем теряется.
Краткий пересказ статьи - "если забивать на тестирование, то в проде будет много багов и это нехорошо"
Про тестирование в статье почти ничего нет. Инциденты рождаются из чего угодно: недостаточное тестирование, отступление от регламентов, несогласованные действия команд, неудачные эксперименты, неучтённые внешние зависимости и прочее. Статья про реакцию на их рост: сначала ставка на быструю починку, потом разворот на снижение частоты.

Мы чинили инциденты всё быстрее — а недовольство клиентов росло. Почему MTBF важнее MTTR