Взгляните на графики ниже: они показывают, что существует некая зависимость между количеством проданного мороженого и количеством утонувших людей в определенном регионе мира. Этот и подобные карикатурные примеры ошибки корреляции можно найти на ресурсе Spurious Correlations.

image.png

Но шутки в сторону. В этой статье хотелось бы рассказать о своем опыте встречи лицом к лицу с ошибкой “correlation does not imply causation”.

Недавно на работе я исследовал временной лаг между регистрацией новых компаний и их конверсией в наших клиентов, по итогам чего коллегами на обсуждение был вынесен тезис:

“новая компания становится нашим клиентом через n месяцев после регистрации”

Я был удивлен таким прочтением моего исследования, построенного на анализе корреляций и поиске уравнения регрессии, ведь корреляцию так интерпретировать нельзя: мне вспомнился приведенный выше пример с мороженым и тонущими людьми.

Данные действительно показывали, что рост числа регистраций коррелирует с приростом клиентской базы через n месяцев - коэффициент корреляции достигал 0,55. Но возник закономерный вопрос: если все действительно так, почему бы нам не сфокусировать все усилия маркетинга на свеже-зарегистрированных компаниях?

Позже, перечитав исследование, я понял, что проблема была в самой логике анализа, а не в его прочтении. Значительная его часть была посвящена поиску корреляций, а обнаруженные связи постепенно превратились из гипотез, требующих проверки, в фундамент для дальнейших выводов. Корреляция перестала быть отправной точкой исследования и фактически стала его доказательной базой.

Так я попал в ловушку correlation does not imply causation. При этом, я прекрасно знал, что корреляция ≠ причинность. Проблема оказалась в другом: в какой-то момент, от вопроса “влияют ли регистрации на приток клиентов?” был незаметно совершен переход к поиску ответа на вопрос “как регистрации влияют на приток клиентов?”

Когда перед тобой стоит задача «найти закономерность», а данные долго не дают убедительного ответа, возникает естественное желание зацепиться за первое правдоподобное объяснение. Найденная корреляция постепенно перестает быть просто наблюдением: вокруг нее начинает выстраиваться логика исследования, появляются объяснения, подтверждающие примеры и все новые аргументы в пользу уже сложившейся гипотезы.

Позднее мне все же удалось выйти из этого “миража” и установить, что рост регистраций и рост клиентской базы сонаправлены из-за сезонности и ряда других факторов, но нашими клиентами становятся не те же компании, что были зарегистрированы n месяцев назад. Вывод оказался неверен целиком - коэффициент 0,55 действительно говорил о наличии статистической связи, но ничего не сообщал о механизме ее возникновения.

Ниже я оставил небольшую справку, которая может быть полезна, чтобы не попасть в подобную ловушку:

  1. Что такое корреляция

  2. Что такое ковариация

  3. Сценарии сильной корреляции

  4. Использование корреляции для манипуляций данными

Что такое корреляция

Коэффициент корреляции - это числовая мера, показывающая, с какой силой и в каком направлении связаны изменения двух переменных. Важно подчеркнуть слово «изменения». Корреляция не сравнивает сами значения, а оценивает, происходит ли изменение одной величины одновременно с изменением другой.

Разберемся с формулой коэффициента корреляции:

Что такое ковариация

Формула коэффициента ковариации выглядит страшновато, но тем не менее ее суть довольна проста в понимании: если обе переменные имеют тенденцию отклоняться от своих средних значений в одном направлении, ковариация будет положительной. Если одна переменная отклоняется выше среднего, а другая - ниже, ковариация станет отрицательной. Суть ковариации продемонстрирована ниже.

Корреляция не объясняет влияние и не служит основой для причинно-следственного вывода (causal inference). Отсюда и растут ноги у всех примеров ошибок корреляции. Всего я бы выделил 4 возможных сценария, почему переменные могут изменяться в одном направлении, причем наступление каждого из сценариев не равновероятно.

Сценарии сильной корреляции:

Также хочется отметить, что для разных статистических задач есть разные группы методов исследования и формы получения данных.

Корреляция и регрессия отвечают на вопросы о статистических взаимосвязях между переменными, тогда как причинный анализ (causal inference) предназначен для оценки причинно-следственных эффектов. Наиболее надежным способом такой оценки являются рандомизированные эксперименты, а если провести их невозможно, применяются квазиэкспериментальные методы.

Именно смешение этих двух типов вопросов чаще всего приводит к ошибке, известной как “correlation does not imply causation”.

Коварность корреляции

В 1998 году в журнале Lancet было опубликовано исследование, авторы которого буквально утверждали, что вакцинация против кори, краснухи и паротита (MMR) вызывает развитие аутизма у детей. Это вызвало настоящий антипрививочный бум и взбудоражило врачей по всему миру.

Последующие крупные исследования не подтвердили причинной связи между MMR-вакцинацией и аутизмом, а в отношении автора удалось установить факт манипуляции данными в корыстных целях: исследование было частью бизнес-плана по выходу на рынок биотехнологической компании Carmel Healthcare. Проблема была в том, что исследование было построено на совпадении двух событий во времени, однако такое совпадение еще не означает, что одно является причиной другого: признаки аутизма сами по себе начинают явно проявляться в том же возрасте, в котором проводится вакцинация.

Манипуляция здесь заключается в подмене временной ассоциации причинностью. Корреляция сама по себе не позволяет установить механизм причинного воздействия - совпадение вакцинации и появления заметных признаков аутизма по возрасту недостаточно для такого вывода.

Так, проблема корреляции заключается в том, что она может служить фундаментом для заведомо ложных исследований и построенных на ней выводах. Через поиск “выгодных взаимосвязей” ее можно использовать для построения “нужных” для исследователя выводов, а не для объяснения реальной ситуации.

Вернемся к бизнес-примеру

Недобросовестный или просто невнимательный аналитик вполне мог бы продать бизнесу подобную неверную идею. И проблема здесь не в самой корреляции, а в подходе к исследованиям: когда аналитика превращается в поиск аргументов в пользу уже выбранной гипотезы, а не в попытку ее опровергнуть, она перестает быть инструментом принятия решений.

Любое исследование должно строиться вокруг вопроса «верна ли моя гипотеза?», а не «как доказать, что моя гипотеза верна?». В противном случае data-driven подход становится лишь красивой вывеской, а решения начинают приниматься не на основе данных, а на основе доверия к интерпретациям аналитиков.

Последствия такой ошибки в бизнесе могут быть серьезными. Если изначальная гипотеза неверна, но именно она становится фундаментом продуктовой стратегии, компания может годами инвестировать ресурсы в направление, которое не создает оптимальной ценности для бизнеса. Именно поэтому задача любого аналитика — не подтвердить свою гипотезу, а сделать все возможное, чтобы попытаться ее опровергнуть.