Обновить
32K+

Статистика в IT

Статистика, исследования, тенденции

21,65
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Почему в науке находят причины там, где их нет

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели5.3K

Представим ситуацию. Продажи мороженого и число утоплений летом растут одновременно — статистика, что графики почти совпадают. Но мороженое никого не топит: оба показателя зависят от третьей переменной — жары. Корреляция показывает, что показатели движутся вместе, но не объясняет причину. Но часто это путают. В научной статье или ее пересказе корреляции легко превращают в объяснение причины. Рассказываю, как часто авторы публикаций допускают такой скачок и что добавляет от себя ИИ.

Ученые из Университета Пенсильвании проанализировали с помощью LLM заголовки и аннотации 194,6 тысяч статей по социальным наукам за 1980–2024 годы. Они отобрали работы с кросс-секционными данными: в таких исследованиях ученые сравнивают людей, организации или другие объекты в один момент времени, а не наблюдают за их изменениями.

Так можно обнаружить связь, но обычно нельзя установить ее причину. Например, если люди, довольные работой, чаще занимаются спортом, это еще не значит, что спорт повышает удовлетворенность работой. Возможно, довольные сотрудники находят больше сил для тренировок. Или и то и другое связано с более удобным графиком.

Тем не менее в 46,3% отобранных статей авторы использовали формулировки, которые прямо или косвенно указывали на причинность. Речь именно о заголовках и аннотациях к статьям. С 2000 по 2024 год доля таких публикаций выросла примерно с 20% до более 60%. В 2024 году в работах по бизнесу она достигла 84%, по экономике — 67%.

Читать далее

Новости

Как Amazon пережила крах доткомов

Время на прочтение21 мин
Охват и читатели9.5K

В мае 1999 года еженедельная деловая газета Barron’s вышла с печально известной обложкой «Amazon.bomb». На ней лицо Джеффа Безоса было изображено на мультяшной бомбе, готовой взорваться. «Мысль о том, что генеральный директор Amazon Джефф Безос создал новую бизнес-парадигму, нелепа, — говорилось в статье. — Он всего лишь очередной посредник, и фондовый рынок начинает это понимать».

Читать далее

Кого оценивают выше: возраст, разница в возрасте и миф о взаимности — по 24 миллионам оценок

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели8.5K

Продолжение разбора 24 миллионов оценок из Rate Me: как средняя оценка зависит от возраста оцениваемого, почему мужчины и женщины по-разному реагируют на разницу в возрасте, и проверка мифа о взаимности - щедрых оценщиков не оценивают щедрее. Три графика, полный массив, без сэмплирования.

Читать далее

Контринтуиция в статистике на примере игры Мир Танков/WOT

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели7.4K

Контринтуитивные события окружают нас повсюду. Взять, например, парадокс дней рождений: каждый раз, когда оказываешься в небольшой группе и узнаёшь, что у двух участников группы праздник в один и тот же день, то думаешь: какое удивительное совпадение, ведь кажется, что событие редкое. Но вот уже при детальном рассмотрении оказывается, что вероятность такого события достаточно высокая (например, если группа 23 человека, то вероятность составит 50%, для группы в 57 человек — 99%). Примеров контринтуитивных событий много и они удивительны тем, что их разоблачение позволяет нам менять своё мировосприятие. 

Вот и мы с друзьями затеяли спор об одном таком событии, связанным с игрой Мир танков. Суть спора: двое из нас считают один сервер «несчастливым», потому что при нашей средней статистике в 50%, именно на этом сервере происходят частые поражения. Третий друг считает, что не может быть такого, чтоб сервер был «несчастливым» и тем более, невозможно, чтобы средний процент побед всех игроков на нём был меньше 50%. 

Читать далее

Говард Маркс. Риск — новое осмысление

Время на прочтение11 мин
Охват и читатели9.5K

Говард Маркс — известный инвестор и мыслитель. Сам Уоррен Баффет сказал, что меморандумы Маркса — «первое, что я открываю и читаю», когда они приходят по почте. Среди них «Risk Revisited Again», «Can We Measure Risk with a Number?» и другие. Ниже основные мысли и идеи из них.

Читать далее

Квантовая статистика данных: почему пора открыть Qiskit, а не ждать квантового компьютера

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели6.7K

Если вы аналитик данных, ML- или DL-инженер то вы работаете в основном с традиционными метриками и статистиками, но у них есть квантовые аналоги, а возможно, и новые еще не исследованные метрики, которые уже вычисляются одной строкой кода без использования квантового компьютера. Более того, на стыке квантовых вычислений и статистики сейчас существует открытая ниша целой дисциплины и это редкий случай, когда первопроходцем может стать не физик-теоретик, а практикующий специалист, работающий с данными.

Читать далее

Дайджест технических новостей, переводов и лонгридов инфослужбы Хабра за август 2026 года

Время на прочтение6 мин
Охват и читатели8K

В августе 2026 года информационная служба Хабра выпустила 826 публикаций (785 новостей и постов, 7 лонгридов и 34 перевода). В текущем дайджесте представлены лучшие технические новости, переводы и лонгриды (отдельные большие публикации) инфослужбы Хабра, согласно оценкам пользователей.

Читать далее

Кто хочет жить вечно — как я сделал открытую базу данных об отношении к продлению жизни

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8.3K

Что общего у Бенджамина Франклина, японских пенсионеров и американских зумеров? Всех их спрашивали о смерти, бессмертии и о том, сколько они хотят прожить. Только данные разбросаны по сотням статей, сайтов, стат. сборников и архивов.

Если биологи и медики уже давно каталогизируют данные о продлении жизни, то социальные данные — что люди об этом думают — до сих пор лежали мертвым грузом. Никто не сводил их в одну таблицу.

Я решил, это исправить. В этой статье я расскажу, как родился проект «Кто хочет жить вечно», почему вопрос бывает важнее ответа и как я собирал со всего интернета материалы, упаковывая их в инфографику на 40 графиков.

Читать далее

В России в 10 раз выросли суммы штрафов организациям за утечки персональных данных. Новый отчёт ЭАЦ

Время на прочтение3 мин
Охват и читатели10K

Привет, Хабр! Наш экспертно-аналитический центр подготовил очередной отчёт, на этот раз — про штрафы за утечки персональных данных по миру и в России (2025–2026).

Небольшой спойлер — тот самый оборотный штраф, о котором столько говорят, пока ещё никому не прилетел. Зато суммы штрафов за утечки персданных, назначаемые организациям, выросли в 10 раз.

Под катом — более подробная статистика с разбивкой по отраслям и странам и полная версия отчёта.

Читать далее

Статистика в отделе маркетинга. Квалификация лидов и биномиальный эксперимент

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6K

Может ли статистика помочь маркетологам и отделам продаж в обработке лидов? Да, причем в целом ряде задач!

Прочитав статью, вы:

1. Получите мощный аргумент для переговоров: «Нет, вероятность, что конверсия вашего отдела продаж просела случайно – статистически ничтожна»;

2. Оцените вероятности целевых событий для вашего медиаплана;

3. Прокачаете «План/Факт», построив эталонное распределение.

Читать далее

Вы внедряете AI неправильно и что такое контекстный долг

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.1K

AI-агента сегодня можно собрать за несколько часов. Но это не значит, что бизнес понимает, где его действительно стоит внедрять.

Компании часто начинают с Build: выбирают модель, подключают Jira, GitHub, MCP, собирают workflow. А уже потом пытаются понять, какую проблему они вообще решили.

В статье разбираю другой подход: сначала найти места, где команда теряет время на восстановление контекста, ручную координацию и переключение между системами. Для этого мы используем Context Audit и понятие контекстного долга.

Поговорим о том, как увидеть такие проблемы в Jira, Confluence и GitHub, почему не каждую из них стоит автоматизировать и что делать после аудита.

Читать далее

DML против PSM: как оценивать нерандомизированные эксперименты быстрее и надёжнее?

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.7K

Привет, Хабр! Давайте на примере кейса с рекламой в ПВЗ Wildberries разберемся в двойном машинном обучении (DML) и методе псевдорандомизации (PSM). Вы в деле?

Меня зовут Платон Попов, я дата-аналитик в команде A/B-платформы RWB. В нашей команде я занимаюсь задачами из области причинно-следственного анализа (Causal Inference) и методами понижения дисперсии. 

В этой статье расскажу о самом кейсе и объясню, почему для него не подошёл классический t-тест. Покажу, как мы учитывали спутывающие факторы с помощью Propensity Score Matching (PSM), почему этого оказалось недостаточно и почему в итоге перешли к Double Machine Learning (DML). В конце сравним результаты и обсудим наш план выкатки метода оценки нерандомизированных экспериментов в промышленный масштаб.

Читать далее

Каталог прислал 127 человек за день. На следующий день не вернулся никто

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели5.4K

Две недели назад я выложил свою игру в MAX и чуть позже в каталог мини-приложений VK. Рекламу не покупал, ссылки нигде не размещал, бюджет на продвижение равен нулю.

За две недели игру открыли 525 разных человек: 263 пришли из VK, 165 из MAX, ещё 97 через прямую ссылку. Если судить по этим цифрам, VK у меня самая успешная площадка, и первые дни я так и думал.

Возврат на следующий день у игроков из VK при этом равен нулю. Ноль человек каждый день подряд, начиная с того момента, когда там вообще кто-то появился. У MAX за тот же период возврат держится около 36%.

В статье разбираю, как я две недели радовался графику роста вместо полезной метрики, что показала проверка счётчика на баг, почему средний возврат по всем источникам не описывает ни одну реальную группу игроков и какие три объяснения этому нулю у меня остались непроверенными.

Читать далее

Ближайшие события

Как фонд в $45 млрд потерял почти всё за несколько недель

Время на прочтение4 мин
Охват и читатели10K

История Леопольда Ашенбреннера ещё недавно выглядела как почти идеальная иллюстрация того, как можно заработать на революции искусственного интеллекта.

После ухода из OpenAI в 2024 году он написал статью под названием «Ситуационная осведомленность», посвящённую будущему искусственного интеллекта, в которой подробно изложил свои взгляды на будущее искусственного интеллекта. Статья была полна сенсационных заявлений и получила широкое распространение в интернете.

Читать далее

5G на «низком старте» в России: сети ещё нет, а смартфоны уже готовы

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели9.9K

Всем привет! На базе наших аналитических исследований вышла новость про 5G устройства в России. Решили поделиться с читателями Хабра подробностями, которые не попали в публикацию.

Это взгляд на запуск сети пятого поколения не из пресс-релизов операторов, а на базе миллионов мобильных устройств, работающих в России.

Читать далее

24 миллиона оценок внешности: что мы нашли в собственной базе за 12 лет

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели7.2K

Двенадцать лет незнакомые люди ставили друг другу баллы от 1 до 10. В базе накопилось 24 миллиона оценок от 110 тысяч человек из 232 стран. Мы залезли в собственный PostgreSQL и нашли четыре вещи, которых не ожидали: провал на девятке, разрыв в 1,14 балла в том, как мужчины оценивают мужчин, разброс по странам в 2,4 балла и падение щедрости по ходу сессии.

Читать далее

Когда комментировать на Хабре: я разобрал 4404 комментария

Время на прочтение8 мин
Охват и читатели7.3K

Некоторое время назад я решил оживить мой аккаунт на Хабре. Покомментировав с умным видом здесь и тут, я решил подвести научную базу: собрал 4404 чужих комментария из 250 тредов и посчитал, когда и где надо оставить комментарий, чтобы он набрал максимум лайков. Спойлер: час на часах не важен, а вот позиция в треде и первые сутки решают всё.

Погрузиться в Биг Дейту

Как мороженое заставляет людей тонуть: главная ошибка корреляционного анализа

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели6.3K

Известно, что чем больше продается мороженого, тем больше регистрируется несчастных случаев с утонувшими. Корреляция есть - значит, мороженое опасно?

Эта статья — о том, почему знание правила «correlation ≠ causation» еще не гарантирует, что вы сами на нем не попадетесь

Читать далее

$40 против миллионов: экономика кибератак, которую защитники не хотят считать

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели5.8K

Привет, Хабр! Меня зовут Александр Михайличенко, я консультирую промышленные компании по безопасности АСУ ТП и КИИ. В прошлом году мы с командой AKTIV.CONSULTING провели исследование зрелости ИБ в 52 российских компаниях, и наткнулись на цифру, которая зацепила: комплаенс у компаний закрыт на 45%, а реальная техническая защита — на 29%. Компании тратят миллионы на бумажную безопасность, а потом читаем в новостях про очередной шифровальщик, остановивший производство.
Родился простой вопрос: а сколько вообще стоит атака?

Начал считать — и увлекся. Аренда шифровальщика — $40 в месяц. Доступ к сети крупной компании — $500. ИИ-фишинг с кликабельностью 54% — $50 в неделю. Ущерб для жертвы — миллионы долларов.

Эта статья — про то, что я насчитал. И про то, почему защита проигрывает не из-за плохих технологий, а потому что экономика сломана: атака дешевеет, защита дорожает, и никто не хочет считать эту разницу вслух.

Читать далее

Новый абсолютный рекорд по числу DDoS-атак и другая статистика за Q2 2026

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8.3K

Настало время рассказать, что интересного произошло в плане DDoS за второй квартал этого жаркого года. Произошло, надо сказать, немало, и некоторые зафиксированные нами тренды специалистам по ИБ будут особенно интересны — впрочем, как и просто тем, кто хочет знать, насколько большая опасность подстерегает их отрасль в середине 2026 года.

Читать далее
1
23 ...