В последнее время традиционная бизнес-аналитика все сильнее пересекается с плоскостью аналитики данных (как в индустрии финтеха и банкинга, так и во многих других сферах). Некоторые профильные специалисты уже не первый год рассматривают Business Intelligence как супермножество Data Science, и все громче звучит мнение, что компаниям необходимо объединять оба направления.
Поэтому сегодня мы в МКБ подготовили подборку материалов для желающих погрузиться в тему BI/Data Science. Под катом — открытые книги, которые помогут разобраться в современном аналитическом стеке, а также профильные учебники. А еще блоги, авторы которых простыми словами разбирают вопросы и проблемы по теме: от борьбы с «фактором автобуса» до принципов работы в индустрии BI.

Что почитать
Аналитический стек с нуля: пособие для чайников. Справочник пригодится начинающим дата-аналитикам или менеджерам продукта, которые в общих чертах понимают устройство современного аналитического стека, но испытывают сложности при общении с дата-инженерами (особенно когда речь заходит о проблемах, связанных с пайплайнами). В материале все базовые концепции поясняются на картинках и примерах для наглядности.
Руководство стремится объяснить как можно большее число сценариев, с которыми сталкивается аналитик — например, про работу как с SQL, так и с NoSQL. При этом авторы — разработчики из сингапурской консалтинговой компании Holistic — открыто признают, что многие рекомендации отражают их собственные предпочтения. Это — облачное хранилище, MPP-аналитические базы данных и прочее. По их мнению, приоритет в построении стека данных стоит отдавать аналитическим процессам и моделированию, тогда как визуализация, хотя и важна, должна отходить на второй план. В любом случае оценить эти и другие рекомендации можно самостоятельно — книга выложена в открытый доступ в формате PDF.
Python для анализа данных. Книга Уэса Маккинни, разработчика open source-пакета pandas. Как следует из названия, это — настольное руководство по обработке и анализу данных с использованием Python. Материал похож на справочник в стиле «бери и делай» — по утверждениям автора, примеры кода со страниц можно использовать в своих решениях и документации. Книга находится в открытом доступе, и в апреле 2023 года была обновлена, чтобы текст соответствовал изменениями в pandas 2.0.0 и Python 3.10.
«Python для анализа данных» будет полезна аналитикам, начинающим работать с этим языком программирования. Уэс рассказывает, как использовать Jupyter и терминал IPython для аналитики и вычислений, объясняет, как устроены базовые и продвинутые функции для подготовки данных: загрузки, очистки, преобразования и перегруппировки. Кроме того, Маккинни пишет про анализ и обработку регулярных и нерегулярных временных рядов. В конце книги Маккинни разбирает описанные им техники на реальных датасетах.
Стоит отметить, что материал перемежается с историческими справками от автора — например, как появлялись первые инструменты для векторизации в Python. Маккинни вспоминает, что все началось в 1995 году, когда Джим Хугунин создал библиотеку Numeric, а Трэвис Олифант в 2005 объединил ее с Numarray и представил NumPy. Также, помимо прочего, Уэс рассказывает, как и почему он разработал pandas.
Машинное обучение и анализ данных. Эту книгу в 2024 году опубликовал Александр Дьяконов, руководитель направления наук о данных в Центральном университете и абсолютный чемпион на платформе Kaggle. Книга выложена на GitHub — в ней 31 глава. Автор пишет про алгоритмы для обучения на размеченных данных, линейную регрессию и классификаторы, ансамбли, случайные леса и не только. Основной акцент Дьяконов делает на предобработке данных, отборе признаков, показателях качества. Книга начинается с основ аналитики, включая задачи, которые решаются с помощью машинного обучения. Материал во многом основан на публикациях в блоге автора (часть глав представлена в виде ссылок на соответствующие посты).
Продвинутый анализ данных: от простого к сложному. Автор книги — Косма Шализи, профессор статистики и специалист кафедры машинного обучения Университета Карнеги — Меллона. Изначально материал представлял собой серию заметок для семестрового курса по продвинутому анализу данных для старшекурсников, но со временем дорос до полноценной книги объемом в 900 страниц (которая, вероятно, продолжит дополняться). Шализи улучшает ее содержание уже более десяти лет. Он планировал выпустить книгу еще в 2013 году, но затем сроки сдвинулись сперва на год, после — еще на пять. Сейчас автор уже не берется прогнозировать, когда именно выйдет печатная версия, однако материал доступен онлайн.
«Продвинутый анализ данных» ориентирован на математическую составляющую и статистический анализ; разделы книги посвящены распределениям, причинно-следственному анализу. Даже сам автор отмечает, что читателям необходимо понимание концепций теории вероятности и владение базовыми инструментами статистического анализа — без этих знаний материал покажется сложным. Помимо прочего, автор пишет о роли моделей машинного обучения в аналитике, затрагивает такие вещи, как переобучение и кросс-валидация.
Автор подкрепляет рассказ графиками, диаграммами, схемами и другим визуалом. Книгу стоит воспринимать как полноценный учебник (коим она и является), который содержит множество ссылок и сносок на научные работы для дополнительного чтения по теме. Кроме того, каждый раздел автор сопровождает практическими упражнениями для закрепления материала.
Байесовский вывод в анализе данных. Эта книга была написана профессорами крупных американских вузов еще в 1995-м, однако в прошлом году вышло свежее переиздание с исправлениями и дополнениями. «Байесовский вывод в анализе данных» — это 700 страниц, которые, по сути, посвящены (внезапно!) одной теме — байесовскому выводу. Этот метод остается одним из ключевых инструментов в арсенале аналитика данных и применяется для построения прогнозных моделей, детектирования аномалий и персонализации рекомендаций.
В первых главах книги описаны ключевые подходы к моделированию процессов, систем или анализа данных — например, однопараметрические и многопараметрические модели. Во второй части книги авторы начинают рассказывать, как можно сочетать байесовский вывод с другими методами анализа данных. Ближе к концу раскрывается идея превосходства такого подхода над традиционными. Эта книга — наверное, самая сложная в подборке. Относиться к ней стоит как к серьезному учебнику, для «общения» с которым необходимо понимать базовые математические методы, концепции теории вероятностей и статистики.

Обмен опытом, личные мнения
Блог дата-сайентиста с дипломом физика. Блог ведет физик, который публиковался в журнале Nature. Последние несколько лет он делится опытом анализа данных: хотя последний пост на сайте датирован октябрем 2025 года, до этого момента материалы выходили регулярно — в некоторые месяцы автор мог опубликовать до семи заметок. Например, одна статья посвящена байесовскому подходу к А/Б-тестированию. В ней аналитик опровергает миф о том, что при использовании этого метода можно в любой момент остановить тестирование, чтобы оценить промежуточные результаты. Автор ставит эксперимент, в ходе которого становится понятно, что частые «подглядывания» приводят к появлению ложных результатов.
Locally Optimistic. Блог был основан в 2018 году группой американских дата- и бизнес-аналитиков, работающих в крупных облачных провайдерах. Посты выходят редко, но за пять лет авторы блога успели выпустить немало материалов — в том числе, с практическими советами. Так, одна статья рассказывает, как находить боли бизнеса с помощью данных. Автор предлагает использовать шаблон, который позволяет выявить ценность продукта для клиента.
Многие материалы также посвящены командной работе. Автор одной из статей разбирает так называемый фактор лотереи (или «фактор автобуса») — риск того, что ключевой сотрудник, не успевший передать знания коллегам, может внезапно выпасть из проекта, и команда окажется в уязвимом положении. Специалист отмечает, что исключить такой риск нельзя, поэтому важно заранее реализовать хранилище знаний.
morling.dev. Это — блог Гуннара Морлинга, разработчика открытого программного обеспечения из американской компании Confluent, который до этого десять лет проработал в RedHat. Спектр тем, на которые он пишет, обширен, но в основном они касаются аналитики, работы с данными, СУБД. Например, одна из последних статей посвящена инструменту Hardwood — новому парсеру формата данных Apache Parquet, де-факто ставшего стандартом для аналитики больших данных. В статье разработчик показывает, как использовать инструмент, объясняет, за счет чего удалось добиться высокой производительности.
Начать работу
Потрясающая бизнес-аналитика. Классическая awesome-подборка на GitHub, которую с этого года курирует канадский писатель и опенсорс-разработчик. В репозитории собраны материалы по ключевым концепциям бизнес-аналитики, а также широкий набор инструментов для разных рабочих сценариев. Внутри можно найти как решения для визуализации и дашбордов, так и инструменты для подготовки отчетности. Также есть список проектов с открытым исходным кодом. Кроме того, по ссылке представлены гайды, туториалы и курсы.
Учебная программа и ресурсы по анализу данных. Это — учебное пособие от Microsoft, опубликованное в 2022 году. Занятия рассчитаны на месяц: каждому дню соответствует тема и задание. Внутри можно найти видеоматериалы, схемы, пояснения и шпаргалки в компактном виде. Курс начинается с изучения основ бизнес-аналитики, затем предлагает создать свой дашборд, изучить моделирование данных и проч. Есть и темы, посвященные шрифтам и выбору цветов в презентациях. В конце — проект для закрепления материала.
P.S. Предложенные в подборке книги, блоги и инструментарий помогут, если изучать аналитику данных самостоятельно. И это не первый материал в нашем блоге про обучение — до этого мы уже рассказывали, как проходило (и проходит) обучение банковских специалистов начиная с 18 века и заканчивая нашим временем.

