Обновить
10
Горлова Наталья@de_natafka

Пользователь

4
Подписчики
Отправить сообщение

Спасибо за вопрос.

Я наверное еще отмечу, что у нас есть боевой инстанс airflow, про него я ответила выше. Есть песочница аналитиков - это отдельный инстанс, где аналитики могут сами собирать ad-hoc витринки и проверять гипотезы не влияя на бой. Есть тестовые инстансы airflow , которые поднимаются под задачи дата инженеров. Получилось достаточно удобно.

Привет!

На момент старта DWH действительно скопировали с Авито.

Сейчас у нас нет чистого волта. В 3 пункте я говорила, что есть элементы и возможность развития в волт. Сейчас больше 3НФ и только некоторые таблицы связей и атрибутов вынесены отдельно, так как есть сложные источники у который так проще хранить и обновлять данные.

На данный момент хранилище хорошо покрывает бизнес: все ключевые элементы загружены и используются аналитикой.

Привет! Отличный вопрос.
Я люблю airflow , но с генераций были проблемы. Технически у нас около 400 физических дагов , остальное генерятся из yaml конфигов. https://airflow.apache.org/docs/apache-airflow/stable/howto/dynamic-dag-generation.html

С генераторами мы ловили проблемы с тем, что даги пропадали и тригерный процесс не мог их найти и запустить. Оказалось , что шедулер не успевал за один проход обработать код всех дагов и не добавлял их в методанные БД.

Что делали :

1) увеличивали некоторые параметры

# Количество секунд, по истечении которых анализируется файл DAG.  Обновления в базах данных отображаются через этот интервал. 

AIRFLOW__SCHEDULER__MIN_FILE_PROCESS_INTERVAL: "480",

# Сколько времени пройдет до истечения тайм-аута DagFileProcessor, который обрабатывает dag-файл

AIRFLOW__CORE__DAG_FILE_PROCESSOR_TIMEOUT: "360"

# Частота (в секундах) сканирования директории с дагами на появление новых файлов. По-умолчанию 5 мин.

AIRFLOW__SCHEDULER__DAG_DIR_LIST_INTERVAL: "600",

# Планировщик может запускать несколько процессов параллельно для анализа групп данных

AIRFLOW__SCHEDULER__PARSING_PROCESSES: "40",

2) Разделяли по слоям генераторы и улучшали кодовую базу согласно рекомендациям, что помогло снизить нагрузку на шедулер https://airflow.apache.org/docs/apache-airflow/stable/best-practices.html

3) По ресурсам на текущий момент scheduler - 4 cpu, 8 ram airflow развернут в Kubernetes. У нас настроен автодеплой через CI/CD после мержа в мастер. Ежедневно проходит с десяток релизов)

На данный момент работает 1092 дага , которые запускаются почти все ежедневно.

Привет!
я не могу сказать за всех, но из своего опыта отмечу, что метод моделирования надо выбирать исходя их ваших требований , источников и ресурсов . В первую очередь нужно сформировать функциональные и не функциональные требования, оценить вектор развития аналитики и ограничения компании. Исходя из требований можно подобрать подходящую архитектуру.
Яндекс делал гибрид волта и якоря, например https://habr.com/ru/companies/yandex/articles/557140/
Архитектура дело творческое.

Привет! Спасибо за комментарий.
«Historia magistra vitae (история — учительница жизни)». В то время 2017-2019 компания больше разбиралась в операционной работе и аналитика только развивалась. Были выбраны решения, которые позволили стартануть аналитику и это хорошо. Были сделаны ошибки и мы их учли.
То что команда вышла на современный стек и смогла ,не останавливая работу аналитики, переехать на новое хранилище и инструменты, я считаю, это здорово.

Я согласна, что на рынок надо смотреть и надо брать лучшее. Сама часто посещаю конференции и смотрю на решения других компаний. Так же важно ориентироваться на возможности и требования твоей компании. Текущего решения для данного уровня аналитики было достаточно, дальше будет больше.

Про стратегию в СДЭК. Я могу отметить, что компания шагнула вперед. В СДЭК есть арх совет, есть стратегия на уровне компании. На стратегической сессии мы формировали вместе с CDO стратегию по развитию аналитики и дата платформы на 2025 год. Из хорошего в компании есть гибкость и мало бюрократии. Я напрямую работала с каждым в команде, мы вместе формировали решения , которые обсуждали на дизайн ревью.


Информация

В рейтинге
Не участвует
Зарегистрирована
Активность

Специализация

Инженер по данным
Ведущий
Git
Docker
SQL
Python
PostgreSQL
ООП
Базы данных
Разработка программного обеспечения
Алгоритмы и структуры данных
Объектно-ориентированное проектирование