Search
Write a publication
Pull to refresh
6
0
Андрей Кучеров @confident_action

Lead Data Engineer

Send message

Apache Spark Catalyst: секреты оптимизатора запросов, который должен знать каждый Data Engineer

Level of difficultyHard
Reading time17 min
Views5.1K

Привет Хабр! Меня зовут Кучеров Андрей и я Lead Data Engineer с более чем 7-летним опытом в области распределенной обработки данных. Я работал над оптимизацией высоконагруженных Spark-приложений в X5 Retail Group и билайн, где мы обрабатывали петабайтные объемы данных. Регулярно сталкиваясь с производительностью запросов, я убедился, что понимание работы Catalyst — необходимый навык для каждого Data Engineer, работающего со Spark.

Читать далее

Как Apache Spark читает файлы: механизмы, оптимизации

Level of difficultyHard
Reading time5 min
Views3.1K

Меня зовут Андрей Кучеров, и я Lead Data Engineer. Часть моей работы включает обучение команды. Я люблю делиться своим опытом, потому что в работе с данными мелочей не бывает - часто кажущиеся незначительными детали могут кардинально влиять на производительность всего пайплайна. Многие недооценивают важность правильного выбора форматов данных и тонкой настройки процессов чтения, а потом удивляются, почему их Spark-джобы работают медленно и потребляют слишком много ресурсов. Читаем далее что бы разобраться в теме ->

Читать далее

Комплексное руководство по конфигурации сервера для LLM

Level of difficultyMedium
Reading time7 min
Views5.8K

Развертывание языковой модели на собственном сервере требует тщательного планирования аппаратной составляющей. В этой статье мы разберем, какие компоненты критически важны для эффективной работы LLM, как они взаимодействуют, и какую конфигурацию выбрать под разные сценарии использования.

Читать далее

Information

Rating
Does not participate
Location
Москва, Москва и Московская обл., Россия
Date of birth
Registered
Activity

Specialization

Data Engineer, CTO
Lead
Spark
Apache Hadoop
Big data
Apache Airflow
ETL