Статьи / Закладки / Профиль Vrt856 / Хабр

Apache Flink. Как работает дедупликация данных в потоке Kafka-to-Kafka?

20 мин

6.8K

Блог компании МТСJava*Big Data*Распределённые системы*Data Engineering*

Всем привет, меня зовут Александр Бобряков. Я техлид в команде МТС Аналитики, занимаюсь Real-Time обработкой данных. Мы начали использовать фреймворк Apache Flink, и я решил поделиться на Хабре своим опытом внедрения этой технологии в цикле статей.

В предыдущей части «Как использовать Spring в качестве фреймворка для Flink-приложений» я рассказывал, как реализовать минимальное Flink-приложение с использованием фреймворка Spring. Мы запустили первую Flink-задачу в поднятом в docker-compose кластере, а также проверили корректность результата по соответствующим логам. В этой статье решим реальную бизнес-задачу дедупликации данных в пайплайне Kafka-to-Kafka.

+14

Apache Flink. Как работает дедупликация данных в потоке Kafka-to-Kafka?

Информация

Специализация