Apache *

Свободный веб-сервер

Статьи Посты Новости Авторы Компании

dp1976 5 сен 2023 в 09:25

Apache Ignite: как эта технология изменила подход к большим данным в Comindware

8 мин

3.5K

Блог компании ComindwareОблачные вычисления*Apache*Распределённые системы*

Вряд ли можно поспорить сегодня с аргументом, что скорость и эффективность обработки информации стали ключевыми факторами успеха любого цифрового проекта. При этом традиционные подходы к хранению и обработке данных уже не могут удовлетворить растущие потребности бизнеса и пользователей. Именно в этот момент на сцену выходит Apache Ignite — высокопроизводительная, распределенная платформа для вычислений в памяти. Рассказывает Александр Столяров, ведущий программист компании Comindware.

sshawnta 31 авг 2023 в 12:54

Как полностью устранить дублирующие записи в ClickHouse

Простой

4 мин

6.6K

Блог компании CloudMTSБлог компании МТСSQL*Apache*Data Engineering*

Обзор

Всем привет!

Меня зовут Валерий Локтаев, я backend-разработчик сервиса биллинга в CloudMTS.

В этой статье я расскажу, как насовсем убрать дублирующие записи в ClickHouse (CH). Логичный вопрос — откуда вообще взялась проблема? Можно взять движок таблицы ReplacingMergeTree, указать ORDER BY в качестве ключа дедупликации, и CH чудесным образом удалит все дубли в базе.

ReplacingMergeTree, безусловно, отличное решение. Но представьте, что ваша задача — сделать так, чтобы в таблице дубли никогда не появлялись, даже на несколько секунд.

Далее я расскажу, в каких случаях это необходимо и какое решение удалось подобрать.

Читать дальше →

+19

AlexChroot 25 авг 2023 в 17:15

1.0.BackupStorage на NixOS

Средний

15 мин

2.9K

Настройка Linux*Системное администрирование*PostgreSQL*Apache*Хранилища данных*

Туториал

Всем привет, меня зовут Алексей, являюсь IT‑инженером в одной из крупных компаний. Иногда включаю внутреннего авантюриста и ищу что‑то редкое и очень интересное.И в данной статье хочу поделиться стеком, который имеет право на жизнь.

Да и надеюсь, что информация для кого‑то будет интересна, как и для меня.

Если бы я раньше нашел такой туториал — быстрее бы разобрался со всеми нюансами.

alitenicole 24 авг 2023 в 17:00

Мы заглянули под капот Kafka и решили проблему потерянных сообщений

Простой

8 мин

11K

Блог компании СлёрмIT-инфраструктура*Apache*DevOps*

Перевод

Kafka — это масштабируемая, отказоустойчивая платформа для обмена сообщениями в реальном времени. Она позволяет обрабатывать миллионы сообщений в секунду. Однако некоторые ситуации приводят к потере событий. Например, Kafka требует хорошего стабильного сетевого соединения между клиентами и брокерами; если сеть нестабильна, это может легко привести к потере сообщений.

Команда разработчиков Trendyol Tech видоизменила архитектуру и решила эту проблему с помощью outbox-шаблона, но столкнулась с другой проблемой — дублированием событий. Приводим перевод статьи о том, как разработчики залезли под капот Kafka и нашли решение этих двух проблем.

serejkee 21 авг 2023 в 12:00

Apache Flink ML – прогнозирование в реальном времени

Средний

7 мин

Блог компании NeoflexПрограммирование*Java*Apache*

Туториал

Всем привет!

В этой статье рассмотрим применение библиотеки Apache Flink ML для построения конвейеров машинного обучения. Затем реализуем простой проект по прогнозированию поведения системы, а также ответим на вопросы: какие задачи Machine Learning подходят для Flink и какие особенности Flink делают его подходящим для использования в задачах Machine Learning.

neshkeev 15 авг 2023 в 06:06

Обработка больших и очень больших графов: Pregel

Средний

24 мин

1.4K

Алгоритмы*Apache*Распределённые системы*

Статья является продолжением предыдущей статьи в рамках цикла статей, посвященных обработке больших и очень больших графов. В статье реализованы распределенные версии четырех классических алгоритмов: "Связные компоненты", "Кратчайшее расстояние", "Топологическая сортировка" и PageRank на Apache Spark DataFrame API. Алгоритмы составлены в соответствии с идеями популярного фреймворка распределенной обработки графов Pregel.

MaxRokatansky 14 авг 2023 в 22:56

Доступ к потоковой передаче данных в режиме реального времени

10 мин

2.4K

Блог компании OTUSApache*

Перевод

Как Redpanda и Materialize — продукты, не основанные на JVM — делают потоковую обработку доступной для широких масс за счет снижения операционных издержек? Обсудим в статье.

alitenicole 14 авг 2023 в 15:16

Apache Spark 3.4 для Databricks Runtime 13.0

10 мин

1.3K

Блог компании СлёрмIT-инфраструктура*Apache*Big Data*Data Engineering*

Перевод

Databricks — это аналитическая платформа для облачных вычислений, работы с большими данными и машинного обучения. Компания разрабатывает data lake и работает с фреймворком Apache Spark. Приводим перевод статьи Databricks о нововведениях Apache Spark 3.4, который вошел в релиз Databricks Runtime 13.0.

atshaman 7 авг 2023 в 13:23

Что такое «хорошо» и что такое «плохо» в NiFi. Часть 3

Средний

9 мин

2.7K

Блог компании ЦифраSQL*Apache*Промышленное программирование*

Переносимость процессоров и паттерны

Вот и обещанная третья часть саги о том, что в NiFi можно делать и как это делать правильно, без претензий на истину в последней инстанции, конечно. Сегодня расскажу о переносимости процессоров и дам несколько паттернов для самых популярных задач на платформе ZIIoT. Если вдруг вам интересно почитать про оптимизацию схем и производительности в NiFi — велком в первую часть. Если мечтаете узнать больше о мониторинге, то вторая часть — must read. Только потом сюда не забудьте вернуться.

Marmaksmark 31 июл 2023 в 10:09

Ивентная модель данных с использованием Kafka и Kafka Connect: Построение гибкой и распределенной архитектуры

Средний

16 мин

7.4K

Программирование*Java*IT-инфраструктура*Apache*DevOps*

Туториал

Привет, Хабр! В наше время при постоянном росте объемов данных и необходимостью более быстрой и надежной обработки информации, мы сталкиваемся с требованием к эффективному обмену и синхронизации данных между различными системами. Отслеживание и обработка данных в реальном времени стало жизненно необходимым для современных приложений.

В этой статье мы рассмотрим, как Kafka Connect – мощный инструмент из экосистемы Apache Kafka – приходит на помощь при решении сложной задачи синхронизации данных между базами данных. Мы рассмотрим, как используя Kafka Connect, мы можем эффективно следить за изменениями в одной базе данных, обрабатывать их в нашем Java приложении и мгновенно записывать их в другую базу данных, обеспечивая надежность и безопасность данных.

Построим гибкую и масштабируемую архитектуру, которая позволит нам забыть о проблемах связанных с несогласованными данными и наслаждаться мгновенным доступом к актуальной информации для наших бизнес-процессов.

MaxRokatansky 16 июл 2023 в 09:08

Аутентификация клиента Kafka SSL в мультитенантной архитектуре

6 мин

Блог компании OTUSApache*

Перевод

Apache Kafka является ключевым продуктом не только для преобразования сообщений, но и при обработке данных в реальном времени, а также для многих других случаев использования. Архитектуры, размещенные в облаке, утверждают, что они безопасны с точки зрения коммуникации и обеспечения общей безопасности. Но когда дело доходит до частого взаимодействия клиента/потребителя с сервером/производителем, Kafka обеспечивает встроенную поддержку SSL, а также пользовательскую аутентификацию. В этой статье мы шаг за шагом настроим такой механизм аутентификации.

rvishnevsky 13 июл 2023 в 14:55

Градиентный бустинг: как подобрать гиперпараметры модели в 5 раз быстрее, чем обычно?

Сложный

36 мин

3.8K

Блог компании РосбанкData Mining*Apache*Big Data*Data Engineering*

Туториал

В этой статье я расскажу, как, используя недокументированные возможности фреймворка Apache Spark, качественно подобрать гиперпараметры для модели градиентного бустинга всего за один человеко-день вместо обычных пяти.

alexandergolovnya 12 июл 2023 в 22:23

Потоковая обработка данных с помощью Kafka Streams: архитектура и ключевые концепции

Средний

23 мин

23K

Программирование*Java*Apache*Распределённые системы*Data Engineering*

Из песочницы

При реализации потоковой обработки и анализа данных может возникнуть необходимость агрегирования записей для объединения нескольких независимых поток данных или обогащения какой-либо модели данных. Для этой цели может использоваться Kafka Streams, которая позволяет выполнять обработку данных в режиме реального времени.

В этой статье мы рассмотрим основные компоненты Kafka Streams и теоретические аспекты их использования. Мы будем использовать последние версии технологий, доступных на сегодня: Kafka 3.4.0 и Java 17 в качестве языка программированию. Для снижения входного порога мы будем использовать только нативные возможности Kafka и Kafka Streams, и не будем рассматривать решения с использованием различных фреймворков вроде Spring.

+13

tendoo 4 июл 2023 в 10:41

Как Flink Table API упрощает разработку

8 мин

1.2K

Блог компании NeoflexПрограммирование*Scala*Apache*

Туториал

Apache Flink является популярным фреймворком для обработки больших данных и аналитики в режиме реального времени. Одним из ключевых компонентов этого фреймворка является Table API, который предоставляет удобный и выразительный способ работы с данными в формате таблиц, аналогичный SQL.

Если вы разработчик, который хочет узнать больше о том, как использовать Apache Flink Table API для обработки потоковых данных, или если вы интересуетесь современными инструментами аналитики данных, эта статья для вас.

atshaman 26 июн 2023 в 19:22

Что такое «хорошо» и что такое «плохо» в NiFi. Часть 2

Простой

5 мин

2.4K

Блог компании ЦифраApache*Хранилища данных*

Мониторинг

Продолжаем разговор о том, что в NiFi делать можно и нужно, а что можно, но лучше не стоит. Если вы пропустили первую часть разговора, то вам сюда. Там про улучшение читаемости схем и повышение производительности (ну почти). Здесь же пойдет речь о том, как проводить мониторинг бизнес-части схемы, чтобы всем было хорошо (ну или чтобы не было плохо), ну и немного о переносимости процессоров. Поехали!

Есть мнение, что хуже всего — не вести мониторинг бизнес-части схемы совсем, используя популярный подход «и так сойдет!». Но если подумать, есть одна вещь хуже отсутствия мониторинга — неправильный мониторинг.

alekseyolg 15 июн 2023 в 10:00

Apache Airflow в связке с Kubernetes

Сложный

5 мин

Блог компании OkkoPython*Apache*DevOps*Data Engineering*

Туториал

Привет! Меня зовут Алексей Карпов, я DevOps-инженер (MLOps) отдела ML разработки в OKKO. Хочу поделиться опытом в работе с Apache Airflow в связке с Kubernetes. Расскажу, как установить Airflow в Kubernetes, настроить автоматическую синхронизацию DAG'ов с удалённым репозиторием, а также как отладить его работу. Всё это — на примере запуска простейшего DAGа.

akakunin 31 мая 2023 в 14:08

Консолидация отображения данных с использованием протокола OData

Средний

5 мин

1.2K

Java*Apache*

Кейс

Появилась у нас тут задачка, вывести на портале Incomand данные из разных подсистем (1С, Тезис…) . Конечно можно было бы написать плагины, каждый из которых слазил бы в подсистему, получил данные и показал их на портале - НО - мы бы получили p2p и спагетти, порталу пришлось бы разбираться с форматами и протоколами работы каждой системы….

Marmaksmark 31 мая 2023 в 13:53

Работа Apache Kafka на примерах. Поднимаем Kafka Cluster используя docker-compose

Средний

11 мин

46K

Программирование*Java*IT-инфраструктура*Apache*

Из песочницы

В этой статье продемонстрирую и объясню работу Kafka, используя как можно меньше определений и больше практики. Мы рассмотрим 3 сценария работы с Kafka. Для последнего сценария мы поднимем Kafka Cluster в Docker и с помощью UI увидим, как происходит общение между сервисами.

gongled 31 мая 2023 в 12:05

Kafka за 20 минут. Ментальная модель и как с ней работать

Средний

19 мин

74K

Блог компании СберМаркетIT-инфраструктура*Apache*Хранение данных*Микросервисы*

Туториал

✏️ Технотекст 2023

Привет! Меня зовут Глеб Гончаров, и я руковожу подгруппой ИТ-инфраструктуры в СберМаркете. В работе мы широко используем Kafka как шину данных для микросервисов и не раз убедились на практике, что к инструменту важно подобрать правильный подход. Об этом сегодня и поговорим в двух частях — сначала обсудим основы, а в конце статьи будет ссылка на практические задания.

+41

k0p4en 23 мая 2023 в 11:48

Как мы распиливаем монолит без даунтайма

Средний

7 мин

2.9K

Блог компании CloudMTSPostgreSQL*Администрирование баз данных*Apache*Микросервисы*

Кейс

Всем привет!

На связи Михаил, и я продолжаю делиться историями про рефакторинг одного из сервисов облачной платформы #CloudMTS. В прошлый раз я рассказывал о том, как мы аккуратно раскладывали по папочкам код в соответствии с принципами чистой архитектуры. Сегодня поговорим о решении, которое позволяет нам распиливать монолит по кусочкам без простоев.

Вместо дисклеймера

Переход от монолита к микросервисной архитектуре — задача непростая. Особенно когда приложение уже в продуктиве. Пускаться в эту историю, потому что микросервисы — это стильно и молодежно, плохая затея. Стартуйте только тогда, когда преимущества трансформации будут очевидны и перевесят возможные издержки.

Наши причины перехода были следующими:

В монолите концентрировалось большое количество бизнес-процессов, которые охватывали сразу несколько потребителей: пользователей облачной платформы, сейлз-менеджеров (через CRM-систему), администраторов, обработчиков метрик. Получилась такая одна большая точка отказа сразу для 4 групп бизнес-процессов.
Каждый бизнес-процесс потребляет свой объем ресурсов. Например, для обработки метрик нужно 5 подов (чтобы запараллелить и ускорить обработку), для администрирования хватит и одного. Так как у нас все в одном сервисе, при масштабировании монолита мы будем ориентироваться на самый «прожорливый» бизнес-процесс. Часть ресурсов будет просто простаивать.
Хотелось добиться гранулярности, чтобы независимо писать и деплоить код для каждого бизнес-процесса. И не переживать, что какие-то изменения в одном бизнес-процессе неожиданно отрикошетят в соседний.

Читать дальше →

+11

1 2

4 5 ...

17 18

Apache *

Apache Ignite: как эта технология изменила подход к большим данным в Comindware

Как полностью устранить дублирующие записи в ClickHouse

1.0.BackupStorage на NixOS

Мы заглянули под капот Kafka и решили проблему потерянных сообщений

Истории

Apache Flink ML – прогнозирование в реальном времени

Обработка больших и очень больших графов: Pregel

Доступ к потоковой передаче данных в режиме реального времени

Apache Spark 3.4 для Databricks Runtime 13.0

Что такое «хорошо» и что такое «плохо» в NiFi. Часть 3

Ивентная модель данных с использованием Kafka и Kafka Connect: Построение гибкой и распределенной архитектуры

Аутентификация клиента Kafka SSL в мультитенантной архитектуре

Градиентный бустинг: как подобрать гиперпараметры модели в 5 раз быстрее, чем обычно?

Потоковая обработка данных с помощью Kafka Streams: архитектура и ключевые концепции

Ближайшие события

Как Flink Table API упрощает разработку

Что такое «хорошо» и что такое «плохо» в NiFi. Часть 2

Apache Airflow в связке с Kubernetes

Консолидация отображения данных с использованием протокола OData

Работа Apache Kafka на примерах. Поднимаем Kafka Cluster используя docker-compose

Kafka за 20 минут. Ментальная модель и как с ней работать

Как мы распиливаем монолит без даунтайма

Вклад авторов