Обновить
128K+

Big Data *

Большие данные и всё о них

139,35
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Почему база не видит ваш предагрегат

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели4.1K

Инженеры данных построили агрегат — маленькую таблицу «продажи по магазинам по дням». Отчёт из неё собирается за доли секунды. А сводная в Excel всё равно ждёт двадцать секунд и читает миллиард строк.

Разбираемся на живом ClickHouse, почему база не видит предагрегат, который для неё построили, какая форма запроса это лечит (одна и та же для ClickHouse, Snowflake и BigQuery) и почему в итоге вопрос не к базе, а к семантическому слою. Внутри — замер на миллиарде строк: 3 секунды против 37 миллисекунд, сравнение восьми баз и одно правило, которое стоит проверить в своём BI.

Читать далее

Новости

От обновлённого ранкера до алгоритма Брезенхема: что дало + 11% ко времени в ленте ВКонтакте в 2026 году

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.3K

Привет! Это Степан Малькевич, руководитель группы рекомендаций ленты ВКонтакте (AI VK).

За прошедшие месяцы 2026 года время в ленте выросло на 11%. За этими цифрами — серия изменений, каждое из которых сделало свой вклад в рост метрик. Сейчас расскажу, что мы обновили и что из этого вышло.

Читать далее

Как мы научили ML предсказывать смерть насоса за 60 дней и выяснили, что все время чинили не то (часть 1)

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели6.1K

Насос на НПЗ ломался каждые три месяца. Ремонтники меняли подшипники, но проблема возвращалась. Мы предложили не просто мониторить вибрацию, а найти скрытую причину в данных. Результат превзошел ожидания: 60 дней упреждения и неожиданный виновник поломки. Рассказываем, как это было и почему модель — это только 20% успеха.

Узнать, почему чинили не то

ИИ‑агент спешит на помощь: как мы автоматизировали более 70% рутины аналитика и увеличили эффективность команды

Время на прочтение11 мин
Охват и читатели5.8K

Привет! Меня зовут Дмитрий Гаврилов, я руководитель центра компетенции аналитики в MWS. Моя команда внедряет ИИ-скиллы в работу дата-аналитиков. Мы посмотрели на типичный рабочий день и поняли: рутина съедает до 75% времени аналитика. А можно ли это передать ИИ-агенту без потери качества? Эту гипотезу проверили на реальных задачах и получили конкретные результаты — делюсь в этом материале.

Читать далее

Действительно ли Вселенная расширяется? Анализ спектра квазара после 2 миллиардов световых лет пути

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели9.7K

Вселенная постоянно меня удивляет тем, что здесь на Земле нет ничего постоянного — облака в небе в следующую секунду уже другой формы, а птенцы, едва вылупившись, уже через несколько недель становятся взрослыми птицами и навсегда покидают гнездо. Все меняется настолько стремительно, что кажется, и в космосе так же. Но нет, всякий раз, когда я получаю спектр звезды и вижу ее линии водорода неизменно на одних и тех же позициях, я удивляюсь: неужели свет не встречает на своем пути ничего, что может его изменить, там действительно так пусто?

Например, от Бетельгейзе свет идет около 600 лет, но в любой день сними ее спектр — линии на своих местах. А если взять объект за миллиарды световых лет от Земли, что покажут фотоны? Ученые говорят, на таком расстоянии длина волны света сильно растянута из‑за расширения пространства и линии смещены в красную зону спектра.

Мне захотелось проверить это самой. Что из этого вышло, я расскажу ниже, и забегая вперед, скажу, что спектр меня удивил. А начну с любопытной предыстории.

Читать далее

Агенты выполнили задачу. Почему тест всё равно провален?

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.8K

Допустим, у тебя есть несколько AI-агентов. Один разбирает тикет, второй меняет код, третий запускает тесты, четвёртый готовит релиз.

Задача закрыта, тесты зелёные, артефакт собран. Метрика success_rate показывает успех.

Можно праздновать?

Не обязательно. Агенты могли несколько раз выполнить одну работу, нарушить порядок операций, одновременно захватить общий ресурс или случайно добиться правильного результата через недопустимую последовательность действий.

Финальное состояние корректное. Процесс — нет.

Именно эту проблему пытается измерить CoCoBench — новый бенчмарк для проверки координации нескольких AI-агентов. Его разработали исследователи из Нанкинского университета, Tsinghua и AgiBot.

Главная идея исследования полезна далеко за пределами робототехники:

Насколько х**во?

Снова хороним BI. Из гроба стучит

Уровень сложностиСредний
Время на прочтение40 мин
Охват и читатели6.6K

BI снова хоронят: подключаем LLM к хранилищу и аналитики больше не нужны, деньги тратить на лицензии не нужно. По крайней мере, так выглядит обещание.

На практике дата-агент может написать корректный SQL, получить верные цифры и всё равно уверенно ответить не на тот бизнес-вопрос. Он путается в определениях метрик, теряет права пользователя, дорого ходит по кругу и иногда рассуждает хуже, когда ему дают больше времени.

Я разобрал свежие кейсы OpenAI, Anthropic и Hex: что действительно улучшает ответы, какие очевидные подходы уже провалились, из чего складывается реальная стоимость и как за шесть шагов проверить

Читать далее

Девопс-инженер и ИИ влетают в бизнес-задачи с двух ног

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели6.3K

209 тысяч наименований товаров в 150 представительствах записаны по-разному, а обычный join сопоставляет от силы 1% из них. Дата-инженер Дмитрий Дунаев на Вечерней школе Слёрма показал, как эту путаницу разгребли с помощью LLM, эмбеддингов и fuzzy-поиска, а заодно избавили менеджеров от звонков по 5 минут за штуку из бесконечного списка на обзвон.

Из 15 протестированных моделей нужный баланс критериев показала только одна. Какая именно и почему, разбираем в конспекте доклада вместе с чек-листом, когда агента строить стоит, а когда деньги лучше сэкономить.

Читать далее

Как я собрала Customer 360 с нуля и что поняла про analytics engineering

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели5.8K

У банков и ритейлеров, с которыми я работала, почти всегда одна и та же боль: данные о клиенте размазаны по CRM, core-banking и платёжным системам, и никто не может ответить на простой вопрос — а что мы вообще знаем об этом клиенте прямо сейчас. Чтобы попрактиковаться в решении этой задачи и показать подход публично, я собрала pet-проект: end-to-end пайплайн, который строит единую витрину Customer 360 из синтетических данных.

Сразу оговорюсь: все данные генерируются локально скриптом и полностью синтетические. Кода или данных работодателя в проекте нет — это самостоятельная реализация архитектуры, которую я использую в повседневной работе DWH/data-аналитика.

Читать далее

MCP-инструменты научились возвращать интерфейс: разбираем OpenSearch MCP Apps

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели9.4K

Обычный MCP-инструмент возвращает агенту текст или структурированные данные. Агент анализирует результат и пишет тебе что-то вроде:

Глубже

Нейроранжирование. Отказ от бустинга в пользу нейросетей

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели9.3K

Привет! Меня зовут Михаил Трапезников, я руководитель группы рекомендательных технологий в AI VK.

В одной из прошлых статей мы рассказали, как устроен нейропрофиль пользователя в рекомендациях VK. Обновление стало фундаментом для нового подхода к ранжированию. Сегодня расскажем о том, как нам удалось перейти от бустинга к нейросетям и как устроена архитектура нейроранкера. 

Читать далее

Как превратить LLM‑разметку в универсальный Spark‑пайплайн

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели6.4K

TL;DR: мы сделали llm_markup — Spark-приложение для массовой обработки данных через LLM API в существующем Airflow-контуре. Источник данных, промпт, формат ответа, лимиты и целевая таблица задаются конфигурацией. Инструмент берет на себя батчинг, распределение запросов, контроль нагрузки на API, валидацию ответов и сопоставление результата с исходными строками.

Меня зовут Дима Иванов, я дата-инженер в Lamoda Tech. Я работал над llm_markup и в этой статье расскажу, как мы пришли к его архитектуре и какие задачи пришлось решить, чтобы инструмент стабильно работал в продакшене. Разберем это на двух примерах: оценке качества поиска и классификации негативных отзывов.

Читать далее

Как перенести сертификаты и значки Databricks при смене работодателя

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели4.9K

Рынок ИТ нестабилен, и люди могут менять работодателей. Ваша предыдущая компания была партнером Databricks, и у вас был аккаунт в Databricks Partner Academy с сертификатами, значками и информацией о пройденных курсах. В новой компании у вас новый аккаунт, а ваши предыдущие достижения и сертификаты остаются в предыдущей компании. Оказывается, вам не нужно проходить все заново. Вы можете перенести всю свою историю.

Читать далее

Ближайшие события

RAG в медицинской аналитике: как построить управляемый контур вместо очередного чат‑бота

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели8K

Медицинская организация одновременно работает с электронными медицинскими картами, результатами исследований, врачебными заключениями, клиническими рекомендациями, внутренними регламентами, отчётностью и аналитическими витринами. Проблема состоит не только в объёме информации. Эти данные имеют разную структуру, обновляются с разной скоростью и доступны разным группам пользователей.

BI-система хорошо показывает показатель и его изменение, но обычно не отвечает на вопросы, какие документы связаны с отклонением, что происходило с конкретным процессом и на какие источники опирается объяснение. Большая языковая модель умеет формулировать связный ответ, но без контролируемого контекста может использовать устаревшие сведения, смешивать факты и правдоподобные предположения.

Здесь появляется RAG, или Retrieval-Augmented Generation. Но в медицинской среде я бы рассматривал его не как чат-бота и тем более не как автономного медицинского советника. Более полезная модель - управляемый слой между данными, документами, аналитическими системами и пользователями.

Читать далее

Выбор Kafka UI: сравнение популярных инструментов для Apache Kafka от VK Data Platform

Время на прочтение12 мин
Охват и читатели9.6K

Apache Kafka — популярная система потоковой обработки событий, предназначенная для сбора, хранения и передачи больших объемов данных в режиме реального времени. Она используется тысячами компаний и разработчиков для построения высокопроизводительных, отказоустойчивых и масштабируемых решений в области аналитики данных, IoT, микросервисов и многих других сфер.

Однако у Kafka есть один важный нюанс: «из коробки» у нее нет графического интерфейса (GUI), что затрудняет понимание текущего состояния кластера, диагностику неполадок и эффективное управление инфраструктурой и самим сервисом, особенно для начинающих пользователей или тех, кому сложно взаимодействовать с консольными инструментами.

Поэтому для комфортной работы с Apache Kafka активно используются специализированные UI-инструменты. Например, ранее для облачного сервиса Managed Kafka от VK Cloud мы использовали Provectus Kafka UI, но в рамках развития сервиса решили заменить UI на более современный и функциональный.

Меня зовут Никита Суровегин. Я продукт-менеджер в команде VK Data Platform, VK Tech. В этой статье я расскажу, с чего мы стартовали, какие инструменты проанализировали и что выбрали в итоге.

Читать далее

Из Oracle в PostgreSQL одним INSERT: DuckDB как ETL без Oracle-клиента

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели8K

Когда говорят о DuckDB, обычно вспоминают аналитику: локальные запросы к Parquet, быстрые агрегации, ноутбуки. Но у него есть свойство, к аналитике отношения не имеющее: он умеет соединять источник и приёмник данных внутри одного SQL-плана. С расширениями для Oracle и PostgreSQL перенос данных сводится к одному запросу — без Instant Client, без OCI, без Python и без промежуточных файлов. А если одной сессии Oracle мало, чтение разбивается на параллельные шарды, читающие один согласованный снимок по единому SCN.

Читать далее

Предзаказ на книгу: «Data integration. Объединение данных для улучшения процесса принятия решений»

Время на прочтение2 мин
Охват и читатели6.1K

Привет, Хаброжители! Совсем недавно мы открыли предзаказ на книгу:«Data integration. Объединение данных для улучшения процесса принятия решений». Мы хотим немного больше вам о ней рассказать.

Джей Бортен дает подробное практическое руководство по интеграции данных — от базовых понятий и терминологии до реального сквозного примера, который шаг за шагом превращает разрозненные источники в работающий конвейер на AWS, Qlik, Databricks и Confl uent. Независимо от того, разбираетесь ли вы в теме, впервые приступили к этой задаче или хотите систематизировать уже накопленный опыт, идеи и практические примеры Бортена помогут вам выстроить эффективную работу с данными в компании.

Читать далее

Теория и практика DWH: все виды SCD по Кимбаллу

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели12K

Разбор всех видов SCD (slowly changing dimensions) по Кимбаллу:
— от простого к сложному
— на примерах
— с цитатами Кимбалла

В конце обзора — заполненная шкала со всеми типами и подсказками

Читать далее

TrueForge: открытая обвязка, которая превращает LLM в полноценного агента

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели10K

Собрать демо-агента сегодня несложно. Подключаешь модель, добавляешь пару инструментов — и она уже читает файлы, вызывает API и бодро обещает выполнить любую задачу.

Сложности начинаются, когда такого агента нужно запустить в проде.

Кто будет хранить состояние между запросами? Как пережить перезапуск? Где выполнять сгенерированный код? Как не передать ему секреты? Когда запрашивать подтверждение пользователя? Что делать, когда контекст разрастается до сотен тысяч токенов?

Глубже

BACamp: как мы запустили школу бизнес‑анализа и что из этого вышло

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.2K

У нас было 14 лекцией и столько же практических семинаров, 100 заявок в первый день запуска, множество кейсов и теоретической базы всех цветов и размеров, 36 участников и 5 матёрых наставников, защита итоговых проектов. Не то, чтобы это был необходимый минимум для решения кадрового вопроса. Но если начал делать «Нешколу» для поиска бизнес-аналитиков – становится трудно остановиться. 

Привет, Хабр, на связи Мария и Александр из департамента бизнес-анализа в ecom.tech. В этой статье мы расскажем, как запустили открытую школу бизнес-анализа, не тратя ни рубля на маркетинг. Поехали!

Читать далее
1
23 ...