Обновить
64K+

Data Engineering *

Обсуждаем вопросы сбора и подготовки данных

92,27
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как выгрузить данные из 1С без разработки: три доступных способа

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели827

В 1С ежедневно накапливаются данные о контрагентах, номенклатуре, остатках, продажах, договорах и сотрудниках. Они нужны не только для учета: руководители используют их в дашбордах, аналитики — в BI-системах, а смежные сервисы — для обмена справочниками и показателями.

Сложность начинается в момент, когда данные требуется получить за пределами учетной системы. Иногда достаточно один раз сохранить список в Excel. В других случаях нужна обновляемая таблица или отчет с отборами и группировками. Разберем три способа, доступных без разработки отдельного решения.

Читать далее

Новости

ML‑датасет для Data Scientist: практический гайд по проверке качества данных перед обучением модели

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели7.2K

Даже хороший алгоритм не спасёт модель, если признаки приходят с нарушенной семантикой или содержат информацию из будущего. Одна лишняя колонка может поднять метрику на тестах и полностью исчезнуть в проде.

Разберём рабочий подход к валидации датасета: от контрактов схемы и проверки таргета до point‑in‑time корректности и фиксации артефактов, чтобы результаты обучения можно было воспроизвести и объяснить.

Разобрать проверки

ClickHouse: разбираем Dictionaries

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели5.8K

Привет, Хабр!

В этой статье разберём ещё один инструмент ClickHouse, который часто используется при обогащении данных и позволяет значительно ускорить выполнение тяжелых SQL-запросов с джоинами.

Читать далее

Агенты выполнили задачу. Почему тест всё равно провален?

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.5K

Допустим, у тебя есть несколько AI-агентов. Один разбирает тикет, второй меняет код, третий запускает тесты, четвёртый готовит релиз.

Задача закрыта, тесты зелёные, артефакт собран. Метрика success_rate показывает успех.

Можно праздновать?

Не обязательно. Агенты могли несколько раз выполнить одну работу, нарушить порядок операций, одновременно захватить общий ресурс или случайно добиться правильного результата через недопустимую последовательность действий.

Финальное состояние корректное. Процесс — нет.

Именно эту проблему пытается измерить CoCoBench — новый бенчмарк для проверки координации нескольких AI-агентов. Его разработали исследователи из Нанкинского университета, Tsinghua и AgiBot.

Главная идея исследования полезна далеко за пределами робототехники:

Насколько х**во?

Снова хороним BI. Из гроба стучит

Уровень сложностиСредний
Время на прочтение40 мин
Охват и читатели6.3K

BI снова хоронят: подключаем LLM к хранилищу и аналитики больше не нужны, деньги тратить на лицензии не нужно. По крайней мере, так выглядит обещание.

На практике дата-агент может написать корректный SQL, получить верные цифры и всё равно уверенно ответить не на тот бизнес-вопрос. Он путается в определениях метрик, теряет права пользователя, дорого ходит по кругу и иногда рассуждает хуже, когда ему дают больше времени.

Я разобрал свежие кейсы OpenAI, Anthropic и Hex: что действительно улучшает ответы, какие очевидные подходы уже провалились, из чего складывается реальная стоимость и как за шесть шагов проверить

Читать далее

Девопс-инженер и ИИ влетают в бизнес-задачи с двух ног

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели6.1K

209 тысяч наименований товаров в 150 представительствах записаны по-разному, а обычный join сопоставляет от силы 1% из них. Дата-инженер Дмитрий Дунаев на Вечерней школе Слёрма показал, как эту путаницу разгребли с помощью LLM, эмбеддингов и fuzzy-поиска, а заодно избавили менеджеров от звонков по 5 минут за штуку из бесконечного списка на обзвон.

Из 15 протестированных моделей нужный баланс критериев показала только одна. Какая именно и почему, разбираем в конспекте доклада вместе с чек-листом, когда агента строить стоит, а когда деньги лучше сэкономить.

Читать далее

Данные без противоречий. Форма данных рисунком

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели7.5K

Четвёртая часть цикла про TDCV2 — открытый конструктор тестовых данных, который я пишу сам.

Обычно форму случайных значений выбирают из списка: нормальное, экспоненциальное, ещё десяток. Нужного в списке может и не оказаться — суточный профиль нагрузки с двумя горбами разной высоты, разгон и торможение, датчик, у которого к вечеру растёт разброс. Собрать такое формулой вполне можно, вопрос только в цене: смесь распределений, подбор весов, десяток коэффициентов, смысл которых через неделю уже не вспомнишь.

А можно нарисовать. Генератор берёт SVG или скриншот графика, читает контур и раскладывает по нему значения. Нарисуете две линии вместо одной — получите коридор, и разброс тоже станет нарисованным. А поменяете смысл горизонтальной оси — та же картинка превратится в закон распределения. Формулу это не отменяет, просто для некоторых форм выходит заметно короче.

Читать далее

Тестовое задание на аналитика DWH: 4 задачи с разбором

Уровень сложностиСложный
Время на прочтение21 мин
Охват и читатели12K

В статье разбираем реальное тестовое задание на позицию аналитика DWH: четыре коротких SQL-запроса. Все синтаксически корректны, все дают верный результат на контрольных данных. И в каждом спрятана предпосылка, при нарушении которой цифры в витрине становятся неверными — без ошибок, без предупреждений, просто другие числа в отчёте

Найти ошибки

Как я собрала Customer 360 с нуля и что поняла про analytics engineering

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели5.7K

У банков и ритейлеров, с которыми я работала, почти всегда одна и та же боль: данные о клиенте размазаны по CRM, core-banking и платёжным системам, и никто не может ответить на простой вопрос — а что мы вообще знаем об этом клиенте прямо сейчас. Чтобы попрактиковаться в решении этой задачи и показать подход публично, я собрала pet-проект: end-to-end пайплайн, который строит единую витрину Customer 360 из синтетических данных.

Сразу оговорюсь: все данные генерируются локально скриптом и полностью синтетические. Кода или данных работодателя в проекте нет — это самостоятельная реализация архитектуры, которую я использую в повседневной работе DWH/data-аналитика.

Читать далее

MCP-инструменты научились возвращать интерфейс: разбираем OpenSearch MCP Apps

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели9.3K

Обычный MCP-инструмент возвращает агенту текст или структурированные данные. Агент анализирует результат и пишет тебе что-то вроде:

Глубже

Автономность ИИ‑агентов в аналитике: сопротивляющаяся среда

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели9.2K

В предыдущей статье я писал, что уровень автономности ИИ-агента слабо связан с тем, насколько умной кажется модель. Способность системы обнаруживать ошибки задает верхнюю границу автономности. А стоимость необнаруженной ошибки и возможность отката определяют, насколько близко к этой границе можно подойти.

Для проверки я использую четыре типа контролеров: от полностью автоматических O3, где результат можно проверить механически, до O0, где остается человеческое решение. При этом наличие проверки само по себе ничего не гарантирует - важна ее реальная сила: охват, надежность, устойчивость и независимость. Эту модель я называю градиентом автономности.


Теперь попробуем применить ее к данным и аналитике

Читать далее

«Я собрал приложение за выходные». Почему вайбкодинг в проде опаснее, чем кажется

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели27K

«Я собрал приложение за выходные». Почему вайбкодинг в проде опаснее, чем кажется.

Где заканчивается прототип и начинается инженерия, почему «работает у меня» не равно «готово для бизнеса» и за что на самом деле платят опытной команде.

Читать далее

Как превратить LLM‑разметку в универсальный Spark‑пайплайн

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели6.4K

TL;DR: мы сделали llm_markup — Spark-приложение для массовой обработки данных через LLM API в существующем Airflow-контуре. Источник данных, промпт, формат ответа, лимиты и целевая таблица задаются конфигурацией. Инструмент берет на себя батчинг, распределение запросов, контроль нагрузки на API, валидацию ответов и сопоставление результата с исходными строками.

Меня зовут Дима Иванов, я дата-инженер в Lamoda Tech. Я работал над llm_markup и в этой статье расскажу, как мы пришли к его архитектуре и какие задачи пришлось решить, чтобы инструмент стабильно работал в продакшене. Разберем это на двух примерах: оценке качества поиска и классификации негативных отзывов.

Читать далее

Ближайшие события

Данные без противоречий. Справочники

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели5.7K

Четыре фамилии, четыре специальности, четыре кабинета. Сколько разных врачей окажется в журнале на две тысячи строк? Шестьдесят четыре.

Генератор честно перебрал все сочетания, и большинства этих людей в клинике не существует: фамилия одного, специальность второго, кабинет третьего. Придраться при этом не к чему — каждое значение взято из правильного списка, любая проверка по полям проходит. Вылезет это позже и в стороне: в отчёте, который считает совсем другое.

Третья часть цикла про TDCV2 — открытый конструктор тестовых данных, который я пишу сам. Про то, что делать, когда несколько колонок описывают один и тот же объект и обязаны меняться только вместе.

Читать далее

Почему ML-модель получает неправильные признаки: Event Time, Watermarks и Apache Flink

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели5.3K

Представьте: вы разрабатываете антифрод-систему для банка. Пользователь совершает пять покупок подряд за пару минут. Все транзакции успешно попадают в Kafka, никаких ошибок, consumer lag почти нулевой, Flink работает стабильно.

Но модель выдачи решений получает на вход признак: transactions_in_10_minute_window = 3 Хотя по факту их было пять, а вместо вероятности мошенничества 0.91 она выдаёт 0.42.

Читать далее

Как перенести сертификаты и значки Databricks при смене работодателя

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели4.8K

Рынок ИТ нестабилен, и люди могут менять работодателей. Ваша предыдущая компания была партнером Databricks, и у вас был аккаунт в Databricks Partner Academy с сертификатами, значками и информацией о пройденных курсах. В новой компании у вас новый аккаунт, а ваши предыдущие достижения и сертификаты остаются в предыдущей компании. Оказывается, вам не нужно проходить все заново. Вы можете перенести всю свою историю.

Читать далее

Проверка теории улучшения результата LoRA файн‑тюнинга на «умных» слоях

Уровень сложностиСложный
Время на прочтение21 мин
Охват и читатели6.1K

При LoRA‑дообучении адаптеры обычно применяются ко всем слоям модели, хотя активность разных слоев во время обработки промпта заметно различается. Возникает вопрос: можно ли выбрать более «умные», активные слои для конкретной темы и получить прирост качества?

Проверил гипотезу на Qwen3-1.7B: воспроизвёл метод из статьи Act‑LoRA, добавил свою метрику по градиентам, статистически проверил устойчивость сигнала и получил результат, который многое объясняет о том, как на самом деле работает LoRA‑дообучение.

Читать далее

Data Lakehouse по‑русски: как не утонуть в болоте импортозамещения

Уровень сложностиПростой
Время на прочтение23 мин
Охват и читатели7.4K

Привет, Хабр!

Собрать Lakehouse на слайде несложно. Берём S3-совместимое хранилище, добавляем Iceberg, Spark, Trino, Kafka, Airflow и каталог данных. Получается современно, масштабируемо и архитектурно красиво. Гораздо сложнее сделать так, чтобы эта конструкция работала в определенных корпоративных сценариях. В статье попробуем отделить архитектурную концепцию от маркетинга и разобраться, как на самом деле идут проекты внедрения Data Lakehouse в России: какие решения доступны на рынке, какие проблемы платформа не решает, когда её внедрение имеет смысл и как выбрать подход к миграции.

Читать далее

Предзаказ на книгу: «Data integration. Объединение данных для улучшения процесса принятия решений»

Время на прочтение2 мин
Охват и читатели6.1K

Привет, Хаброжители! Совсем недавно мы открыли предзаказ на книгу:«Data integration. Объединение данных для улучшения процесса принятия решений». Мы хотим немного больше вам о ней рассказать.

Джей Бортен дает подробное практическое руководство по интеграции данных — от базовых понятий и терминологии до реального сквозного примера, который шаг за шагом превращает разрозненные источники в работающий конвейер на AWS, Qlik, Databricks и Confl uent. Независимо от того, разбираетесь ли вы в теме, впервые приступили к этой задаче или хотите систематизировать уже накопленный опыт, идеи и практические примеры Бортена помогут вам выстроить эффективную работу с данными в компании.

Читать далее

Теория и практика DWH: все виды SCD по Кимбаллу

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели12K

Разбор всех видов SCD (slowly changing dimensions) по Кимбаллу:
— от простого к сложному
— на примерах
— с цитатами Кимбалла

В конце обзора — заполненная шкала со всеми типами и подсказками

Читать далее
1
23 ...