Обновить
128K+

Big Data *

Большие данные и всё о них

131,58
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

У каждой системы своя правда. Кто решает, какая из них корпоративная?

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели9.4K

Корпоративную НСИ не всегда можно «сначала почистить», потому что иногда единого корпоративного объекта данных ещё нет. Разные системы могут содержать разные, но обоснованные части одного объекта. Тогда задача проекта – не выбрать самую удобную базу, а определить, где возникает каждый значимый факт, кто отвечает за его смысл, какой источник считается авторитетным и кто завершает спор. Эту неопределённость удобно разбирать через карту источников и ответственности за данные.

Читать далее

Новости

10 сайтов, где можно бесплатно учиться на курсах лучших университетов мира

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели11K

Не обязательно поступать в Harvard, Stanford или MIT, чтобы учиться по материалам этих университетов.

Собрала 10 платформ и университетских ресурсов, где можно найти бесплатные онлайн-курсы, лекции и учебные материалы.

Особенно рекомендую тем, кто хочет развиваться в AI / ML / Data Science, Computer Science или готовится к PhD.

Читать далее

Где искать темы и материалы для PhD в ML/AI: 10 бесплатных ресурсов

Время на прочтение3 мин
Охват и читатели6.2K

Если вы занимаетесь ML / AI, Computer Science или научными исследованиями, диссертации могут быть очень полезным источником идей для research.

🔬 Если вы занимаетесь ML/AI research — сохраните этот пост.

Здесь собрала 20 бесплатных ресурсов, где можно искать:

🎓 PhD-диссертации
🏆 архивы лучших ML/AI-конференций
📚 научные статьи
🧠 research ideas и research gaps
📊 datasets и новые направления исследований

Читать далее

Торговый бот за 60 минут: гайд с нуля без знаний программирования и рынка

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели13K

Перед тем как писать эту статью, я сделал небольшой ресёч: посмотрел, что уже есть на Хабре по разработке торговых ботов и гайдам в формате «с чего начать»

Одни слишком простые, другие заточенные на одну стратегию, не нашел чего-то такого, что было бы как минимальной базой для начала

Не учить одной конкретной стратегии, а собрать минимальный рабочий фреймворк, который можно взять за основу и дальше развивать под себя

Поэтому в статье мы с нуля соберём торгового бота, который умеет получать рыночные данные, принимать решение, выставлять заявку, проверять состояние позиции и фиксировать результат сделки

И да - всё это попробуем сделать примерно за 60 минут Вся необходимая информация будет здесь, никуда переходить не нужно - статья полностью самостоятельная

Спойлер: Собранный бот заработал за 5 минут 22 цента, сделки приложил в конце статьи, можно их проверить если сомневаетесь

Читать далее

Предиктивное обслуживание в промышленности: три системных условия, без которых технологии не работают

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.4K

Сотни миллиардов вложены в IIoT, предиктивную аналитику и цифровые двойники. Но часто проекты предиктивного ТОиР достигают технологического успеха — и операционного провала: модели верно прогнозируют отказы, а оборудование по-прежнему ремонтируют «по факту».

В статье разбираю три условия, без которых предиктивная диагностика не становится частью реальной работы.

Читать далее

Пишем свой Native Filter плагин для Apache Superset: пошаговый рабочий туториал

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.2K

Всем привет! Меня зовут Александр Цай, я ведущий инженер-аналитик в МТС Web Services.
Занимаюсь всем, что связано с данными и ИИ. Найти, заполучить, обработать, спроектировать, развернуть — это все ко мне.

Опущу все нудные подробности, решили мы развернуть себе Superset 6.1.0 — последнюю версию, но столкнулись с тем, что заказчику категорически не нравится штатный фильтр по датам и он не хочет пересаживаться со своего BI, а хочет он календарик. А еще — пару плагинов с оглядкой на PowerBI. Поэтому встал вопрос создания собственного плагина-фильтра.

Казалось бы, задача несложная. Пара-тройка гайдов в en сегменте имеется, есть даже документация и штатный генератор шаблонов. Но по факту оказалось, что все это не работает. Генератор так вообще не обновлялся аж с 2024 года: выдает шаблон, который ссылается на уже несуществующие классы и типы, что автоматически делает все гайды неактуальными…

А что все это значит? Время написать свой собственный!
Об этом и расскажу в сегодняшнем материале. 

Дисклеймер: Я питонист до мозга костей и в тайпскрипте, да и фронте в целом, понимаю не очень много. Простите меня, адепты сего языка программирования, но код самого плагина навайбкожен (хоть и проверен насколько я смог).
В npm не запушил тоже умышленно, цель статьи дать исходники и показать, как можно собрать плагин. Любой желающий может что-то додумать и доработать, собрать или разобрать и так далее.

Читать дальше

Почему Илону Маску не удается создать по-настоящему правдивую нейросеть?

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.2K

Илон Маск как одержимый выпускает на рынок все новые модели своей нейронной сети Grok, и 12 августа уже стала доступной версия 4.6, но, хотя он постоянно подчеркивает, что его детище является максимально правдивым ИИ, правдивость ответов Grok в некоторых случаях не обеспечивает. Это не случайно – в модели содержится принципиальный дефект – она не владеет научными правилами отличия правды от лжи и заблуждений. Чтобы исправить этот дефект, к алгоритмам обучения SFT и RL следует добавить новый – НРД.

Несколько лет назад Илон Маск захотел создать альтернативу ChatGPT – нейросеть TruthGPT, в которой упор был бы сделан на поиск правды, однако что-то пошло не так, и у него получилась в 2023 году нейросеть Grok, у которой из-за минимальной цензуры существует значительный риск воспроизведения непроверенных данных, поэтому ее пользователям рекомендуют обязательно проверять факты.

Тем не менее, сам Илон Маск постоянно подчеркивает, что его детище является максимально правдивым ИИ, даже если эта истина иногда противоречит общепринятой точке зрения или политкорректности. Да и название нейросети, которое взято из романа Роберта Хайнлайна «Чужак в чужой стране», там использовалось в смысле интуитивного, глубинное понимание чего-либо. То есть претензии на правду остались, несмотря на другое название.

Маск считает, в частности, что другие нейросети содержат скрытые элементы идеологии разнообразия, равенства и инклюзивности (DEI), а это представляет серьезную угрозу, так как ИИ может из-за этого принимать неверные решения. Например, если ИИ научить, что разнообразие является единственным приемлемым результатом, то нейросеть может сказать, что у власти слишком много белых парней, и их надо просто казнить. А если, допустим, запрограммировать ИИ думать, что неправильное определение пола – это худшее, что может произойти, тот, чтобы гарантировать, что неправильное определение пола никогда не произойдет, решит просто уничтожить всех людей, так как это сведет к нулю  вероятность неправильного определения пола.

Читать далее

TabFM против XGBoost: 5 фактов, которых нет в релизе

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели11K

TabFM умеет получать предсказания по таблицам без обучения на конкретном датасете — и на бенчмарках уже обходит настроенный бустинг. Разбираемся, насколько убедительны эти результаты, где у модели заканчивается преимущество и что изменится для тех, кто держит табличный ML в проде.

Читать далее

AI‑дайджест #3

Время на прочтение6 мин
Охват и читатели5.4K

Друзья, всем привет! На связи Ольга Попова, ИИ-Евангелист Лаборатории искусственного интеллекта Департамента больших данных Россельхозбанка. Я подготовила новый дайджест новостей про ИИ. Поехали!

Anthropic выпустила Claude Opus 5, OpenAI обновила модель по умолчанию в ChatGPT до GPT-5.6 Luna,  Alibaba выпустила Qwen3.8-Max, китайская MiniMax разрабатывает открытую модель с 2,7 трлн параметров и не только!

Больше новостей про ИИ

От CTR до сделок: как в Авито устроены ML‑модели монетизации

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели8.4K

Всем привет! Меня зовут Алина Бабенко, я acting DS-менеджер в Авито. Наша команда занимается моделями монетизации в поиске и рекомендациях: мы оцениваем ожидаемую выручку от действий пользователей и используем её в ранжировании. В этой статье я расскажу, какие модели используем для расчёта ожидаемой выручки, как оцениваем их качество, а также зачем корректируем ставки.

Материал будет полезен дата-сайентистам и тимлидам, которые работают с монетизацией на маркетплейсах и в сервисах для объявлений.

Читать далее

Книга: «Современная бизнес-аналитика. Увеличьте ценность данных с помощью Python и R»

Время на прочтение2 мин
Охват и читатели6.8K

Привет, Хаброжители! Извлечение ценности из данных — сложный процесс. Чтобы превратить данные в информацию, бизнес-аналитик должен уметь работать с различными технологиями, включая базы данных, языки программирования и коммерческие аналитические инструменты.

Преодолейте разрыв между миром технологий и бизнеса. Сосредоточьтесь на развитии необходимых навыков с помощью R и Python на примерах из реальной жизни. Узнайте, какие методологии стоит использовать для успешной реализации проектов.

Читать далее

Как за 5 недель построить рекомендательную систему в TravelTech: Kafka и MongoDB вместо Feature Store

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.1K

Привет! Меня зовут Кристина, я MLOps-инженер в Туту. Занимаюсь тем, что помогаю рекомендательным системам добраться до прода со всеми компромиссами, горящими дедлайнами и новыми идеями. 

Эта статья — про один из таких запусков.

В идеальном ML-мире запуск рекомендаций выглядит примерно так: полгода проектируют хранилище признаков (Feature Store), настраивают, откуда и как берутся данные, гоняют тяжёлые расчёты фичей и моделей, а отдельная команда следит, не деградирует ли модель из‑за изменений в данных. 

В реальном бизнесе у тебя есть 5 недель до старта высокого сезона, два инженера, DS и задача: сделать так, чтобы пользователь, который купил билет, сразу увидел релевантный отель. Рассказываем, как мы собрали работающую RecSys v1 на привычном стеке: Kafka, MongoDB, ClickHouse. При этом мы сознательно отказались от перфекционизма ради скорости.

Инженерный вызов здесь не в масштабе и не в алгоритмах, а в контексте. Cross-sell в travel — это не «похожие товары». 

Пример

Пользователь купил билет Москва → Сочи на 10–17 июля: значит, нужно показать отели именно в Сочи, именно на эти даты. 

Коллаборативная фильтрация без контекста поездки — «похожие пользователи → похожие отели» — не знает ни город, ни даты, ни то, что заказ только что оплачен и его ещё нет в DWH. 

Нужен подход, где контекст конкретной поездки — куда, когда, с кем — задаётся явно до ранжирования.

«Правильный» путь —  Feature Store и полноценная ML-платформа, занял бы 4–6 месяцев. Бизнесу нужно было проверить гипотезу на живом трафике. Мы собрали v1 на том, что уже работало в проде, с некоторыми компромиссами и без иллюзий насчёт идеальной архитектуры. 

Читать далее

AI‑хакатон в GlowByte: как мы решали задачи для вымышленной розничной сети «МегаБайт»

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели7.2K

Всем привет! На связи команда BI‑практики GlowByte.

У нас прошел внутренний хакатон AI Seasons. Он вдохнул жизнь в корпоративное обучение и дал участникам ощутимую бизнес‑ценность. Хочу поделиться этим опытом и подкинуть вам идею для масштабирования истории у себя. Ниже расскажу подробно, а пока вкратце опишу основную идею, как это реализовали у нас в GlowByte.

Итак, мы взяли вымышленную розничную сеть «МегаБайт» с сотнями магазинов и миллионами заказов. Поставили перед командами задачу реализовать DWH/BI‑кейс, решать задачки нужно было с помощью ИИ. На старте участвовали 28 команд, до финиша добрались три: было по‑спортивному напряжённо, горячо и энергично, так что не все смогли потянуть битву в таком темпе.

Под катом я расскажу:

— как устроен наш хакатон;
— как оценивались задания;
— какие ошибки мы допустили;
— что было ценного и что мы уже забираем в текущие рабочие процессы.

Будет здорово, если вам зайдет тема и организуете подобный «боевик» для специалистов у себя. Потом обязательно поделитесь в комментариях! 

Читать далее

Ближайшие события

От 12 часов к 30 минутам: как мы join’им миллиарды товарных движений в ClickHouse

Время на прочтение15 мин
Охват и читатели9.1K

Всем привет! Меня зовут Муса. Наша команда занимается витринами данных по товарному учёту.

Каждый день мы доставляем около 10 млрд записей в разных форматах. На этих данных строится различная аналитика, связанная с товарными запасами и движениями экземпляров. Перед нами встала задача: пять раз в день обогащать выгрузку из миллиардов экземплярных остатков дополнительными атрибутами для построения различного рода аналитики. История этих атрибутов уже измерялась десятками миллиардов записей.

Первое решение выглядело просто: положить данные в ClickHouse и сделать JOIN. Но одна выгрузка считалась около 12 часов, а нам нужно было укладываться в десятки минут.

В статье расскажу, про то, как мы смогли сократить время обработки примерно до 33 минут, про ключевой подход при работе с большими объёмами данных, а также попытаюсь донести важность локальности данных на примере реальной задачи.

Читать далее

Как вас обманывают биржи: большинство трейдеров думают, что торгуют на рынке

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели13K

Вы открываете Binance / Bybit / OKX и т.п., смотрите на график, нажимаете Buy и думаете, что только что купили актив на рынке

На самом деле вы сделали гораздо более интересную вещь: отдали заявку в чужую инфраструктуру, где профессиональные участники заранее знают, где стоит ликвидность, как устроен стакан и какие заявки сейчас находятся в очереди

И самое неприятное - вы почти всегда играете против участников, которые технически и информационно находятся на другом уровне

Спойлер: у вас нет шансов. Сейчас покажу почему на реальных примерах.

Если не хотите читать лонгрид — смело мотайте в конец статьи. Там коротко собрал главный вывод и что с этим делать, как получить преимущество над большинством трейдеров

Читать далее

Сжатие словаря. Языки из омонимов и хроматическое число

Время на прочтение14 мин
Охват и читатели8.3K

В естественном языке распространена ситуация, когда значение слова нельзя установить без контекста: «замок закрыли ключом», «замок окружён рвом».

С позиции здравого смысла кажется, что у каждой отдельной вещи должно быть своё отдельное имя, но, как видно на практике, в этом нет необходимости.

В языке существует способ упаковать несколько значений в одно слово-омоним. В этой работе мы сознательно отказываемся от однозначности слов. Будет представлен алгоритм, сжимающий словарь русского языка в десятки и сотни раз, используя раскраску графа.

Мы рассмотрим, насколько естественные языки поддаются такому сжатию, и посмотрим, как выглядят языки с максимальным числом омонимов.

Читать далее

Пилот дата-агента: шаблон брифа, приёмка по 50 вопросам и пять метрик, по которым его закрывают

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.6K

Привет, это команда BI GlowByte.

Это третий разбор материалов FanRuan про дата-агентов. В первом смотрели, чем агент отличается от ИИ-помощника. Во втором собрали чек-лист готовности данных. Сегодня говорим про людей и процесс. Основной тезис: инструмент купить несложно, сложно наладить путь от бизнес-задачи до работающего сценария.

Материал вендора при этом целиком управленческий: ни одной цифры, ни одного шаблона. Поэтому мы взяли его каркас (пять этапов пилота, владелец сценария, стартовая команда) и развернули в то, чего в оригинале нет. Что у нас получилось: шаблон брифа, процедура приёмки, точки проверки человеком и метрики, по которым через два месяца решают, оставлять сценарий или закрывать. Надеемся, что вам будет полезно.

Читать далее

Тихо неправильные данные хуже упавшего скрипта

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.4K

Скрипт, который упал, вы почините за пять минут. Скрипт, который отработал молча и выдал неправильный ответ, вы не почините никогда, потому что не узнаете, что он сломан.

В работе с FASTA и FASTQ таких мест неприлично много. Почти все они когда‑то были задуманы как удобство.

Вот три, с которыми я сталкивался чаще всего.

Первое. Инструмент пишет FASTQ, а качества у записи нет. Вместо ошибки он подставляет строку из I. Файл получается валидный, парсер доволен, а фильтр по качеству дальше по пайплайну видит идеальные риды и пропускает всё подряд.

Второе. R1 и R2 разъехались: один файл отфильтровали, второй забыли. На выходе абсолютно корректный FASTQ, просто риды спарены не с теми. Формат не нарушен ни в одном байте. Ни один валидатор не возразит.

Третье. Определение Phred‑кодировки по образцу, который одинаково хорошо подходит и под Phred+33, и под Phred+64. Инструмент молча выбирает вариант. Иногда правильный.

Общее у всех трёх одно: вместо ошибки вы получаете правдоподобный результат. И это худший из возможных исходов, потому что ошибку вы бы заметили.

Полгода назад я начал писать fastx, библиотеку и CLI для FASTA/FASTQ на Rust. Основное решение в ней сформулировано так: там, где можно либо угадать, либо признать неоднозначность, признавать неоднозначность.

Как это устроено

Пять дней ожидания: опыт длинных временных окон Kafka stream

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели8.9K

Иногда бизнес-логика выглядит просто: «соберём все данные за период и посчитаем итоговый результат». На практике этот период может оказаться не часом и даже не днём, а несколькими сутками. В одном из моих проектов требовалось построить агрегаты на основе данных, которые могли поступать в течение пяти дней.

В литературе мы встретили концепцию временных окон (Time Windows). По описанию это выглядело именно тем инструментом, который должен решить задачу: определить период ожидания, дождаться всех необходимых данных и получить итоговый агрегат.

Однако при работе с реальными потоками оказалось, что основная сложность заключается вовсе не в выборе размера окна. Главный вопрос оказался другим: существует ли вообще момент, после которого агрегат можно считать завершённым и больше никогда не изменять?

Узнать больше

Оцениваем шиномонтаж методом Симпсона, чтобы спасти автосервис от краха

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.3K

Что делать, если средний чек премиального автосервиса оказался в 4 раза меньше планового? Первое «очевидное» решение руководства — немедленно избавиться от дешёвой мелочёвки вроде сезонного шиномонтажа и хранения колес, которая перегружает мастеров и портит красивую статистику.

Звучит логично. Вот только глубокий дата-анализ показал, что такое «оптимизаторское» решение лишило бы компанию доброй трети валовой выручки.

В этой статье мы разбираем реальный кейс анализа массива из сотен тысяч заказов за 10 лет работы крупного автодилера. Разберем обработку данных в Python (Pandas/Seaborn), столкнемся с Парадоксом Симпсона в действии и рассчитаем честный LTV клиентов. Вы узнаете, как сезонная переобувка работает в роли «троянского коня» и почему клиенты с шиномонтажом за свой жизненный цикл приносят компании в 3.1 раза больше денег.

Читать далее
1
23 ...