Обновить
64K+

Data Mining *

Глубинный анализ данных

35,43
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Я прогнал 60 тысяч составов продуктов через свой алгоритм. Вот что в еде на самом деле

Время на прочтение5 мин
Охват и читатели7.2K

Сразу скажу, как считается балл, чтобы не было магии. Никакого ИИ в самой оценке. Обычная арифметика: сахар на 100 грамм, соль, насыщенные жиры, трансжиры, позиция сахара в списке ингредиентов и наличие добавок из «списка внимания». Складываю штрафные баллы, порог — и на выходе зелёный, жёлтый или красный. Формула открытая, каждый может пересчитать руками. ИИ у меня отвечает только за короткую фразу-объяснение поверх уже готового вердикта, придумать он ничего не может.

Теперь сами цифры.

Из шестидесяти тысяч товаров зелёных вышло примерно 43 процента, жёлтых — 38, красных — около 18. То есть «всё плохо» — это неправда. Больше сорока процентов полки — нормальная еда без подвохов: крупы, простые молочные продукты, вода, чай, овощи. Это, кстати, был первый сюрприз лично для меня: я начинал проект с ощущением, что сейчас всё окажется красным, а оказалось наоборот.

Красная зона — вот где интересно. Я полез разбирать, из-за чего именно товар туда попадает, и картинка развалилась на три почти равные кучки. Примерно 40 процентов красных — чисто из-за питания: сахар, соль, жир, без всяких добавок. Ещё около 36 — наоборот, состав по нутриентам нормальный, а красный он из-за добавки. И ещё треть — пограничные, где всё держится на одном показателе: чуть сдвинь порог, и половина из них уедет в жёлтый. Красная зона, короче, не монолит. «Красное» по разным причинам красное.

Дальше — добавки, те самые «ешки», которых все боятся. Я прогнал частотку по всем составам: сколько всего разных Е-кодов реально встречается. Получилось чуть больше четырёхсот уникальных. И вот тут главное, ради чего всё затевалось: из этих четырёхсот с лишним под настоящим вниманием токсикологов находится буквально горстка. Нитриты в колбасе, часть синтетических красителей, диоксид титана — и то претензии обычно не к самому факту наличия, а к дозе. Всё остальное — это витамины, кислоты, загустители, эмульгаторы, которые получили код Е просто потому, что регистривались по той же процедуре. Аскорбиновая кислота — это витамин С и одновременно Е300. Лимонная кислота — Е330. Пектин, лецитин, сода. Буква Е на упаковке говорит не «химия», а «есть регламент».

Читать далее

Новости

Почему цена Bitcoin «сломалась»: разбор аномалий 2022–2026 с WhyTrend

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.7K

Увидел провал на графике → открыл Google или Twitter → полдня собираешь версии "почему". Знакомо? Детектор аномалий сам по себе даёт только точки на оси времени, а вопрос "почему" как был ручным, так и остаётся.

В этот раз я прогнал WhyTrend не на паре аккуратных точек из Google Trends, а на полном ряде BTC за 4.5 года — и заодно на двух разных LLM. Результат оказался неожиданным: модель меньшего размера дала в три раза больше настоящих объяснений, чем более крупная. Расскажу, что случилось и почему.

Читать далее

Как я разобрала 4 848 постов маркетологов в Threads и почему самые частые приёмы работают в минус

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.3K

Каждая вторая статья про «алгоритм Threads 2026» держится на цифрах, которых никто не показывает. Я решила посчитать сама и заодно проверить, переживут ли выводы тест на случайность.

200 аккаунтов русскоязычных маркетологов, 16 724 поста. После чистки осталось 4 848 профессиональных постов от 103 авторов. Метод — нормализация внутри автора плюс перестановочный тест. На четырёх признаках из двенадцати это переворачивает знак эффекта относительно наивного подсчёта.

Результат неприятный: три самых частых приёма у маркетологов работают в минус, а приём с самым сильным плюсом встречается всего в 6% постов.

Дальше — сбор данных, метод с кодом и точными p-value, результаты и раздел про ограничения, которых тут хватает.

Threads принадлежит компании Meta, которая признана в России экстремистской организацией и её деятельность запрещена.

Читать далее

Как вас обманывают биржи: большинство трейдеров думают, что торгуют на рынке

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели13K

Вы открываете Binance / Bybit / OKX и т.п., смотрите на график, нажимаете Buy и думаете, что только что купили актив на рынке

На самом деле вы сделали гораздо более интересную вещь: отдали заявку в чужую инфраструктуру, где профессиональные участники заранее знают, где стоит ликвидность, как устроен стакан и какие заявки сейчас находятся в очереди

И самое неприятное - вы почти всегда играете против участников, которые технически и информационно находятся на другом уровне

Спойлер: у вас нет шансов. Сейчас покажу почему на реальных примерах.

Если не хотите читать лонгрид — смело мотайте в конец статьи. Там коротко собрал главный вывод и что с этим делать, как получить преимущество над большинством трейдеров

Читать далее

FlatAdapter для преобразования иерархических структур

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели8.2K

Превращаем иерархические структуры в набор плоских строк готовых для импорта в БД

flat-adapter преобразует нетипизированные вложенные mapping в детерминированный список плоских строк. Библиотека умеет приводить scalar-типы, обрабатывать optional-поля, извлекать значения по путям, разворачивать вложенные FlatAdapter-ы и строить декартово произведение списков.

Читать далее

0.9 от вашего классификатора — это не 90%: почему модели врут о своей уверенности и как это чинить

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели10K

Порог 0,8 часто воспринимают как 80% уверенности — и на этом строят автоматизацию.

Разберём, почему predict_proba может врать, как измерить калибровку модели и вернуть её вероятностям практический смысл.

Читать далее

Почему никто не объясняет аномалии во временных рядах?

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели9.3K

Недавно встретились с коллегой за кружкой кофе, без всякой рабочей повестки. Он занимается Data Science, я — backend‑разработкой. Разговор как‑то незаметно, как это обычно бывает, свернул в сторону обсуждения рабочих нюансов, а самый обычный вопрос про очередной график в дашборде — закончился идеей проекта, который в итоге вырос в open‑source фреймворк.

В какой‑то момент он сказал фразу, которая неожиданно зацепила:

Читать далее

BM25 против эмбеддингов, Protocol против наследования: как рождался фреймворк WhyTrend

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.2K

В прошлой статье я рассказывал про WhyTrend — open-source инструмент, который не просто находит аномалии во временных рядах, а пытается объяснить, почему они произошли: собирает внешний контекст (новости, Hacker News, Wikipedia) и формирует объяснение со ссылками на источники. Если коротко: идея выросла из наблюдения, что находить аномалии мы научились отлично, а вот объяснять их до сих пор приходится вручную — гуглить, листать Reddit и Slack, собирать гипотезу самому.

Эта статья — про внутреннюю кухню: почему WhyTrend в итоге оказался фреймворком, а не очередной библиотекой, и какие архитектурные решения к этому привели.

Читать далее

Гипотеза о Языке Мышления как альтернатива Искусственному Интеллекту

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели8.8K

50 лет назад была выдвинута гипотеза о Языке Мышления. Наверняка вы про нее не слышали – а зря. Классная штука, которая может перевернуть (и уже переворачивает) представление о возможных методах обработки информации, воплощенных в технологиях.

Погрузиться

Еще одна мировая революция. Мы улучшили модель для любых CV-задач, добавив сегментацию. И еще лучше SOTA

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели10K

Мы собрали модель, которая одновременно решает детекцию, классификацию и сегментацию, и при этом остается радикально легче и экономичнее по ресурсам, чем любые современные SOTA‑архитектуры. На COCO и RF100‑VL мы получаем качество детекции уровня крупных transformer‑детекторов при сотнях раз меньшем числе параметров, а на LVIS – покрытие и точность масок, недостижимые для YOLO‑семейства без переобучения, все это в режиме близком к real‑time на массовом железе.

В терминах «качество / параметры / латентность» наша модель находится в области, где у крупных конкурентов просто нет сопоставимых точек: либо они хуже по качеству при сопоставимой скорости, либо требуют на порядки больше параметров и железа, чтобы выйти на похожие цифры.

Посмотреть и воспользоваться

Data Storytelling на примере нестандартного дашборда: РПЛ и знаки зодиака

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.2K

Что если задать BI-системе вопрос, который выходит за рамки рутинной аналитики? Будет ли она также эффективна? Эта идея родилась из корпоративного шуточного спора: шутили над качествами сотрудника «Рака», а в статистику попали также и другие «носители» знака зодиака. 

Мы в Modus решили проверить закономерности на данных, так как это наш профессиональный рабочий инструмент и сфера интереса. Взяли статистику всех игроков Российской Премьер-Лиги, добавили знаки зодиака — и посмотрели, что получится. 

Спойлер: вышел настоящий дашборд и серьезный вывод о том, на что способен гибкий BI.

Читать далее

Почему Tesla никогда* не сделает настоящий полноценный надежный реальный автопилот

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.5K

Традиционные методы обработки изображений и видео, включая уже раритетные капсульные сети и модные видео‑трансформеры (их ждет та же участь), достигли своего потолка и для решения не самых сложных задач требуют огромных ресурсов. А есть задачи посложнее.

Не самая сложная задача – это Content ID YouTube, на разработку которой компания потратила минимум  $100 млн и 10 лет. Задачу, которую должна решать система: сравнивать видео с видео и ловить пиратский контент автоматически.

Content ID – реально сложная, и по-своему выдающаяся система, про которую до сих пор известно довольно мало. Но даже она, при всех затратах и при всех усилиях лучших инженерных умов, остановилась примерно на половине пути. Хотя казалось бы: нужно всего-то сравнивать все видео с друг с другом. 

Что уж говорить про системы так называемого автопилота, которые тоже работают с видео – но в гораздо более сложной и разнообразной среде. Несмотря на все громкие обещания Илона Маска уважаемого, воз и ныне там.

Разберем на примерах YouTube и Tesla, почему все компании, пытающиеся работать с видео и с компьютерным зрением, шагают по бесконечному тупику, и как наши методы TAPe нашей пока что малоизвестной научно-исследовательской лаборатории щелчком пальца (за которым стоят годы RnD) решают задачи бессильных в данном случае мегакорпораций.

Распознать знание

Тихая-тихая мировая революция. Мы сделали модель распознавания для любых задач компьютерного зрения – и выше уровня SOTA

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели11K

Практический эффект TAPe+ML v2 сейчас лучше всего видно в object detection. Так, TAPe+ML v2 на конкретной практической задаче рудозасорения (см главу про промышленный пилот), без COCO-головы, на новом backbone, основанном на данных клиента, дает точность детекции 96%, по mAP50 – точность  90% и по mAP50–95 – 85%. То есть TAPe‑детекция выходит на уровень RF‑DETR по mAP50 при числе параметров меньше 100 тысяч против порядка 127 миллионов у RF‑DETR 2XL.

Мы применили последовательность улучшений, которые не раскрываем публично как ноу‑хау, но их итоговые эффекты можно зафиксировать на COCO. На разных этапах получались следующие значения:

Божечки

Ближайшие события

Книга: «Анализ данных с LLM. Текст, таблицы, изображения и аудио»

Время на прочтение2 мин
Охват и читатели11K

Привет, Хаброжители! Большие языковые модели (LLM) позволяют оптимизировать и ускорить решение практически любой задачи в области анализа данных. Освойте методы для анализа больших массивов текстовых, табличных и графовых данных, изображений, видео и многого другого с помощью понятных запросов на естественном языке и нескольких строк кода на Python.

Читать далее

От имени Габенбота: измеряем во сколько обошёлся призыв оставить отзыв

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.5K

Игра Far Far West просила игроков оставить отзыв прямо через внутриигрового NPC — прямое нарушение правил Steam. Мы выгрузили данные и прогнали через модели детекции аномалий, чтобы посчитать, сколько отзывов оказались «добавленными». Спойлер: от 27% до 50%.

Читать далее

Мы — другие. Компьютерное зрение без миллионов параметров: практический разрыв SOTA

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели5.9K

Краткий манифест-тизер; запомните этот твит.

Повторяем как мантру, чтобы она дошла до как можно большего количества людей. У YOLO, семейства DINO и прочих сетей - сотни миллионов и миллиардов параметров для решения задач детекции, классификации, сегментации. На фундаменте этих сетей по всему миру рождаются сервисы, которые позволяют решать какие-то задачи детекции, классификации, сегментации. 

У нас есть своя собственная универсальная модель компьютерного зрения – со своей собственной архитектурой – со своей собственной “математикой”. И нам для решения задач детекции, классификации, сегментации нужны не сотни и даже не десятки миллионов параметров, и уж тем более не миллиарды, а меньше 100 тыс. А точность при этом в худшем случае сопоставима с SOTA, а в обычном – превосходит SOTA.

Но как же так? С одной стороны миллионы и миллиарды параметров, а с другой – меньше 100 тыс. Это же гигантская разница. Что происходит? Что все это значит?

Это значит, что мы про что-то другое

Как я собрал эталонный Data Engineering проект: ClickHouse, Kafka, Spark, dbt, Airflow и Superset за одну команду

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели13K

Меня зовут Андрей, я работаю с данными. И так получается, что на реальных проектах у меня никогда не было возможности собрать идеальный, на мой взгляд стек. Поэтому я собрал его в идеальном пет проекте.

Стать инженером данных

raFTI: как сопоставлять «хаотичные» названия вин

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.4K

Привет, я Вит Глинка, backend программист в компании Deeplace, в которой среди прочего активно работают в области winetech. Хочу презентовать нашу последнюю фичу в этой области — raFTI.v5.3 — систему полнотекстового поиска.

Разобраться в вине

Критерии выживания и случайность — 5

Уровень сложностиСложный
Время на прочтение27 мин
Охват и читатели12K

Продолжаем data mining путешествие в погоне за удачей. Адаптивность — последний фактор в нашем разборе, хотя и не последняя статья серии. Если интеллект отвечает на вопрос «насколько у человека мощный когнитивный аппарат», то адаптивность отвечает на вопрос «насколько устойчиво он функционирует под давлением и насколько быстро восстанавливается». В популярной литературе адаптивность считается едва ли не главным фактором жизненного успеха. Данные показывают более скромную, фрагментированную и в нескольких местах контринтуитивную картину.

Читать далее

Энтропия, которая измеряет порядок: IH-анализ находит закономерности в разнотипных данных

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.1K

Обычно энтропия — мера хаоса. Но наш сегодняшний герой — IH-анализ (Information-Entropy analysis) — вычисляет информационную энтропию, чтобы измерить обратное: степень детерминированности связи между признаками и целевой переменной. Мы будем вычислять: насколько утверждение «если А, то Б, и, если не А, то и не Б» выполняется в наших данных устойчиво. Одновременная работа с категориальными и количественными признаками нас не затруднит.

Читать далее
1
23 ...