Обновить
64K+

Data Mining *

Глубинный анализ данных

41,08
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

ML на данных Мосбиржи: как я собирал историю стакана, сделок и фьючерсов

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели8.8K

Лето подходит к концу и я хочу рассказать о своём увлечении последних месяцев — машинном обучении (Machine Learning) на данных Московской биржи. Эта тема уже давно не даёт мне покоя и в этот раз я решил подойти более основательно — активно использовал новейшие языковые модели, типа Claude Sonnet 5, Gemeni 3.7 Flash не только для написания кода, но и для работы с результатами этих скриптов. При этом не использовал полностью автономных агентов — все языковые модели работали как консультанты в чате — все решения принимал я, в том числе какую исходную информацию давать конкретной модели на каждом из этапов.

Предвидя будущие вопросы я сразу отвечу что это мой эксперимент и он не только не зарабатывает, но и пока даже непонятно чем закончится — сейчас это всё в процессе. Эту статью решил написать не чтобы «засветить трейдерским граалем» — которых я кстати считаю что не существует, потому что вся информация общедоступна. Эта статья написана чтобы рассказать как есть об этой ML теме без прикрас и познакомиться с комментариями — среди негатива (обычно так) проскакивают интересные мысли. Я сам не работаю в финансах и моя позиция больше исследовательская, так что раскрыть какие‑то корпоративные секреты я не могу — просто прощупываю путь перед собой. 

ML на Мосбирже

Claude Code Antifraud, часть 2: крысы‑биссектрисы и обезьяны‑медианы на детской математической олимпиаде

Уровень сложностиСредний
Время на прочтение41 мин
Охват и читатели7.6K

В прошлой серии знакомый принёс мне импортное за триста и попросил посмотреть результаты московской олимпиады по геометрии. Пока публиковал статью, пришёл второй заказ. В этот раз питерская олимпиада для 4–11 классов: 6 сезонов, 40+ площадок проведения, устный формат. Устный — это когда участник рассказывает решение, жюри кивает или не кивает, черновиков нет, перепроверить нельзя.

И снова импортное за триста. Что ж, триста так триста. Погнали.

Читать далее

Треть сканов моего приложения заканчивается фразой «нет данных». Разбираюсь, почему

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели5.5K

Каждое утро мне падает сводка по приложению. Сегодня в ней было: 27 сканов за сутки, из них 10 — с вердиктом “нет данных”. Тридцать семь процентов людей навели камеру на штрихкод и не получили ничего. Разбираю, откуда берётся эта дыра при базе в 112 тысяч товаров, почему OCR-фоллбэк отсекает 39 процентов пользовательских вкладов и где проходит граница между “принять с риском” и “отклонить и потерять данные”.

Читать далее

Скрапер Google Maps на Playwright: семь граблей, на которые я наступил

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Задача звучала просто: получить список компаний определённого профиля в конкретном городе — с сайтом и способом связаться. Не телефоном, а email / Telegram / WhatsApp.

Итоговый скрипт — примерно 400 строк: Playwright для Maps, requests + BeautifulSoup для сайтов, регексы для контактов, txt на выходе. Ниже — не туториал "как повторить", а список мест, где всё ломается.

Вот весь конвейер целиком, с отмеченными точками отказа — дальше по статье разберём каждую:

Читать далее

Две страницы с 17-й позиции и нулём кликов дали больше цитирований ИИ, чем весь мой топ-5

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели9.8K

Я исходил из простого допущения: сначала выводим страницу в топ поиска, а цитирование нейросетями подтянется следом — модель ведь тоже читает интернет. Допущение оказалось неверным.

Взял один сайт, снял два среза данных и свёл их по URL. Ниже метод, код и результат, который меня удивил.

Читать далее

DS‑собеседование в 2026 году: 6 ошибок, из‑за которых отказывают даже сильным кандидатам

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.5K

На DS/ML‑собеседовании можно уверенно пройти теорию и всё равно получить отказ. Часто решение принимается позже — когда становится видно, умеет ли кандидат работать с данными, продакшеном и реальными ограничениями. Разбираем шесть ошибок, на которых сыпятся даже сильные специалисты.

Читать далее

Где искать темы и материалы для PhD в ML/AI: 10 бесплатных ресурсов

Время на прочтение3 мин
Охват и читатели7.9K

Если вы занимаетесь ML / AI, Computer Science или научными исследованиями, диссертации могут быть очень полезным источником идей для research.

🔬 Если вы занимаетесь ML/AI research — сохраните этот пост.

Здесь собрала 20 бесплатных ресурсов, где можно искать:

🎓 PhD-диссертации
🏆 архивы лучших ML/AI-конференций
📚 научные статьи
🧠 research ideas и research gaps
📊 datasets и новые направления исследований

Читать далее

Меня разнесли в комментариях к прошлой статье. Разбираю, где читатели правы

Время на прочтение4 мин
Охват и читатели8.2K

Две недели назад выложил сюда разбор 60 тысяч составов. Комментаторы за два дня нашли в алгоритме четыре дыры — про две я знал и молчал, про две не догадывался. Разбираю все четыре, без отмазок.

Читать далее

Я прогнал 60 тысяч составов продуктов через свой алгоритм. Вот что в еде на самом деле

Время на прочтение5 мин
Охват и читатели8.1K

Сразу скажу, как считается балл, чтобы не было магии. Никакого ИИ в самой оценке. Обычная арифметика: сахар на 100 грамм, соль, насыщенные жиры, трансжиры, позиция сахара в списке ингредиентов и наличие добавок из «списка внимания». Складываю штрафные баллы, порог — и на выходе зелёный, жёлтый или красный. Формула открытая, каждый может пересчитать руками. ИИ у меня отвечает только за короткую фразу-объяснение поверх уже готового вердикта, придумать он ничего не может.

Теперь сами цифры.

Из шестидесяти тысяч товаров зелёных вышло примерно 43 процента, жёлтых — 38, красных — около 18. То есть «всё плохо» — это неправда. Больше сорока процентов полки — нормальная еда без подвохов: крупы, простые молочные продукты, вода, чай, овощи. Это, кстати, был первый сюрприз лично для меня: я начинал проект с ощущением, что сейчас всё окажется красным, а оказалось наоборот.

Красная зона — вот где интересно. Я полез разбирать, из-за чего именно товар туда попадает, и картинка развалилась на три почти равные кучки. Примерно 40 процентов красных — чисто из-за питания: сахар, соль, жир, без всяких добавок. Ещё около 36 — наоборот, состав по нутриентам нормальный, а красный он из-за добавки. И ещё треть — пограничные, где всё держится на одном показателе: чуть сдвинь порог, и половина из них уедет в жёлтый. Красная зона, короче, не монолит. «Красное» по разным причинам красное.

Дальше — добавки, те самые «ешки», которых все боятся. Я прогнал частотку по всем составам: сколько всего разных Е-кодов реально встречается. Получилось чуть больше четырёхсот уникальных. И вот тут главное, ради чего всё затевалось: из этих четырёхсот с лишним под настоящим вниманием токсикологов находится буквально горстка. Нитриты в колбасе, часть синтетических красителей, диоксид титана — и то претензии обычно не к самому факту наличия, а к дозе. Всё остальное — это витамины, кислоты, загустители, эмульгаторы, которые получили код Е просто потому, что регистривались по той же процедуре. Аскорбиновая кислота — это витамин С и одновременно Е300. Лимонная кислота — Е330. Пектин, лецитин, сода. Буква Е на упаковке говорит не «химия», а «есть регламент».

Читать далее

Почему цена Bitcoin «сломалась»: разбор аномалий 2022–2026 с WhyTrend

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.1K

Увидел провал на графике → открыл Google или Twitter → полдня собираешь версии "почему". Знакомо? Детектор аномалий сам по себе даёт только точки на оси времени, а вопрос "почему" как был ручным, так и остаётся.

В этот раз я прогнал WhyTrend не на паре аккуратных точек из Google Trends, а на полном ряде BTC за 4.5 года — и заодно на двух разных LLM. Результат оказался неожиданным: модель меньшего размера дала в три раза больше настоящих объяснений, чем более крупная. Расскажу, что случилось и почему.

Читать далее

Как я разобрала 4 848 постов маркетологов в Threads и почему самые частые приёмы работают в минус

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.5K

Каждая вторая статья про «алгоритм Threads 2026» держится на цифрах, которых никто не показывает. Я решила посчитать сама и заодно проверить, переживут ли выводы тест на случайность.

200 аккаунтов русскоязычных маркетологов, 16 724 поста. После чистки осталось 4 848 профессиональных постов от 103 авторов. Метод — нормализация внутри автора плюс перестановочный тест. На четырёх признаках из двенадцати это переворачивает знак эффекта относительно наивного подсчёта.

Результат неприятный: три самых частых приёма у маркетологов работают в минус, а приём с самым сильным плюсом встречается всего в 6% постов.

Дальше — сбор данных, метод с кодом и точными p-value, результаты и раздел про ограничения, которых тут хватает.

Threads принадлежит компании Meta, которая признана в России экстремистской организацией и её деятельность запрещена.

Читать далее

FlatAdapter для преобразования иерархических структур

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели8.4K

Превращаем иерархические структуры в набор плоских строк готовых для импорта в БД

flat-adapter преобразует нетипизированные вложенные mapping в детерминированный список плоских строк. Библиотека умеет приводить scalar-типы, обрабатывать optional-поля, извлекать значения по путям, разворачивать вложенные FlatAdapter-ы и строить декартово произведение списков.

Читать далее

0.9 от вашего классификатора — это не 90%: почему модели врут о своей уверенности и как это чинить

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели10K

Порог 0,8 часто воспринимают как 80% уверенности — и на этом строят автоматизацию.

Разберём, почему predict_proba может врать, как измерить калибровку модели и вернуть её вероятностям практический смысл.

Читать далее

Ближайшие события

Почему никто не объясняет аномалии во временных рядах?

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели9.4K

Недавно встретились с коллегой за кружкой кофе, без всякой рабочей повестки. Он занимается Data Science, я — backend‑разработкой. Разговор как‑то незаметно, как это обычно бывает, свернул в сторону обсуждения рабочих нюансов, а самый обычный вопрос про очередной график в дашборде — закончился идеей проекта, который в итоге вырос в open‑source фреймворк.

В какой‑то момент он сказал фразу, которая неожиданно зацепила:

Читать далее

BM25 против эмбеддингов, Protocol против наследования: как рождался фреймворк WhyTrend

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.3K

В прошлой статье я рассказывал про WhyTrend — open-source инструмент, который не просто находит аномалии во временных рядах, а пытается объяснить, почему они произошли: собирает внешний контекст (новости, Hacker News, Wikipedia) и формирует объяснение со ссылками на источники. Если коротко: идея выросла из наблюдения, что находить аномалии мы научились отлично, а вот объяснять их до сих пор приходится вручную — гуглить, листать Reddit и Slack, собирать гипотезу самому.

Эта статья — про внутреннюю кухню: почему WhyTrend в итоге оказался фреймворком, а не очередной библиотекой, и какие архитектурные решения к этому привели.

Читать далее

Гипотеза о Языке Мышления как альтернатива Искусственному Интеллекту

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели9K

50 лет назад была выдвинута гипотеза о Языке Мышления. Наверняка вы про нее не слышали – а зря. Классная штука, которая может перевернуть (и уже переворачивает) представление о возможных методах обработки информации, воплощенных в технологиях.

Погрузиться

Еще одна мировая революция. Мы улучшили модель для любых CV-задач, добавив сегментацию. И еще лучше SOTA

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели10K

Мы собрали модель, которая одновременно решает детекцию, классификацию и сегментацию, и при этом остается радикально легче и экономичнее по ресурсам, чем любые современные SOTA‑архитектуры. На COCO и RF100‑VL мы получаем качество детекции уровня крупных transformer‑детекторов при сотнях раз меньшем числе параметров, а на LVIS – покрытие и точность масок, недостижимые для YOLO‑семейства без переобучения, все это в режиме близком к real‑time на массовом железе.

В терминах «качество / параметры / латентность» наша модель находится в области, где у крупных конкурентов просто нет сопоставимых точек: либо они хуже по качеству при сопоставимой скорости, либо требуют на порядки больше параметров и железа, чтобы выйти на похожие цифры.

Посмотреть и воспользоваться

Data Storytelling на примере нестандартного дашборда: РПЛ и знаки зодиака

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.3K

Что если задать BI-системе вопрос, который выходит за рамки рутинной аналитики? Будет ли она также эффективна? Эта идея родилась из корпоративного шуточного спора: шутили над качествами сотрудника «Рака», а в статистику попали также и другие «носители» знака зодиака. 

Мы в Modus решили проверить закономерности на данных, так как это наш профессиональный рабочий инструмент и сфера интереса. Взяли статистику всех игроков Российской Премьер-Лиги, добавили знаки зодиака — и посмотрели, что получится. 

Спойлер: вышел настоящий дашборд и серьезный вывод о том, на что способен гибкий BI.

Читать далее

Почему Tesla никогда* не сделает настоящий полноценный надежный реальный автопилот

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.5K

Традиционные методы обработки изображений и видео, включая уже раритетные капсульные сети и модные видео‑трансформеры (их ждет та же участь), достигли своего потолка и для решения не самых сложных задач требуют огромных ресурсов. А есть задачи посложнее.

Не самая сложная задача – это Content ID YouTube, на разработку которой компания потратила минимум  $100 млн и 10 лет. Задачу, которую должна решать система: сравнивать видео с видео и ловить пиратский контент автоматически.

Content ID – реально сложная, и по-своему выдающаяся система, про которую до сих пор известно довольно мало. Но даже она, при всех затратах и при всех усилиях лучших инженерных умов, остановилась примерно на половине пути. Хотя казалось бы: нужно всего-то сравнивать все видео с друг с другом. 

Что уж говорить про системы так называемого автопилота, которые тоже работают с видео – но в гораздо более сложной и разнообразной среде. Несмотря на все громкие обещания Илона Маска уважаемого, воз и ныне там.

Разберем на примерах YouTube и Tesla, почему все компании, пытающиеся работать с видео и с компьютерным зрением, шагают по бесконечному тупику, и как наши методы TAPe нашей пока что малоизвестной научно-исследовательской лаборатории щелчком пальца (за которым стоят годы RnD) решают задачи бессильных в данном случае мегакорпораций.

Распознать знание

Тихая-тихая мировая революция. Мы сделали модель распознавания для любых задач компьютерного зрения – и выше уровня SOTA

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели11K

Практический эффект TAPe+ML v2 сейчас лучше всего видно в object detection. Так, TAPe+ML v2 на конкретной практической задаче рудозасорения (см главу про промышленный пилот), без COCO-головы, на новом backbone, основанном на данных клиента, дает точность детекции 96%, по mAP50 – точность  90% и по mAP50–95 – 85%. То есть TAPe‑детекция выходит на уровень RF‑DETR по mAP50 при числе параметров меньше 100 тысяч против порядка 127 миллионов у RF‑DETR 2XL.

Мы применили последовательность улучшений, которые не раскрываем публично как ноу‑хау, но их итоговые эффекты можно зафиксировать на COCO. На разных этапах получались следующие значения:

Божечки