Обновить
64K+

Data Mining *

Глубинный анализ данных

54,96
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Кетчуп нельзя сравнивать с гречкой. А сканеры состава сравнивают, и мой тоже

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели3.5K

Читатель написал: кетчупа съедают 5 грамм, а гречки 220. Сравнивать их на 100 г бессмысленно. Пошёл смотреть, как с порциями устроено в РФ, ЕС и США, и почему в моём сканере состава их до сих пор нет.

Читать далее

Новости

HTTP 200 на несуществующий адрес: пять способов, которыми Telegram обманул мои проверки

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели4.1K

Задача была на полчаса: пройтись по списку из 216 адресов вида t.me/имя и понять, какие живы и что это — канал, группа или аккаунт. Ушёл день, и почти весь на то, чтобы перестать верить собственному коду. Ни одна из пяти ошибок не выглядела как ошибка: HTTP 200, валидный HTML, разбор без исключений.

Читать далее

ИИ‑агент спешит на помощь: как мы автоматизировали более 70% рутины аналитика и увеличили эффективность команды

Время на прочтение11 мин
Охват и читатели5.8K

Привет! Меня зовут Дмитрий Гаврилов, я руководитель центра компетенции аналитики в MWS. Моя команда внедряет ИИ-скиллы в работу дата-аналитиков. Мы посмотрели на типичный рабочий день и поняли: рутина съедает до 75% времени аналитика. А можно ли это передать ИИ-агенту без потери качества? Эту гипотезу проверили на реальных задачах и получили конкретные результаты — делюсь в этом материале.

Читать далее

«Спорт, борщ, крипта»: как мы проверяли, работают ли интересы в рекомендательной системе

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели9.2K

Пользователь пишет интересы текстом, мы делаем из них один эмбеддинг. Работает он как монета (ROC-AUC 0.52), а на коротких интересах 0.41, то есть хуже случайного порядка. Прогнали шесть вариантов починки и подняли до 0.80. Рассказываю, что сработало, а что нет.

Что показали цифры

Как создавался агрегатор ИБ‑новостей: склейка сюжетов, семь признаков важности и порог по данным

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели8.5K

Идея агрегатора новостей по кибербезопасности зародилась еще давно. Хотелось получать самое важное и без инфошума. LLM тогда ещё не были повседневным инструментом, и первую версию реализовал на модели суммаризации rut5_base_sum_gazeta, а важность считал textrank. Работало так себе. Потом появились сервисы, которые сами подбирают новости под настроенную ленту. Но оптимального решения так и не увидел – это либо про всё сразу, либо что-то про одну узкую тему.

Задача изначально выглядела простой. Моделей полно, готовых наработок должно было быть много. Но на практике уже первые недели ушли на тюнинг, и лучше при этом не становилось: поднял порог – канал молчит сутки, опустил – в ленту попали вебинары, квадранты и пресс-релизы продуктов. Из этого опыта родилось гибридное решение. Важность теперь считает формула из семи признаков, все логируется, а модель пишет тексты и отсекает нерелевантное.

Читать далее

Я не откликаюсь на вакансии. Я пишу людям — и написал программу, которая их находит

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели8.5K

24 коллектора, 111 ATS-досок компаний, 345 тестов, ноль API-ключей и ноль ИИ. Windows-exe, который считает совпадение резюме с вакансией и приносит 1–3 живых человека, которым можно написать самому. Внутри — архитектура, три бага, из-за которых я чуть не отправил письма сотрудникам чужих компаний, и раздел «честные ограничения», без которого это была бы реклама.

Читать далее

В ответах нейросетей почти всегда есть ссылки. Но не по всем из них видно, что за источник за этим стоит

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели6.5K

Ответ нейросети с включённым поиском обычно приходит со списком источников, и этот список выглядит как готовый ответ на вопрос «где про эту тему пишут». Я собрал такой список по семи запросам одной темы из логов собственного прогона — получилось 359 уникальных адресов. Раскрыть удалось 199. За остальными 160 стоит редирект, за которым реальный сайт не виден ни из кода, ни глазами.

Ниже — откуда берётся этот пробел, почему его нельзя закрыть локально, что из неё всё-таки вытаскивается бесплатно и как из-за неё врут метрики, если считать их наивно.

Читать далее

Ипотечный кризис 2008 через свой риск-движок: в деньгах слом виден на год раньше, чем в ROC-AUC

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.1K

Модель кредитного риска, обученная на данных до 2009 года, ранжирует займы с ROC-AUC 0.89. Ожидаемые потери портфеля она оценила в 161 млн долларов, реальные составили 546. Увидеть эту ошибку можно было еще в 2007 году, за год до дна ROC-AUC, но не в метриках качества, а взвесив ошибку модели деньгами. Ниже — прогон на 26.5 млн реальных ипотечных записей, метрики против денег. Числа воспроизводятся до последнего разряда — код движка и инструкции в опенсорсе.

Читать далее

Агенты выполнили задачу. Почему тест всё равно провален?

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.8K

Допустим, у тебя есть несколько AI-агентов. Один разбирает тикет, второй меняет код, третий запускает тесты, четвёртый готовит релиз.

Задача закрыта, тесты зелёные, артефакт собран. Метрика success_rate показывает успех.

Можно праздновать?

Не обязательно. Агенты могли несколько раз выполнить одну работу, нарушить порядок операций, одновременно захватить общий ресурс или случайно добиться правильного результата через недопустимую последовательность действий.

Финальное состояние корректное. Процесс — нет.

Именно эту проблему пытается измерить CoCoBench — новый бенчмарк для проверки координации нескольких AI-агентов. Его разработали исследователи из Нанкинского университета, Tsinghua и AgiBot.

Главная идея исследования полезна далеко за пределами робототехники:

Насколько х**во?

Соревнование замерло 16 августа, а таблица поехала дальше. Разбираю, что из этого настоящее

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели8.2K

Я полез в данные соревнования Pokemon TCG AI Battle посмотреть, кто там выигрывает, и залип на другом. На публичной таблице 6806 команд. Самая поздняя отправка решения датирована 16 августа, 23:58:53. После этой секунды не отправил никто

1668 команд из 6806, почти четверть поля, сделали финальную отправку именно в этот день: 824 из них после шести вечера, 350 в последний час. Похоже, немалая часть узнала про срок в тот же день, когда он истекал

Читать далее

ML на данных Мосбиржи: как я собирал историю стакана, сделок и фьючерсов

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели8.6K

Лето подходит к концу и я хочу рассказать о своём увлечении последних месяцев — машинном обучении (Machine Learning) на данных Московской биржи. Эта тема уже давно не даёт мне покоя и в этот раз я решил подойти более основательно — активно использовал новейшие языковые модели, типа Claude Sonnet 5, Gemeni 3.7 Flash не только для написания кода, но и для работы с результатами этих скриптов. При этом не использовал полностью автономных агентов — все языковые модели работали как консультанты в чате — все решения принимал я, в том числе какую исходную информацию давать конкретной модели на каждом из этапов.

Предвидя будущие вопросы я сразу отвечу что это мой эксперимент и он не только не зарабатывает, но и пока даже непонятно чем закончится — сейчас это всё в процессе. Эту статью решил написать не чтобы «засветить трейдерским граалем» — которых я кстати считаю что не существует, потому что вся информация общедоступна. Эта статья написана чтобы рассказать как есть об этой ML теме без прикрас и познакомиться с комментариями — среди негатива (обычно так) проскакивают интересные мысли. Я сам не работаю в финансах и моя позиция больше исследовательская, так что раскрыть какие‑то корпоративные секреты я не могу — просто прощупываю путь перед собой. 

ML на Мосбирже

Claude Code Antifraud, часть 2: крысы‑биссектрисы и обезьяны‑медианы на детской математической олимпиаде

Уровень сложностиСредний
Время на прочтение41 мин
Охват и читатели7.5K

В прошлой серии знакомый принёс мне импортное за триста и попросил посмотреть результаты московской олимпиады по геометрии. Пока публиковал статью, пришёл второй заказ. В этот раз питерская олимпиада для 4–11 классов: 6 сезонов, 40+ площадок проведения, устный формат. Устный — это когда участник рассказывает решение, жюри кивает или не кивает, черновиков нет, перепроверить нельзя.

И снова импортное за триста. Что ж, триста так триста. Погнали.

Читать далее

Треть сканов моего приложения заканчивается фразой «нет данных». Разбираюсь, почему

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели5.4K

Каждое утро мне падает сводка по приложению. Сегодня в ней было: 27 сканов за сутки, из них 10 — с вердиктом “нет данных”. Тридцать семь процентов людей навели камеру на штрихкод и не получили ничего. Разбираю, откуда берётся эта дыра при базе в 112 тысяч товаров, почему OCR-фоллбэк отсекает 39 процентов пользовательских вкладов и где проходит граница между “принять с риском” и “отклонить и потерять данные”.

Читать далее

Ближайшие события

Скрапер Google Maps на Playwright: семь граблей, на которые я наступил

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Задача звучала просто: получить список компаний определённого профиля в конкретном городе — с сайтом и способом связаться. Не телефоном, а email / Telegram / WhatsApp.

Итоговый скрипт — примерно 400 строк: Playwright для Maps, requests + BeautifulSoup для сайтов, регексы для контактов, txt на выходе. Ниже — не туториал "как повторить", а список мест, где всё ломается.

Вот весь конвейер целиком, с отмеченными точками отказа — дальше по статье разберём каждую:

Читать далее

Две страницы с 17-й позиции и нулём кликов дали больше цитирований ИИ, чем весь мой топ-5

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели9.7K

Я исходил из простого допущения: сначала выводим страницу в топ поиска, а цитирование нейросетями подтянется следом — модель ведь тоже читает интернет. Допущение оказалось неверным.

Взял один сайт, снял два среза данных и свёл их по URL. Ниже метод, код и результат, который меня удивил.

Читать далее

DS‑собеседование в 2026 году: 6 ошибок, из‑за которых отказывают даже сильным кандидатам

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.5K

На DS/ML‑собеседовании можно уверенно пройти теорию и всё равно получить отказ. Часто решение принимается позже — когда становится видно, умеет ли кандидат работать с данными, продакшеном и реальными ограничениями. Разбираем шесть ошибок, на которых сыпятся даже сильные специалисты.

Читать далее

Где искать темы и материалы для PhD в ML/AI: 10 бесплатных ресурсов

Время на прочтение3 мин
Охват и читатели7.8K

Если вы занимаетесь ML / AI, Computer Science или научными исследованиями, диссертации могут быть очень полезным источником идей для research.

🔬 Если вы занимаетесь ML/AI research — сохраните этот пост.

Здесь собрала 20 бесплатных ресурсов, где можно искать:

🎓 PhD-диссертации
🏆 архивы лучших ML/AI-конференций
📚 научные статьи
🧠 research ideas и research gaps
📊 datasets и новые направления исследований

Читать далее

Меня разнесли в комментариях к прошлой статье. Разбираю, где читатели правы

Время на прочтение4 мин
Охват и читатели8.2K

Две недели назад выложил сюда разбор 60 тысяч составов. Комментаторы за два дня нашли в алгоритме четыре дыры — про две я знал и молчал, про две не догадывался. Разбираю все четыре, без отмазок.

Читать далее

Я прогнал 60 тысяч составов продуктов через свой алгоритм. Вот что в еде на самом деле

Время на прочтение5 мин
Охват и читатели8.1K

Сразу скажу, как считается балл, чтобы не было магии. Никакого ИИ в самой оценке. Обычная арифметика: сахар на 100 грамм, соль, насыщенные жиры, трансжиры, позиция сахара в списке ингредиентов и наличие добавок из «списка внимания». Складываю штрафные баллы, порог — и на выходе зелёный, жёлтый или красный. Формула открытая, каждый может пересчитать руками. ИИ у меня отвечает только за короткую фразу-объяснение поверх уже готового вердикта, придумать он ничего не может.

Теперь сами цифры.

Из шестидесяти тысяч товаров зелёных вышло примерно 43 процента, жёлтых — 38, красных — около 18. То есть «всё плохо» — это неправда. Больше сорока процентов полки — нормальная еда без подвохов: крупы, простые молочные продукты, вода, чай, овощи. Это, кстати, был первый сюрприз лично для меня: я начинал проект с ощущением, что сейчас всё окажется красным, а оказалось наоборот.

Красная зона — вот где интересно. Я полез разбирать, из-за чего именно товар туда попадает, и картинка развалилась на три почти равные кучки. Примерно 40 процентов красных — чисто из-за питания: сахар, соль, жир, без всяких добавок. Ещё около 36 — наоборот, состав по нутриентам нормальный, а красный он из-за добавки. И ещё треть — пограничные, где всё держится на одном показателе: чуть сдвинь порог, и половина из них уедет в жёлтый. Красная зона, короче, не монолит. «Красное» по разным причинам красное.

Дальше — добавки, те самые «ешки», которых все боятся. Я прогнал частотку по всем составам: сколько всего разных Е-кодов реально встречается. Получилось чуть больше четырёхсот уникальных. И вот тут главное, ради чего всё затевалось: из этих четырёхсот с лишним под настоящим вниманием токсикологов находится буквально горстка. Нитриты в колбасе, часть синтетических красителей, диоксид титана — и то претензии обычно не к самому факту наличия, а к дозе. Всё остальное — это витамины, кислоты, загустители, эмульгаторы, которые получили код Е просто потому, что регистривались по той же процедуре. Аскорбиновая кислота — это витамин С и одновременно Е300. Лимонная кислота — Е330. Пектин, лецитин, сода. Буква Е на упаковке говорит не «химия», а «есть регламент».

Читать далее

Почему цена Bitcoin «сломалась»: разбор аномалий 2022–2026 с WhyTrend

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.1K

Увидел провал на графике → открыл Google или Twitter → полдня собираешь версии "почему". Знакомо? Детектор аномалий сам по себе даёт только точки на оси времени, а вопрос "почему" как был ручным, так и остаётся.

В этот раз я прогнал WhyTrend не на паре аккуратных точек из Google Trends, а на полном ряде BTC за 4.5 года — и заодно на двух разных LLM. Результат оказался неожиданным: модель меньшего размера дала в три раза больше настоящих объяснений, чем более крупная. Расскажу, что случилось и почему.

Читать далее
1
23 ...