Обновить
64K+

Открытые данные *

Данные будут свободны!

28,98
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как мы измеряли рекламные обещания регулярками и почему первая выгрузка соврала вдвое

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели6.1K

Нам понадобились свои данные о том, как устроены страницы, продающие франшизы. Не мнение, не подборка скриншотов, а числа, которые можно пересчитать через полгода и сравнить. Готовых датасетов по этой нише нет, поэтому мы написали скрипт: он забирает шестнадцать страниц, ищет на них набор признаков и складывает результат в JSON.

Первая выгрузка выглядела убедительно. Потом мы открыли страницы глазами и обнаружили, что по одному признаку скрипт ошибся больше чем вдвое. Эта статья про то, где именно регулярное выражение находит слово, но не находит смысл, и что с этим делать, если полностью уйти от регулярок нельзя.

Читать далее

Новости

Штрихкод есть, базы нет: как я собирал справочник продуктов для домашнего приложения

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели5K

Чтобы человек навёл камеру на пачку гречки и получил название, вес и калории, нужна база штрихкодов российских продуктов. Я был уверен, что она где-то есть. Её нет. Что проверял живыми запросами, почему каталоги сетей не взять, как чек ОФД заменяет каталог и как в итоге устроен справочник на 258 тысяч позиций, который растёт ровно на то, что люди сканируют.

Читать далее

Система экстренных оповещений на 15 тысяч пользователей: LLM, PostGIS, Qdrant и Telegram

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели9.7K

Главная инженерная задача здесь — превратить поток неструктурированного текста из сотен телеграм-каналов в события, с которыми может работать остальная система: определить тип события, место, краткое описание, убрать дубли и понять, кому именно его нужно отправить.

Мы изначально строили систему без постоянной ручной модерации. События появляются круглосуточно, поэтому ручная проверка плохо масштабируется. Часть работы выполняет LLM-конвейер, часть — пользователи, которые могут сами сообщать о событиях и проверять сообщения друг друга.

Читать далее

Неделя после Хабра: почта человека нашлась в его же коммитах, а мой скоринг раздавал 50 очков даром

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели6.2K

Шесть дней назад я рассказал здесь про resume2human — программу, которая из резюме делает список вакансий и по каждой находит 1–3 живых человека с именем, ролью и адресом, чтобы написать им напрямую. За неделю в проект уехал 21 коммит в девяти PR, тестов стало 746 вместо 345, и я нарушил ровно половину обещаний, которые дал в том тексте. Внутри: бесплатная ступень поиска личных контактов, которая держится на git вместо платных баз; три бага, из-за которых прогон честно искал не то, что просили; и разбор того, почему покрытие пустого множества равно единице и что это стоило мне в скоринге.

Читать далее

Как научить криптосканер не врать самому себе: ML‑часть AltScanner

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели8.2K

Большинство рассказов о машинном обучении в трейдинге начинаются с модели. Берут свечи, добавляют индикаторы, запускают обучение и получают красивую кривую. Проблема обычно появляется раньше. В выборку могла попасть незакрытая свеча, пропуск мог превратиться в нарисованную цену, а соседние сделки могли использовать один и тот же участок будущего рынка.

В AltScanner мы пошли с другого конца. Сначала система научилась фиксировать состояние рынка так, чтобы его можно было воспроизвести. Затем появился механизм отложенной разметки. И только после этого мы добавили простую интерпретируемую модель.

ML-контур сейчас работает с 13 токенами на бессрочном рынке USDT: LINK, AAVE, FET, FIL, ETH, LTC, PENGU, HYPE, DOT, BNB, DOGE, BCH и SUI. Таймфреймы соответствуют внутридневной торговле: 15, 60 и 240 минут.

Задача этого контура не состоит в замене сканера одним магическим числом. У AltScanner остаётся фиксированная двухосевая оценка. D показывает направление от −100 до +100, а A показывает рыночную активность от 0 до 100. Машинное обучение строится рядом с этой системой. Оно изучает связь признаков с последующим движением цены, но не переписывает веса D и A.

Читать далее

Дендрохронология своими руками

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели19K

Посчитай кольца на пне и поймешь сколько лет дереву - это мы знаем с детства. Однако полезная информация, записанная в кольцах, не исчерпывается их количеством. Теплое и влажное лето оставляет широкое кольцо, а холодное и сухое - узкое. Это наблюдение дает две возможности: определять возраст археологических находок (дендрохронология) и восстанавливать климат прошлого (дендроклиматология).

Оба направления очень трудозатратны. Как правило, дендрохронология работает с цилиндрическими образцами древесины (кернами). Каждый керн полируется, затем годичные кольца измеряются с помощью микроскопа. Датировка требует значительного перекрытия между последовательностью годичных колец образца и установленной хронологией, составленной из многих других датированных образцов того же вида древесины в том же регионе. Наращивание такой хронологии - это работа, которая может занимать десятилетия.

Мне стало интересно, можно ли все это ускорить с помощью современного компьютерного зрения. Можно ли уместить всю дендрохронологию в одно приложение на смартфоне? Видимо нельзя, но вот что я узнал в процессе.

Читать далее

Серебряные кадры 2.0: что изменилось спустя полгода

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели8.3K

В феврале у меня уже был материал про серебряные кадры – сотрудников старше 50 лет, которых компании всё активнее начинают рассматривать как один из ответов на демографическую проблему российского рынка труда.

И тогда моя основная мысль была такой: людей в ключевых возрастах становится меньше, при этом сохраняется дефицит кадров и бизнес постепенно начинает активнее работать с сотрудниками 50+. Я тогда писал, что у Магнита росла доля сотрудников 50+, у Ашана к началу 2026 года она достигала 37%, также у Сибура были проекты и у Т2.

Теперь, смотрим что изменилось спустя полгода.

Читать далее

Как определить CMS у 53 тысяч сайтов за один обход. И почему картина всё равно смещена

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.3K

Задача была прикладная: мы переносим интернет‑магазины на свой движок и хотели понять, сколько в зоне .ru магазинов на каждой платформе и как их находить. Готовые сервисы вроде BuiltWith продают выгрузки по подписке, но нам нужен был воспроизводимый обход, который можно гонять когда угодно и по своим правилам.

Написали свой пробер, обошли 53 305 доменов и получили распределение платформ. Заодно собрали коллекцию ловушек, на каждой из которых успели ошибиться. Про них и статья — цифры без описания граблей мало чего стоят.

Читать далее

Кто хочет жить вечно — как я сделал открытую базу данных об отношении к продлению жизни

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8.3K

Что общего у Бенджамина Франклина, японских пенсионеров и американских зумеров? Всех их спрашивали о смерти, бессмертии и о том, сколько они хотят прожить. Только данные разбросаны по сотням статей, сайтов, стат. сборников и архивов.

Если биологи и медики уже давно каталогизируют данные о продлении жизни, то социальные данные — что люди об этом думают — до сих пор лежали мертвым грузом. Никто не сводил их в одну таблицу.

Я решил, это исправить. В этой статье я расскажу, как родился проект «Кто хочет жить вечно», почему вопрос бывает важнее ответа и как я собирал со всего интернета материалы, упаковывая их в инфографику на 40 графиков.

Читать далее

Полмиллиона словоформ для ингушского языка, у которого не было ни анализатора, ни корпуса

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели10K

У ингушского глагола «деша» на нашей карточке 98 форм — от инфинитива до уступительного перфекта отрицательного, а всего по словарю их вышло полмиллиона. Строить пришлось с нуля: ни морфоанализатора, ни размеченного корпуса для языка не существовало, а учебники спорят друг с другом даже о числе спряжений.

Рассказываю, как каждая форма отвечала на главный вопрос — «а ты вообще существуешь?» — и почему половина работы оказалась не про морфологию, а про эпистемологию.

Разобраться, существует ли форма

Инфляция 6%, а люди ждут 14,7%

Время на прочтение3 мин
Охват и читатели6K

Раз уже начал про инфляцию и ставку, то чего останавливаться, верно? Давайте обсудим что там с ожиданиями как раз по инфляции.

Вообще, с инфляцией сейчас получается достаточно «интересная» ситуация, потому что с одной стороны — по данным ЦБ России, годовая инфляция в июне 2026 года составила 6,02%. А уже в июльском опросе инФОМ россияне оценили ожидаемую инфляцию на ближайшие 12 месяцев в 14,7% против 12,4% месяцем ранее.

И более того, инфляцию, которую люди считают уже произошедшей за последние 12 месяцев, они оценили в 15,1%. Цифры довольно разные, мягко говоря.

Читать далее

Что такое реальная процентная ставка и почему 14% — это всё ещё много

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели4.7K

В этом материале я попробую максимально просто показать что такое ключевая ставка, о которой многие говорят и почему она сейчас еще большая, хотя 14% это намного меньше, чем 21%, которые были в начале 2025 года.

Итак, сегодня 14% ключевая ставка, ее постепенно снижают, а это значит что кредиты постепенно должны становиться дешевле, а депозиты менее доходными, в целом и происходит. Однако я еще предлагаю посмотреть в сторону инфляции, которая также влияет на эту ключевую ставку.

Читать далее

Словарь «Колобок» и идея перевода словарей

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели13K

Оказывается, если поработать с промптами и гейтами, то можно перевести большущий японо-английский словарь к виду японо-русского с очень неплохим качеством. Идея применима к другим языкам. Сделал пайплайн, запускал 100 Sol-воркеров-переводчиков одновременно через CLI. Вышло недорого.

Тут словарь, тут гитхаб с пайплайном, тут примеры статей.

Читать далее

Ближайшие события

Киберрасследования без мифов: OSINT, утечки данных, блокировки и цифровая анонимность – интервью с Игорем Бедеровым

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели6.2K

Почему блокировок становится всё больше, чем OSINT принципиально отличается от «пробива», можно ли сохранить анонимность в цифровой среде и с чего бизнесу начинать реальную защиту данных? Интернет давно перестал быть пространством, где можно просто «закрыть страницу и забыть»: данные переходят между сервисами, удалённые публикации сохраняются в архивах, а удобные инструменты одинаково доступны специалистам по безопасности, мошенникам и обычным пользователям.

Я, Александр, автор телеграм-канала «Shulepov Code», поговорил с Игорем Бедеровым — бывшим сотрудником полиции, основателем компании «Интернет-Розыск» и специалистом по киберрасследованиям. В этом интервью мы разбираем, почему государства усиливают контроль над информационным пространством, где заканчивается легальный анализ открытых источников и начинается нарушение, как устроены современные схемы с утечками и Telegram, а также какие практические шаги помогают бизнесу и специалистам выстраивать цифровую защиту. Игорь делится реальным опытом расследований, кейсами и объясняет, как устроена работа с данными без мифов.

Читать далее

Как я собрал сайт на 30 000 SEO‑страниц за месяц

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели19K

Я играю на гитаре. Не то чтобы хорошо, но у костра сходит. И каждый раз одна и та же сцена: кто-то просит сыграть конкретную песню, я достаю телефон, открываю сайт с аккордами — и следующие полторы минуты наблюдаю, как на одной палке связи грузится баннер, потом второй баннер, потом видеореклама, потом всплывашка «скачайте наше приложение», и где-то под всем этим — песня. К этому моменту у костра уже поют что-то другое. Без меня.

В какой-то момент я сформулировал, чего хочу: сайт с аккордами, который открывается мгновенно, работает без интернета и ничего мне не продаёт. Такого сайта не нашлось. Зато нашлись подписки на Claude и GPT и спортивный вопрос: может ли один человек, не написав руками почти ни строчки кода, собрать себе идеальный продукт за месяц?

Проверил. Рассказываю:

Читать далее

Очень много данных, даже слишком

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели5.3K

Сегодня речь пойдет про некоторый парадокс в аналитике, понимание которого приходит лишь со временем.

Представим, что каждый год данных становится всё больше и у компаний появляются новые системы, витрины, дашборды, десятки KPI, выгрузки на миллионы строк и всё это просто пачками валиться, хочешь смотреть так или эдак, можно посмотреть продажи / непродажи по регионам, сотрудникам, товарам, часам, минусам, секундам и еще по 25 разрезам.

И вроде, чем больше данных, тем лучше. Но это не всегда так, и иногда после появления пятого дашборда понимания становится даже меньше, чем было после одной нормальной таблицы.

Читать далее

Опыт снова дорожает и за квалифицированного специалиста рынок платит всё больше

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели19K

Постепенно видя, как работает рынок труда, мне стало интересно изучить не классический формат оценки уровня оплаты сотрудников, этого хоть отбавляй, а то, сколько рынок доплачивает именно за опыт.

Для этого на сайте простой аналитики есть отдельный индекс, там все опубликованные вакансии делятся на две группы: "стартовые" - то есть с требуемым опытом до 3 лет, и опытные - от 3 лет и после этого сравниваются медианные зарплатные предложения.

Читать далее

Пенсия всё позже, а карьерный потолок всё раньше. Где работать человеку после 45?

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели6.8K

Давайте представим 45-летнего специалиста: обычный спец, не руководитель. Если это будет мужчина, то в текущих реалиях до пенсионного возраста ему ещё 20 лет. Если женщина, то 15. А с 2028 года общий пенсионный возраст составит 65 и 60 лет соответственно.

Много еще работы впереди, но именно где-то в этом возрасте сменить работодателя или профессию становится заметно сложнее.

Читать далее

Сегментация как главный инструмент честной аналитики

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели9.9K

Когда вы работаете с данными, особенно если это начало вашего пути в аналитике, то порой вы можете попробовать делать выводы на общий цифрах, давая ответ из серии "в среднем по палате".

В этом материале я бы хотел рассказать, что если вы это делаете, то будьте аккуратный, ведь обобщенные цифры мало могут говорить о реальном положении дел. Общая цифра обычно отвечает только на один вопрос: что произошло со всей совокупностью в среднем, но люди, компании, профессии, товары, города и сотрудники не живут в среднем примерно от слова совсем.

И поэтому общий показатель - это скорее начало анализа, а не его итог.

Читать далее

Как одно неверно прочитанное слово вывело меня на прусское село, которое я искал полгода

Уровень сложностиПростой
Время на прочтение18 мин
Охват и читатели6.9K

Некоторое время назад я случайно познакомился с Леонидом, и вскоре выяснилось, что когда-то мы оба работали в EPAM, хотя были в разных командах и лично тогда не пересекались. Леонид уже много лет увлекается генеалогией и развивает проект Biografissimo. Знакомство с ним вернуло меня к давнему интересу к семейной истории.

Работая с открытыми источниками, Леонид обнаружил запись о рождении и крещении Виктора Витшаса, сына моего прадеда Вильгельма Рудольфа Витшаса и Анны Элизабет Штеркель, сорбские корни фамилии (Wićaz означает «свободный крестьянин») и сведения об Оскаре Эдмунде Эвальде Матвеевиче Витшасе, фабричном смотрителе из Моршанска.

Читать далее
1
23 ...