Отличная статья. Особенно про Playwright — сам недавно через это прошёл, когда парсил Transfermarkt для своего ML-проекта.
У меня сайт оказался хитрее: просто подменить User-Agent и поставить таймауты оказалось недостаточно. Пришлось эмулировать поведение реального пользователя: случайные задержки, движение мыши (через pyautogui), и даже менять fingerprint браузера через playwright-stealth. Без этого бан летел после 50-60 запросов
Спасибо за статью, особенно про ROI и NPV. У самого сейчас проект — ML-модель для спортивной аналитики. Я как раз упираюсь в вопрос: какую метрику считать основной на раннем этапе, когда данных мало?
Вы пишете про ROI 125-150% у ВкусВилла. А для небольших проектов, где точность модели на уровне 60-65%, какой порог ROI считать адекватным? Или на таком этапе лучше смотреть на другие метрики вроде AUC / логического выигрыша?
Отличная статья. Особенно про Playwright — сам недавно через это прошёл, когда парсил Transfermarkt для своего ML-проекта.
У меня сайт оказался хитрее: просто подменить User-Agent и поставить таймауты оказалось недостаточно. Пришлось эмулировать поведение реального пользователя: случайные задержки, движение мыши (через pyautogui), и даже менять fingerprint браузера через playwright-stealth. Без этого бан летел после 50-60 запросов
Спасибо за статью, особенно про ROI и NPV. У самого сейчас проект — ML-модель для спортивной аналитики. Я как раз упираюсь в вопрос: какую метрику считать основной на раннем этапе, когда данных мало?
Вы пишете про ROI 125-150% у ВкусВилла. А для небольших проектов, где точность модели на уровне 60-65%, какой порог ROI считать адекватным? Или на таком этапе лучше смотреть на другие метрики вроде AUC / логического выигрыша?