Комментарии 8
Отличный кейс! Но он же показывает главную боль: чтобы агент мог просто сравнить 45 товаров, человеку пришлось писать парсер и разбираться в вёрстке. А ведь было бы классно, если бы сайты сами шли навстречу — добавляли llms.txt, файл-карту для ИИ: что за сайт, какие параметры, какие эндпоинты. Тогда агент читал бы его и собирал нужное сам, без всякого кода. Я у себя так сделал, вот живой пример: https://cinefilter.app/llms.txt — заняло полчаса.
Я себе для айхерба сделал экстеншен для хрома что бы он непосредственно в интерфейсе айхерба показывал для развесных продуктов цену за 100гр

Сайты без защиты хорошо парсятся сейчас. А вот с сайтами которые даже для проверки curl выдают 403 ошибку и где уже даже со специальными библиотеками попадаешь в пермаментный бан , тут все очень сложно) Самый кайф на сайте найти API )
Забавная история была недавно , в РФ есть один из крупнейших сайт по канц товарам , там админ параноик , как я понял настроил максимально жесткие правила в WAF и если слишком активно пользоваться сайтом , выдает пермаментный бан .. про парсинг молчу как раз. Весело будет когда у них резко снизится аудитория и причину найдут в журналах лога , руководители)
Без опыта программирования, да но все это мягко говоря очень так себе))
Но свою проблему решили - оке. Самое забавное это сам сайт. Проверка на бота на HTML, с классом на элементе который нужно кликнуть, сама проверка при курле не показывается, и какой-то укр текст в исходниках)))
Спасибо за честную оценку! Полностью согласен: с точки зрения профи код наверняка «так себе» 😅 Писали с нейросетью методом научного тыка, да там и итераций то было всего 3.
И для меня главный критерий успеха — что JSON на выходе получился и нужный белок был найден. Теперь надо отлистать на его покупку

Из немыслимого в элементарное: парсинг сайта спортпита на Python без бэкграунда программиста