Pull to refresh
0
Send message

Тело запроса: это фактические данные, которые клиент хочет получить от сервера

Хуже всего, когда нас - "самых маленьких" вводят в заблуждение неверными фразами. Получается в одном месте написано правильно, в другом неправильно. А новички долго разбираются где же истина.

Тело запроса - это то что клиент отправляет серверу, а не то что он хочет получить от сервера. Понятно, что это ошибка перевода. Но, блин! Такие неточности реально иногда так запутывают

Вытащить нужную информацию из текстового контента (html, json или др.) очень простая задача. Еще раз, ОЧЕНЬ простая задача.
При парсинге сайтов основная проблема - это получение контента с сайта, а не его разбор.
Раз уж вы запускаете "курс по парсингу сайтов", то наверняка хорошо разбираетесь в данной теме. Рассказали бы нам о действительно насущной проблеме - как получать контент с сайтов надежно, быстро и стабильно.
Покажите на реальных сайтах, а не на демонстрационных статичных страничках.
Начните хотя бы со среднего уровня сложности - как получать контент с таких сайтов как озон, домклик, золотое яблоко. И не просто как его получать, а самым лучшим и оптимальным способом.
Дайте реальные кейсы, а не то, что грубо говоря, знает каждый первоклассник. Вот это будет ценная и полезная информация - которую интересно будет почитать. А вы алфавит нам предлагаете, который ну просто на каждом шагу.

Мда, Хабр нынче не тот, что раньше. Принимает статьи от всех, кто вчера освоил requests и beautifulsoup. Зачем эта статья? На том же Хабре наверное сотни таких статей про эти библиотеки.

import requests from bs4 import BeautifulSoup response = requests.get('http://parsingme.ru/beautifulsoup/1.html') tree = response.text soup = BeautifulSoup(tree, 'lxml')

Зачем вы повторяете этот кусок кода из раза в раз. Почти вся статья только из этих строк и состоит.

И уже "1 февраля стартует мой курс по парсингу..." Вы серьезно?!

О боги!!! Я нашёл это крутое объяснение, зачем нужен poetry и чем он лучше pip. Можете смеяться, но не всем это очевидно. Автору респектище!

ozon.ru, например, вы с помощью простых http-клиентов (requests, aiohttp и им подобных) не спарсите.
Даже если скопируете из браузера и передадите в запросе все реальные браузерные заголовки. И даже если пробовать json напрямую из api запрашивать. Проверено. Потому что там в каждом запросе должен быть уникальный токен. А токены из предыдущих запросов браузера уже "протухшие". А новый токен http-клиент получает в предварительном запросе-ответе, пройдя проверку на способность обработать javascript. Так что http-клиенты не умеющие обрабатывать js блокируются. Поэтому увы, ваш метод не сработает для особо защищенных сайтов.

"этот туториал" подойдет для парсинга разве что для указанного в статье сайта example.com
Сайты с защитой от парсинга такой парсер с указанными настройками заблокируют

Information

Rating
Does not participate
Registered
Activity