Web scrapping 2400-SP-DS-WEB
Celem kursu jest zapoznanie słuchaczy z narzędziami umożliwiającymi w pełni zautomatyzowane, wydajne i skuteczne zbieranie danych ze źródeł internetowych. Z uwagi na specyfikę podejmowanej problematyki w pierwszej kolejności zreferowane zostaną regulacje prawne precyzujące kiedy tego typu działanie jest legalne oraz jakie konsekwencje może rodzić ich naruszenie. Następnie kursanci zostaną pokrótce zaznajomieni z węzłową strukturą stron internetowych i metodami jej eksploracji.
Zaprezentowane zostaną narzędzia umożliwiające inwestygację struktur statycznych stron internetowych, czyli takich których pobierana automatycznie zawartość nie różni się od tej wyświetlanej w przeglądarce, jak również stron o charakterze dynamicznym, modyfikowanych przez skrypty. W szczególności omówione zostaną możliwości bibliotek BeautifulSoup i Selenium dostępnych w języku programowania Python. Ponadto słuchacze zostaną zapoznani z technikami radzenia sobie z byciem blokowanym przez administratora stron internetowych oraz CAPTCHA. Omówione zostanie w szczególności to jak pozostać niewykrytym skutecznie symulując zachowanie człowieka. Dodatkowo zaprezentowane będzie dynamiczne zmienianie charakterystyk programu zbierającego dane - tzw. UserAgent zawierającego informacje o wykorzystywanym urządzeniu i przeglądarce, jak również adresu IP.
Koordynatorzy przedmiotu
Rodzaj przedmiotu
Tryb prowadzenia
Kryteria oceniania
Test zaliczeniowy - do zaliczenia wymagana jest 50% poprawnych odpowiedzi na 10 pytań.
Literatura
Materiały przygotowywane przez wykładowcę i udostępniane uczestnikowi na platformie Google Drive.