Mikrokurs: Analiza danych w Pythonie z wykorzystaniem NumPy, Pandas i modeli sztucznej inteligencji 0000-MIKRO-ADWP-UP
Omówione zostaną biblioteki NumPy i Pandas, które będą wykorzystate do praktycznych zadań analitycznych, w szczególności wykorzystamy metodę Monte Carlo i macieży kowariancji w kontekście zadań związanych z oceną ryzyka.
Biblioteka Pandas zostanie wprowadzona jako narzędzie analityczne, które można używać jako często lepsza alternatywa dla popularnych pakietów statystycznych jak SAS czy SPSS.
W ramach mini-projektu analitycznego uczestnicy pracują na rzeczywistym zbiorze danych, wykonują agregacje, analizują wyniki i wykrywają anomalie prostymi metodami oraz z użyciem MAD i IQR.
Ostatnia część kursu obejmuje wizualizację danych w Matplotlib i Seaborn oraz wykorzystanie modeli językowych, w tym otwartych modeli z Hugging Face, do analizy ryzyka i perspektyw finansowych jako uzupełnienie czysto statystycznych analiz.
Moduł 1. Numpy - podstawy
Podstawy Numpy, po co jest, jaki problem rozwiązuje. Kwestie wydajności i brak w Pythonie bezpośredniego wsparcia dla operacji algebraicznych. Typy danych wspierane przez Numpy, najważniejsze podstawowe operacje na tablicach NumPy.
Moduł 2. Numpy - tematy zaawansowane
Poznamy bardziej zaawansowane możliwości Numpy:
- Operacje algebraiczne (wektorowe i macieżowe) w Numpy
- Metoda Monte Carlo.
- Zastosowania w analizie ryzyka.
Moduł 3. Numpy - metoda macierzt kowariancji. Wprowadzenie do Pandas.
Zawansowane operacje algebraiczne w Numpy, zastosowanie w analizie ryzyka, w ocenie porfeli inwestycyjnych
Wprowadzenie do Pandas - motywacja powstania, porównanie z innymi rozwiązaniami - od SQL po SPSS-a.
Moduł 4. Pandas - Podstawy
Pandas jako narzędzie do obliczeń statystycznych (alternatywa dla R/SAS/SPSS tylko w Pythonie). Podstawowe operacje na DataFrame, typy danych, obsługa brakujących danych.
Mini-projekt analityczny (część I) - praca ze zbiorem danych, wykrywanie anomalii (proste metody).
Moduł 5. Pandas - Tematy zaawansowane.
Agregacja danych i operacje na zagregowanych danych. Sortowanie danych, łącznie danych. Podobieństwa z bazami danych SQL.
Mini-projekt analityczny (część II). Analiza agregowanych danych. Wykrywanie anomali przy pomocy Median Absolute Deviation oraz IQR.
Moduł 6. Wizualizacja danych i wykorzystanie modeli językowych w analizach
finansowych
Biblioteki Matplotlib i Seaborn. Zastosowanie w eksploracyjnej analizie danych. Wykorzystatnie różnego rodzaju modeli językowych przy analizie ryzyka, ocenie perspektyw finansowych. Użycie wyspecjalizowanych modeli otwartych z Hugging Face. Uruchamianie modeli lokalnie i wykorzytywanie ich we wsłasnych programach analitycznych.
Certyfikat mikropoświadczenia
Koordynatorzy przedmiotu
Tryb prowadzenia
Założenia (opisowo)
Efekty uczenia się
Student po zaliczeniu kursu zdobył wiedzę w zakresie:
- zaawansowanych technik programowania w języku Python
- wykorzystania biblioteki Numpy do obliczeń numerycznych, statystycznych i algebry liniowej
- zastosowań metody symulacji Monte Carlo
- zastosowań macierzy kowariancji
- wykorzystania biblioteki Pandas do analiz statystycznych
- wykorzystania modeli językowych sztucznej inteligencji uruchamianych na własnym sprzęcie komputerowym
- wykorzystania biblioteki Seaborn i Matplotlib do wizualizacji danych
Student zdobył następujące umiejętności w zakresie:
- wykorzystanie biblioteki Numpy i symulacji Monte Carlo do analizy ryzyka w zastosowaniach finansowych
- wykorzystania biblioteki Pandas i wybranych modeli dostępnych przez portal Hugging Face do wykrywania anomalii w zastosowaniach finansowych
- wykonania eksploracyjnej analizy danych przy pomocy wizualizacji danych
Kryteria oceniania
Efekty uczenia się będą weryfikowane na bieżąco za pomocą zadań warsztatowych, wykonywanych przez uczestników podczas zajęć. Sposób zaliczenia: ocena warsztatów.
Literatura
Materiały przygotowane przez prowadzącego