Statystyka i eksploracyjna analiza danych 2400-M1ABSEA
Celem zajęć jest zapoznanie studentów z podstawami analizy statystycznej w stopniu wystarczającym do samodzielnego i efektywnego analizowania danych ustrukturyzowanych, interpretowania i wyciągania wniosków z analiz tychże. Na kurs składają się następujące bloki tematyczne:
1. Wprowadzenie do statystyki:
znaczenie statystyki i analizy danych w biznesie,
typy struktur danych,
pojęcia populacji i próby, pojęcie zmiennej losowej, rozkład zmiennej losowej, funkcja gęstości, dystrybuanta,
wybrane rozkłady statystyczne: rozkład normalny, t-Studenta, F-Snedecora, Poissona, Gamma, Beta.
2. Wprowadzenie do języka programowania Python:
wczytywanie danych z różnych źródeł,
wybieranie obserwacji i zmiennych, filtrowanie, sortowanie,
mówienie podstawowych bibliotek języka programowania Python: numpy, pandas, statsmodels,
czyszczenie danych, wykrywanie i usuwanie duplikatów, wykrywanie, usuwanie i uzupełnianie braków danych,
przekształcanie struktur danych, łączenie zbiorów danych.
3. Miary położenia, rozproszenia i kształtu rozkładu:
średnia, mediana, moda, kwartyle, decyle, kwantyle, percentyle,
rozstęp, rozstęp międzykwartylowy, wariancja, odchylenie standardowe, współczynnik zmienności,
skośność, kurtoza.
4. Miary zależności i asocjacji:
korelacja Pearsona, Spearmana, Kendalla, współczynnik V Cramera.
5. Wizualizacja danych:
obserwacje odstające Wykres pudełkowy, obserwacje odstające, IQR, Z-score, zmodyfikowany Z-score,
przekształcenia zmiennych: kategoryzacja zmiennych ciągłych, one-hot-encoding, normalizacja, standaryzacja, winsoryzacja,
znaczenie i cele wizualizacji danych,
złe i dobre praktyki w wizualizacji,
rodzaje wykresów a typ danych (ciągłe, kategoryczne, szeregi czasowe),
przegląd bibliotek języka programowania Python: matplotlib, seaborn, plotly, pandas plotting.
6. Testowanie hipotez statystycznych:
hipotezy, statystyki testowe, wartości krytyczne, p-value, poziom istotności, błędy I i II rodzaju,
moc testu, moc a wielkość próby.
7. Wybrane testy statystyczne:
testy dla jednej grupy: testy na normalność rozkładu, test t, test Z, test dwumianowy, test χ² dla jednej grupy,
testy dla dwóch i więcej grup niezależnych: test t, test Wilcoxona, test χ², test Fishera. ANOVA, test Kruskala-Wallisa, test χ². Testy dla dwóch i więcej grup zależnych: test t, test Wilcoxona, test McNemara. ANOVA, test Q-Cochrana.
Szacunkowy nakład pracy studenta: 4ECTS x 25h = 100h
(K) - godziny kontaktowe (S) - godziny pracy samodzielnej
zajęcia: 30h (K) 0h (S)
konsultacje: 8h (K) 0h (S)
egzamin: 2h (K) 0h (S)
przygotowanie do zajęć: 0h (K) 30h (S)
przygotowanie zaliczenia: 0h (K) 30h (S)
Razem: 40h (K) + 60h (S) = 100h
|
W cyklu 2025Z:
Zajęcia realizowane w ramach projektu „Zintegrowany Program Rozwoju Dydaktyki ZIP 2.0”, współfinansowanego ze środków Europejskiego Funduszu Społecznego Program Fundusze Europejskie dla Rozwoju Społecznego 2021 2027 (FERS) (nr umowy: FERS.01.05 IP.08 0365/23 00). 1. Kwestie organizacyjne; wprowadzenie do statystyki 2. Wprowadzenie do języka programowania Python 3. Miary położenia, rozproszenia i kształtu rozkładu 4. Miary zależności i asocjacji 5. Wizualizacja danych 6. Testowanie hipotez 7. Wybrane testy statystyczne Szacunkowy nakład pracy studenta: |
Koordynatorzy przedmiotu
W cyklu 2026Z: | W cyklu 2025Z: |
Rodzaj przedmiotu
Efekty uczenia się
Po ukończeniu przedmiotu, student:
W ZAKRESIE WIEDZY:
zna i rozumie podstawowe pojęcia statystyczne,
zna i rozumie specyfikę wybranych rozkładów statystycznych,
zna i rozumie narzędzia pozwalające na przeprowadzanie wnioskowania statystycznego.
W ZAKRESIE UMIEJĘTNOŚCI:
potrafi wczytywać, oczyszczać i przygotowywać dane do analiz,
potrafi wyciągać wnioski w oparciu o miary położenia, rozproszenia, kształtu rozkładu, miary zależności i asocjacji,
potrafi wizualizować dane w sposób jasny i zrozumiały, jak również wyciągać wnioski na podstawie takich wizualizacji,
potrafi przeprowadzać i interpretować testy statystyczne.
W ZAKRESIE KOMPETENCJI:
jest gotów interpretować wyniki uzyskane w toku analiz statystycznych, co wynika ze zaznajomienia z najważniejszymi metodami statystycznymi i dobrymi praktykami w ich wykorzystywaniu,
wykazuje się zdolnością do krytycznej analizy uzyskanych wyników, co wynika z faktu omówienia przykładów zastosowań wspomnianych metod w trakcie zajęć.
Kryteria oceniania
Uzyskanie zaliczenia przedmiotu wymaga:
1. uzyskania co najmniej połowy punktów z egzaminu pisemnego;
2. uzyskania co najmniej połowy punktów z projektu przygotowanego w domu;
3. uzyskania co najmniej połowy punktów z prezentacji wyżej wspomnianego projektu;
4. uzyskania co najmniej połowy z łącznej sumy punktów uzyskanych ze wszystkich wymienionych powyżej elementów.
5. Skala ocen:
[0%-50%) - ndst
[50%-60%) - dst
[60%-70%) - dst+
[70%-80%) - db
[80%-90%) - db+
[90%-100%] - bdb
Literatura
Downey, A. B. (2014). Think stats: Exploratory data analysis in Python (Version 2.0.27).
Knaflic, C. N. (2015). Storytelling with data: A data visualization guide for business professionals. John Wiley & Sons, Inc.
Mangiafico, S. S. (2015). An R companion for the Handbook of Biological Statistics (Version 1.3.9, revised 2023) [Online handbook]. Rutgers Cooperative Extension. Retrieved from https://rcompanion.org/handbook.
Molin, S. (2021). Hands-on data analysis with pandas: Efficiently perform data collection, wrangling, analysis, and visualization using Python (2nd ed.). Packt Publishing.
Pant, D., & Mukhiya, S. K. (2025). Statistics for Data Scientists and Analysts: Statistical approach to data‑driven decision making using Python. BPB Publications.
|
W cyklu 2025Z:
Downey, A. B. (2014). Think stats: Exploratory data analysis in Python (Version 2.0.27). |