W ramach kursu omówione zostaną kolejno następujące zagadnienia:
1.Wprowadzenie do przetwarzania danych tekstowych:
tokenizacja,
stemming,
lemmatyzacja,
stopwords,
n-gramy,
metryki TF, IDF, TF-IDF.
2. Analiza sentymentu oparta na słownikach:
SentiStrength,
AFINN,
Pattern,
VADER.
3. Analiza sentymentu oparta na korpusach:
słowniki oparte na podobieństwie,
Label Propagation Algorithm.
4. Analiza sentymentu w oparciu o algorytmy uczenia nienadzorowanego:
klastrowanie oparte na podobieństwie,
modelowanie tematów: LSA, NMF, PLSA, LDA, BERTopic.
5. Analiza sentymentu w oparciu o algorytmy uczenia nadzorowanego:
ekstrakcja cech,
wybór zmiennych,
modele regresyjne i klasyfikacyjne,
modele multiklasyfikacyjne,
interpretowalność, wyjaśnialna sztuczna inteligencja.
6. Analiza sentymentu w oparciu o uczenie głębokie:
wprowadzenie do uczenia głębokiego,
osadzenia słów i zdań, duże modele językowe,
rekurencyjne sieci neuronowe,
LSTM.
7. Analiza sentymentu w oparciu o transformery:
BERT,
RoBERTa,
BioBERT, FinBERT, HateBERT, TwitterBERT.
Szacunkowy nakład pracy studenta:
Typ aktywności K (kontaktowe) S (samodzielne)
wykład (zajęcia) 0 0
ćwiczenia (zajęcia) 30 30
egzamin 0 0
konsultacje 5 0
przygotowanie do ćwiczeń 0 10
przygotowanie do wykładów 0 0
przygotowanie do kolokwium 0 0
przygotowanie do egzaminu 0 0
… 0 0
Razem 35 40 = 75