KMI/ZZD Zpracování dat

(částečně aktualizováno pro letní semestr 2012/2013)

Rozvrh předmětu

Kurz probíhá pouze v první polovině letního semestru, ale s dvojnásobnou intenzitou -- tedy dvě přednášky a dvě cvičení týdně.
Přednáška: Úterý 13:15 - 14:45 (LP-5070)
Přednáška: Úterý 16:45 - 18:15 (LP-5070)
Cvičení: Úterý 18:30 - 19:15 (LP-5070)
Cvičení: Úterý 19:15 - 20:00 (LP-5070)

Sylabus

12.2. přednáška: Data Mining, motivace, proces získávání znalostí z dat, modely procesů, základní pojmy, předzpracování dat -- šum, odlehlé body, chybějící hodnoty.
cvičení: Projekt R, explorační analýza dat v R, doplnění chybějících hodnot v R, zadání zkouškového úkolu.
slajdy: 1, 2, 3
19.2. přednáška: Redukce dimenzionality: Analýza hlavních komponent, Fisherův lineární diskriminant, metody selekce atributů; Metody diskretizace dat;
cvičení: Probrané metody v R.
slajdy: 4, 5, 6
26.2. přednáška: Učení nez učitele: shlukování, hierarchické shlukování, shlukování založené na cílové funkci, shlukování založené na hustotě, fuzzy shlukování; asociační pravídla, algoritmus Apriori.
cvičení: Probrané metody v R
slajdy: 7, 8, 9
5.3. přednáška: Učení s učitelem: rozhodovací stromy, ID3 a C4.5
cvičení: Probrané metody v R
slajdy: 10
12.3. přednáška: Neuronové sítě; metoda GUHA; okrajová témata.
cvičení: Probrané metody v R.
slajdy: 11, 12
19.3. rezerva
Upozornění: Slajdy budu upravovat, ale aktuální verze bude vystavena vždy v den přednášky.

Zápočet a zkouška

Zápočet i zkouška budou uděleny za vypracování úkolu zpracovávaného doma a v průběhu cvičení.

Data

00000_00999, 01000_01999, 02000_02999, 03000_03999, 04000_04999, 05000_05999, 06000_06999, 07000_07999, 08000_08999, 09000_09999, 10000_10999, 11000_11999, 12000_12999, 13000_13999, 14000_14999, 15000_15999, 16000_16999, 17000_17999, 18000_18999, 19000_19999. 20000_20999, 21000_21999, 22000_22999, 23000_23999.

Důležité okazy

LIPS miner -- http://lispminer.vse.cz/
R Project -- http://www.r-project.org/
UC Irvine Machine Learning Repository -- http://archive.ics.uci.edu/ml/

Co ten Konečný vlastně chce:

0) Statistiky -- % potrestaných, nepotrestaných
                 % kolik potrestaných nedostalo trest.

1) Pokrytí nejčastějšími x slovy

   graf pošet slov vs. pokrytí ...

   --- podívat se na nejméně pokryté chatlogy
   ... pokusit se zdůvodnit, proč jsou nepokryté 
   [překlepy, záměrné překlepy, jiný jazyk]

   --- totéž zopakovat po odstranění jmen 


2) Funkce měřící podobnost slov na vyrovnání se
   s překlepy, záměrnými překlepy...

   ---- návrh, implementace, teorie okolo

   Pokusit se najít dostatečně blízké sousedy vybraných slov
   např.: "nigger, mother, fuck,.."


3) Aplikace shlukování
   ---- výběr vhodné metody, vzdálenosti ...
   ---- Nějaká reprezentace výsledku (dendogram), 2d diagram s použitím SOM (viz 6).
   ---- interpretace výsledku.

4) Aplikace klasifikátoru
   ---- Aplikovat nějakou metodu učení konceptu: NN, DT.

   ---- uvést všechny detaily:
	(rozdělení na testovací/trénovací množinu,
	jakým způsobem jste se snažili potlačovat falešně pozitivní výstupy
	(např. různý faktor učení při falešně pozitivních a falešně negativních výsledků)

   ---- Výsledek (přesnost, specifičnost...), 
        Interpretace výsledků. Proč to selhává?

5) Výběr relevantní množiny atributů (= detekce "neutrálních" slov)
   ---- Výběr metody
   ---- Výsledek (výpis relevatních/neutrálních slov)
   ---- Zhodnocení výsledku.


6) Aplikace SOM, --- bude zadáno.