|
12.2.
|
přednáška: Data Mining, motivace, proces získávání znalostí z dat, modely procesů, základní pojmy, předzpracování dat -- šum, odlehlé body, chybějící hodnoty.
|
|
|
cvičení: Projekt R, explorační analýza dat v R, doplnění chybějících hodnot v R, zadání zkouškového úkolu.
|
|
|
slajdy: 1, 2, 3
|
|
19.2.
|
přednáška: Redukce dimenzionality: Analýza hlavních komponent, Fisherův lineární diskriminant, metody selekce atributů; Metody diskretizace dat;
|
|
|
cvičení: Probrané metody v R.
|
|
|
slajdy: 4, 5, 6
|
|
26.2.
|
přednáška: Učení nez učitele: shlukování, hierarchické shlukování, shlukování založené na cílové funkci, shlukování založené na hustotě, fuzzy shlukování; asociační pravídla, algoritmus Apriori.
|
|
|
cvičení: Probrané metody v R
|
|
|
slajdy: 7, 8, 9
|
|
5.3.
|
přednáška: Učení s učitelem: rozhodovací stromy, ID3 a C4.5
|
|
|
cvičení: Probrané metody v R
|
|
|
slajdy: 10
|
|
12.3.
|
přednáška: Neuronové sítě; metoda GUHA; okrajová témata.
|
|
|
cvičení: Probrané metody v R.
|
|
|
slajdy: 11, 12
|
|
19.3.
|
rezerva
|
Upozornění: Slajdy budu upravovat, ale aktuální verze bude vystavena vždy v den přednášky.
Zápočet a zkouška
Zápočet i zkouška budou uděleny za vypracování úkolu zpracovávaného doma a v průběhu cvičení.
Data
00000_00999,
01000_01999,
02000_02999,
03000_03999,
04000_04999,
05000_05999,
06000_06999,
07000_07999,
08000_08999,
09000_09999,
10000_10999,
11000_11999,
12000_12999,
13000_13999,
14000_14999,
15000_15999,
16000_16999,
17000_17999,
18000_18999,
19000_19999.
20000_20999,
21000_21999,
22000_22999,
23000_23999.
Důležité okazy
LIPS miner -- http://lispminer.vse.cz/
R Project -- http://www.r-project.org/
UC Irvine Machine Learning Repository -- http://archive.ics.uci.edu/ml/
Co ten Konečný vlastně chce:
0) Statistiky -- % potrestaných, nepotrestaných
% kolik potrestaných nedostalo trest.
1) Pokrytí nejčastějšími x slovy
graf pošet slov vs. pokrytí ...
--- podívat se na nejméně pokryté chatlogy
... pokusit se zdůvodnit, proč jsou nepokryté
[překlepy, záměrné překlepy, jiný jazyk]
--- totéž zopakovat po odstranění jmen
2) Funkce měřící podobnost slov na vyrovnání se
s překlepy, záměrnými překlepy...
---- návrh, implementace, teorie okolo
Pokusit se najít dostatečně blízké sousedy vybraných slov
např.: "nigger, mother, fuck,.."
3) Aplikace shlukování
---- výběr vhodné metody, vzdálenosti ...
---- Nějaká reprezentace výsledku (dendogram), 2d diagram s použitím SOM (viz 6).
---- interpretace výsledku.
4) Aplikace klasifikátoru
---- Aplikovat nějakou metodu učení konceptu: NN, DT.
---- uvést všechny detaily:
(rozdělení na testovací/trénovací množinu,
jakým způsobem jste se snažili potlačovat falešně pozitivní výstupy
(např. různý faktor učení při falešně pozitivních a falešně negativních výsledků)
---- Výsledek (přesnost, specifičnost...),
Interpretace výsledků. Proč to selhává?
5) Výběr relevantní množiny atributů (= detekce "neutrálních" slov)
---- Výběr metody
---- Výsledek (výpis relevatních/neutrálních slov)
---- Zhodnocení výsledku.
6) Aplikace SOM, --- bude zadáno.