Karteikarten im Karteikarten-Set

Noch nicht gestartet (23)

Machine Learning – Definition

- Prinzipien, Methoden und Algorithmen verwenden, um etwas zu Lernen und auf der Basis von historischen Daten Vorhersagen zu machen

 

Beispiele:

- Spracherkennung - Siri

- Handschrifterkennen

- Textfilterprogramme (Spamfilter)

- Robotics (Google Fahrerlose Autos)

- Prinzipien, Methoden und Algorithmen verwenden, um etwas zu Lernen und auf der Basis von historischen Daten Vorhersagen zu machen

 

Beispiele:

- Spracherkennung - Siri

- Handschrifterkennen

- Textfilterprogramme (Spamfilter)

- Robotics (Google Fahrerlose Autos)

Machine Learning - Ziel:

- etwas Lernen, um einen Task auf Basis von Erfahrung auszuführen

- Maschine soll die relevanten Kriterien automatisch von vergangenen Beobachtungen lernen und auf gegebene Situationen anwenden

- Performance eines Tasks aufgrund von Erfahrung

- Performance: wird oft in % gemessen

- benötigt Methoden aus Statistik, Wahrscheinlichkeitstheorien,…

Machine Learning – Task

152485714962dcfddd0ff719.06884267phpxDiZhT.png

Beispiele von Machine Learning:

Regression

→ kontinuierlichem Output (z.B. selbstfahrendes Auto)

→ bezieht sich auf reale Zahlen

 

Klassifikation

- diskreter Output (mit bestimmten Kategorien)

→ bezieht sich auf Klassenlabel

- z.B. Spamfilter

 

Clustering

- nahegelegene Punkte werden in einem Cluster zusammengefasst

→ Struktur innerhalb von Daten erkennen

Machine Learning – Supervised und unsupervised learning

Supervised learning

= Daten mit Labels (historische Daten z.B. Spam – JA/NEIN-Klassifizierung)

- wird häufig bevorzugt, wenn diese Daten vorliegen

 

Unsupervised learning

= Daten ohne Labels (z.B. Vermutung, dass Spams anders geschrieben sind als normale Mails)

- Versuch, eine Struktur in den Daten zu finden

- z.B. Clustering (Klassen aufgrund von statistischen Eigenschaften des Datensatzes finden)

k-nearest Neighbor (k-NN) Klassifikation

Input:

- Trainingsdaten als Vektoren in einem multidimensionalen Raum

- jeder Datensatz hat ein Klassenlabel

- Klassifikation als Mehrheitswahl (der Klassifikation der Nachbarn)

→ Ergebnis abhängig von der Anzahl der Nachbarn, die betrachtet werden (k)

→ k sollte optimiert werden (basierend auf cross-validation)

Distanz berechnen, um die Nachbarn in der Nähe zu identifizieren

133995674662dd03889a12f4.09099038php6EsVEF.png

k-nearest Neighbor – Case study

 

Können wir die Kreditwürdigkeit von Konsumenten vorhersagen?

34299013262dd04b9dc1300.20068925php6lUXmt.png

Entscheidungsbäume in R implementieren

172618124362dd0511b7b269.84477031phpnLuvVq.png

Assessment der Modelle (anhand folgender Kriterien)

1.      Vorhersagekraft des Modells (bei neuen Daten)

2.      Dauer der Erstellung und Vorhersage des Modells

3.      Robustheit

4.      Skalierbarkeit

5.      Interpretierbarkeit

Manuelle Berechnung der Precision in R

41819084562dd05969a0ed5.66544879phpsvPbIG.png

Manuelle Berechnung der Accuracy in R

32903961962dd05b2736c87.12319812phpgcXd6N.png

Trade-off: Sensitivity vs. Specificity/Precision

45607506262dd05d37aed22.03037752php1kcRKG.png

Predictive vs. Explanatory Power

1.      Empirische Modelle für Vorhersagen

→ statistische Modelle, Methoden des Data minings

→ Vorhersagen über neue Beobachtungen

→ Predictive Analytics (accuracy, precision)

 

2.      Empirische Modelle für Erklärungen

→ testen Hypothesen

→ Erklärungsgehalt wird gemessen durch statistische Tests und R²

 

→ Erklärungsgehalt bedeutet nicht, dass das Modell gute Vorhersagen treffen kann

Overfitting

- wenn der Lernalgorithmus zu lange performt und sich zu stark an die Trainingsdaten anpasst

→ die Vorhersagekraft bei den Testdaten sinkt jedoch

Lösungsansätze für Overfitting und Lernkurve des Modells

97354757862dd064b6789f3.70833981phpkoXRy2.png

Gründe für Resampling

206139222762dd068177d504.83457445php3QwdPH.png

Model tuning

- meistens müssen Parameter optimiert werden

→ durch die cross-validation können diese Parameter optimiert werden (beispielsweise optimale Anzahl von k)

Das caret Package

- Funktionen 

119630724262dd07276dcf90.17904442phpf3mJQC.png

Modell Trainieren:

213453688862dd0754995b40.84201456phpw7Xdl2.png

Vorhersage anhand der Testdaten → mit Hilfe der Confusion Matrix :

177798540062dd077bd099e3.78877158phpulSpG8.png

Different ways to improve your model 

31570132262dd079c81bac0.91480700phpUoLvc0.png

Underfitting und overfitting -> grafisch 

170904251262dd07bbad8846.66139981phptrVApE.png