Was ist ein Klassifikationsproblem?
Gegeben: Datenpunkte (x1,y1),...,(xm,ym)(x_1, y_1), ..., (x_m, y_m)(x1,y1),...,(xm,ym)
Ziel: Finde eine Funktion f(x)f(x)f(x), die den korrekten Output yyy für neue xxx vorhersagt.
Formel: k-Nearest Neighbour
1.Suche die kkk nächsten Nachbarn
2.Nimm die Mehrheitsklasse der Nachbarn
Was ist ein Entscheidungsbaum?
Ein Baum, bei dem jeder innere Knoten ein Feature testet und jedes Blatt einen Klassifikationswert angibt.
Greedy Decision Tree Lernalgorithmus
Greedy Decision Tree Lernalgorithmus
Wähle das Feature mit größtem Informationsgewinn. Teile die Daten nach den Featurewerten und rekursiv weitermachen.
Was ist ein linearer Klassifikator?
h(x)=sgn(⟨w,x⟩−b)
Perzeptron-Update-Regel:
Wenn Vorhersage falsch:
w←w+yxw \leftarrow w + yxw←w+yx
SVM Optimierung
min∥w∥2 s.t. yi⟨w,xi⟩≥1y_i \langle w, x_i \rangle \geq 1yi⟨w,xi⟩≥1
Logistische Regression:
fw(x)=σ(⟨w,x⟩),
wobei σ(z)=11+e−z\sigma(z) = \frac{1}{1 + e^{-z}}σ(z)=1+e−z1
Was ist das Ziel von k-Means Clustering?
Eine Menge von Punkten in genau k Clustern zu gruppieren, wobei Punkte innerhalb eines Clusters nah beieinander liegen sollen.
Wie funktioniert der k-Means Algorithmus?
Initialisiere k Zentren (z.B. zufällig)
Ordne jeden Punkt dem nächsten Zentrum zu
Aktualisiere die Zentren als Mittelwerte ihrer Cluster
Wiederhole, bis keine Änderung mehr auftritt
Warum konvergiert k-Means?
Die Fehlerfunktion (Summe der quadrierten Abstände) sinkt monoton und es gibt endlich viele mögliche Clusterzuordnungen.
Ist k-Means optimal?
Nein, es kann in lokale Minima konvergieren und hängt stark von der Initialisierung ab.
Was ist Entropie?
Maß für die durchschnittliche Information eines Zufallsexperiments:
H(X)=−∑p(x)log(p(x))H(X) = -\sum p(x) \log(p(x))H(X)=−∑p(x)log(p(x))
Wann ist die Entropie maximal?
Bei Gleichverteilung, also wenn alle Ereignisse gleich wahrscheinlich sind:
H(X)=log(n)H(X) = \log(n)H(X)=log(n)
Wie wählt man das beste Attribut für einen Entscheidungsbaum?
Man wählt das Attribut mit dem höchsten Information Gain.
Was ist der Information Gain?
Differenz zwischen Entropie vor und nach Aufteilung:
G(S,A)=H(Y)−∑x∣Sx∣∣S∣⋅H(Y∣x)G(S, A) = H(Y) - \sum_x \frac{|S_x|}{|S|} \cdot H(Y|x)G(S,A)=H(Y)−∑x∣S∣∣Sx∣⋅H(Y∣x)