Flashcards in the set

Haven't started (33)

Was ist die Multiple Regression 

untersucht, wie mehrere unabhängige Variablen (Prädiktoren) gemeinsam eine abhängige Variable (Kriterium) erklären


Damit beantwortet die multiple Regression Fragen wie:

Wie verändert sich math, wenn escs steigt – unter Kontrolle von mig und gender?

Das „unter Kontrolle halten“ ist der entscheidende Unterschied zur einfachen Regression.

Unterschied Einfache Regression und Multiple Regression

Einfache Regression

1 Prädiktor

Zusammenhang zwischen X und Y

Gefahr von Scheinkorrelationen

Gleichung: Y=b0+b1X1


Multiple Regression

2 oder mehr Prädiktoren

Zusammenhang zwischen jedem X und Y unter Kontrolle der anderen Xs

Kontrolle von Störvariablen

Gleichung: Y=b0+b1X1+b2X2+...+bkXk

Wie stellt man eine Gleichung einer multiplen Regression auf?

Allgemeine Form:

Y=b0+b1X1+b2X2+⋯+bkXk


Beispiel mit einem PISA‑Werten:

math=475.56+41.16⋅escs+b2⋅mig+b3⋅gender


Interpretation des Koeffizienten 41.16:

Wenn escs um eine Einheit steigt, steigt math um 41.16 Punkte,

unter Kontrolle von mig und gender.


Wie berechnet man Multiple Regression in R ?

model <- lm(math ~ escs + mig + gender, data = pisa22)

summary(model)



Wie interpretiert man Multiple Regression?

Coefficients

  • Intercept: Grundwert von math, wenn alle Prädiktoren = 0
  • b-Werte: partieller Effekt jedes Prädiktors

Signifikanz (Pr > |t|)

  • Testet: Ist der Koeffizient ≠ 0?

  • Anteil der Varianz von math, der durch alle Prädiktoren gemeinsam erklärt wird
  • Typische Werte in Sozialforschung: 0.10–0.30
  • Du hattest bereits R² ≈ 0.15 – das ist absolut realistisch.

F‑Test

  • Testet: Erklären die Prädiktoren gemeinsam signifikant Varianz?


Was ist das Grundkonzept der multiplen linearen Regression?

Eine statistische Methode, um den Einfluss mehrerer unabhängiger Variablen auf eine abhängige Variable gleichzeitig zu untersuchen.

Was bedeutet „kontrollieren für andere Variablen“?

Der Effekt eines Prädiktors wird berechnet, während die anderen konstant gehalten werden, sodass Scheinkorrelationen reduziert werden

Wie lautet die allgemeine Gleichung der multiplen Regression?

Y=b0+b1X1+b2X2+⋯+bkXk

Was ist b?

zeigt, wie stark und in welche Richtung ein Prädiktor die Zielvariable beeinflusst – kontrolliert für alle anderen Variablen im Modell.

was sind b0, b1 und b2?

b₀ = Intercept (Grundwert von math, wenn alle Prädiktoren = 0 sind)

b₁ = Effekt des sozioökonomischen Status (escs)

b₂ = Effekt der elterlichen Unterstützung während Corona

Was bedeutet der Intercept (b₀)?

Der vorhergesagte Wert von Y, wenn alle Prädiktoren den Wert 0 haben.

 Wie wird eine multiple Regression in R berechnet?

model <- lm(Y ~ X1 + X2 + X3, data = daten)

summary(model)


Was zeigt der Koeffizient b₁ in der multiplen Regression?

Wie stark Y steigt oder fällt, wenn X₁ um eine Einheit steigt — unter Kontrolle der anderen Prädiktoren

Was bedeutet R² in der multiplen Regression?

Der Anteil der Varianz von Y, der durch alle Prädiktoren gemeinsam erklärt wird.

Was prüft der F‑Test im Regressionsmodell?

Ob die Prädiktoren gemeinsam signifikant Varianz in Y erklären.

Was sagt ein signifikanter p‑Wert eines Koeffizienten aus?

Dass der entsprechende Prädiktor einen statistisch bedeutsamen Einfluss auf Y hat.

Was ist ein partieller Effekt?

Der isolierte Einfluss eines Prädiktors auf Y, nachdem die anderen Prädiktoren berücksichtigt wurden.

Warum ist die multiple Regression in der Pädagogik besonders nützlich?

Sie erlaubt, komplexe Zusammenhänge zu analysieren, z. B. wie verschiedene soziale, schulische und individuelle Faktoren gemeinsam Leistungen beeinflussen.

Was bedeutet die Linearitätsannahme in der multiplen Regression?

Was bedeutet die Linearitätsannahme in der multiplen Regression?

Was bedeutet die Annahme der unabhängigen Residuen?

Die Fehler dürfen nicht miteinander korreliert sein. Besonders wichtig bei Zeitreihen oder Clusterdaten.

Was ist Homoskedastizität?

Die Varianz der Residuen ist über alle Werte der Prädiktoren hinweg konstant. Verletzung: Heteroskedastizität → trichterförmige Muster im Residuenplot.

Warum müssen Residuen normalverteilt sein?

Damit die Signifikanztests (t‑Tests, F‑Test) gültig sind. Überprüfung: Q‑Q‑Plot.

Was ist Multikollinearität?

Wenn Prädiktoren stark miteinander korrelieren, sodass ihre individuellen Effekte nicht mehr zuverlässig geschätzt werden können. Indikator: VIF > 5 (oder > 10 je nach Lehrbuch).

Wofür steht der VIF?

Ein Maß dafür, wie stark die Varianz eines Koeffizienten durch Multikollinearität aufgebläht wird.

Was zeigt ein Residuenplot?

Die Abweichungen zwischen vorhergesagten und tatsächlichen Werten. Ziel: Keine Muster → gute Modellpassung

Wozu dient ein Q‑Q‑Plot?

 Zur Überprüfung, ob die Residuen normalverteilt sind. Interpretation: Punkte sollten auf der Diagonalen liegen.

Was sind einflussreiche Datenpunkte?

Beobachtungen, die das Modell stark verzerren können. Maße: Cook’s Distance, Leverage.

Was misst Cook’s Distance?

Wie stark ein Datenpunkt die Regressionskoeffizienten beeinflusst. Daumenregel: Werte > 1 sind kritisch.

Was ist der Unterschied zwischen R² und Adjusted R²?

R²: Anteil der erklärten Varianz.

Adjusted R²: korrigiert für die Anzahl der Prädiktoren; verhindert künstliche Aufblähung.

Was prüft der F‑Test?

Ob alle Prädiktoren gemeinsam signifikant Varianz in der abhängigen Variable erklären.

Was ist Overfitting?

Wenn das Modell die Trainingsdaten zu gut abbildet und dadurch für neue Daten schlecht generalisiert.

Wozu dienen standardisierte Koeffizienten?

Sie ermöglichen den Vergleich der relativen Stärke der Prädiktoren, da alle Variablen auf die gleiche Skala gebracht werden.

Warum braucht man Dummy‑Variablen?

Um kategoriale Variablen in die Regression einzubinden. Beispiel: Geschlecht → 0 = männlich, 1 = weiblich.