Was ist eine Ex-Post-Facto-Anordnung?
Nicht-experimentelles Querschnittdesign
Häufig handelt es sich um Befragungen.
Hinweis: Natürliche Experimente sind keine Ex-Post-Facto-Anordnungen.
Unterscheidungskriterium ist das Auftreten eines manipulierenden Ereignisses (vs. der reinen Beobachtung von unterschiedlichen Merkmalsausprägungen). Die unabhängige Variable wird zum Zeitpunkt des Eintretens des Ereignisses „beobachtet“.
Was ist beobachtete Heterogenität?
Systematische Unterschiede zwischen Gruppen in gemessenen Merkmalen Z.
Was ist unbeobachtete Heterogenität?
Systematische Unterschiede zwischen Gruppen in nicht-gemessenen Merkmalen.
Was sind nicht-kausale Effekte?
⇒ Nicht kausale Effekte bzw Korrelationen sind Zusammenhänge
zwischen zwei Variablen X und Y, die in Daten/Empirie auftreten, ohne dass X einen kausalen Einfluss auf Y ausübt
Welche drei Bedingungen gibt es bei kausalen Beziehungen?
Bei fehlender Randomisierung vermuten wir eine kausale Beziehung zwischen X und Y, wenn drei Bedingungen erfüllt sind:
Aber: Kein sicherer Kausalschluss. Unbeobachtete Heterogenität, d. h. nicht gemessene Merkmale, die den statistischen Zusammenhang erklären könnten (siehe unten).
Statistische Kontrolle: → Multivariate Analyseverfahren.
was ist statistische Kontrolle?
Statistische Kontrolle heißt, dass der Einfluss von dritten Merkmalen Z auf die statistische Beziehung zwischen X und Y herausgerechnet wird.
(Experimentelle Kontrolle erfolgt dagegen durch Randomisierung).
Was ist eine Node?
Node (Knoten):
• eine Variable
• dargestellt durch einen Buchstaben
• ausgefüllter Kreis: beobachtet
• hohler Kreis: unbeobachtet
Was sind Children?
• Variablen, die direkt von einer anderen Variable verursacht werden
Was sind Descendents?
• Variablen, die direkt oder indirekt von einer anderen Variable
verursacht werden
Was sind Parents?
• direkte Ursachen einer Variable
Was sind Ancestors?
• alle direkten und indirekten Ursachen einer Variable
Was ist eine Scheinkorrelation?
• Z zeitlich vor X und Y
• Korrelation zwischen X und Y verschwindet bei Kontrolle von Z.
• Besserer Begriff: Scheinkausalität, weil die Korrelation bivariat ja tatsächlich existiert.
Was ist ein indirekter Effekt?
Die Wirkung von X auf Y wird über Z vermittelt. Bei Kontrolle von Z ist die Korrelation zwischen X und Y nahe null.
X -> Z -> Y
Unterschied zwischen Scheinkorrelation und Mediation: zeitliche Reihenfolge.
Was ist Multikausalität?
X und Z führen beide zu Y
Was ist eine Drittvariablenkontrolle?
Drittvariablenkontrolle ist eine relativ einfache Strategie, die mit Problemen behaftet ist.
Andere Strategien der „Drittvariablenkontrolle“:
Was ist ein Instrument-Variablen-Schätzer?
Für eine Instrument-Variablen-Schätzung wird eine Instrumentvariable IV benötigt. Instrumentvariablen sollen
Die Instrumentvariable wird verwendet, um den „Teil von X“ zu identifizieren, der nicht mit dem Fehlerterm korreliert ist.
→ Damit ist die Schätzung des Effekts von X auf Y ohne Bias möglich.
Was ist ein Querschnittdesign?
Merkmale werden für einen Zeitpunkt t bei interessierenden Untersuchungseinheiten (z. B. einer Stichprobe) erhoben.
Nachteile:
Was ist ein Trenddesign?
Dieselben Merkmale (und Merkmalsausprägungen) werden für verschiedene Zeitpunkte bei jeweils unterschiedlichen Gruppen von Untersuchungseinheiten erhoben. Bei Umfragen mit Stichproben wird für jede Erhebung eine neue Stichprobe gezogen.
Vorteile:
Was ist ein Paneldesign?
Dieselben Merkmale (und Merkmalsausprägungen) werden für mehrere Zeitpunkte (Wellen) bei denselben Untersuchungseinheiten erhoben.
Vorteile:
Was ist Panelmortalität?
Ausfälle von Befragten in den nachfolgenden Wellen, wobei der
Ausfall von der 1. auf die 2. Welle in der Regel sehr hoch ist.
Beispiel:
Binder et al. 2009, S. 84: An der 1. Welle nahmen 3667 Schülerinnen teil.
Informationen für beide Wellen sind für 1655 Schüler/innen vorhanden. Das entspricht einem Ausfall von 2012 Personen, also 54% der Ausgangsstichprobe.
Was sind Paneleffekte?
Auswirkungen der wiederholten Befragung auf Meinungen und
Einstellungen.
Was ist fehlende Repräsentativität?
Beispiel:
Die ursprünglichen Stichproben A und B des SOEP wurden 1984 zufällig gezogen.
Diese Stichproben sind „repräsentativ“ für die bundesdeutsche Bevölkerung in 1984, aber schon nicht mehr für die bundesdeutsche Bevölkerung in den neunziger Jahren (Migration nach 1990, Ostdeutsche).
Lösung: Auffrischung des Panels durch neue Stichproben.
Aus diesem Grund sind Trenddaten zur Ermittlung von Veränderungen im Aggregat besser geeignet.
Was ist eine Kohorte?
Eine Kohorte ist eine „Bevölkerungsgruppe, die durch ein zeitlich gemeinsames, längerfristig prägendes Ereignis geprägt ist“
Dabei kann es sich um Geburts-, Eheschließungs-, Bildungskohorten etc. handeln.
Was ist der Kohorteneffekt?
Effekt der Umstände, in denen eine Kohorte gebildet wurde.
Was ist der Lebenszykluseffekt?
(auch: Alterseffekt)
Effekt der Prozesszeit (bei Geburtskohorten: des Alters)
Was ist der Periodeneffekt?
Effekt des historischen Zeitpunktes. Betrifft alle Kohorten in gleicher Weise.
Was ist externe Validität?
Die externe Validität einer Studie ist hoch, wenn die Ergebnisse auf andere Personen und Kontexte verallgemeinert werden können.
Was ist interne Validität?
Wir bezeichnen die Ergebnisse einer Studie als intern valide, wenn die beobachteten Unterschiede in der abhängigen Variable auf die unabhängige Variable zurückgeführt werden können, d. h. ein kausaler Effekt plausibel ist.
Was ist eine Auswahlgesamtheit?
Die Auswahlgesamtheit beinhaltet alle Elemente, die eine Chance haben, in die Stichprobe zu gelangen. Auswahlgesamtheiten können in den einfachsten Fällen auf Basis von Listen oder Registern erstellt werden.
Was bedeutet der Begriff undercoverage?
Elemente der Grundgesamtheit fehlen in der Auswahlgesamtheit
Was bedeutet der Begriff overcoverage?
Elemente der Auswahlgesamtheit gehören nicht zur Grundgesamtheit.
Diese Elemente werden auch als ineligible units (unzulässige Elemente oder Fremdelemente) bezeichnet
Was ist der coverage bias?
Ein Bias ist eine systematische Verzerrung von Untersuchungsergebnissen.
Ein coverage bias liegt vor, wenn durch undercoverage/overcoverage (coverage error) die Auswahlgesamtheit in den für eine Untersuchung interessierenden Merkmalen (und statistischen Maßzahlen) systematisch von der
Grundgesamtheit abweicht.
Was bedeutet der Begriff clustering?
Idealfall: Für jedes Element der Grundgesamtheit liegt exakt ein Eintrag im Auswahlrahmen vor.
Vorkommen kann auch, dass ... (Beispiel: Festnetzauswahlrahmen) mehrere Elemente der Grundgesamtheit nur durch ein Element der Auswahlgesamtheit repräsentiert sind (clustering) (bspw. wenn sich 4 Personen einen Festnetzanschluss teilen)
Was bedeutet der Begriff duplication?
Idealfall: Für jedes Element der Grundgesamtheit liegt exakt ein Eintrag im Auswahlrahmen vor.
Vorkommen kann auch, dass ... (Beispiel: Festnetzauswahlrahmen) ein Element der Grundgesamtheit über mehrere Elemente im Auswahlrahmen repräsentiert ist (duplication)
(bspw. wenn eine Person über mehrere Festnetzanschlüsse verfügt)
Was ist ein sampling error?
Sampling Error entstehen aus der Diskrepanz zwischen Auswahlgesamtheit und Stichprobe durch
1. Sampling Bias und
2. Sampling Variance.
Was ist ein sampling bias?
Ein Sampling Bias liegt vor, wenn eine statistische Maßzahl der Auswahlgesamtheit (Ȳ) durch die statistischen Maßzahlen in Stichproben aus dieser Auswahlgesamtheit (ȳs) systematisch unter- oder überschätzt wird. E(ȳs) =/= Ȳ
Systematische Verzerrungen der Stichprobe resultieren vor allem daraus, dass nicht alle Elemente der Auswahlgesamtheit eine Chance haben, in die Stichprobe zu gelangen. Dies ist v.a. bei nicht-zufallsgesteuerten Auswahlverfahren der Fall.
Was ist die sampling variance?
Die Varianz der Kennwerteverteilung ist die sampling variance der statistischen Maßzahl. Sie beschreibt, wie unterschiedlich die Kennwerte aus verschiedenen Stichproben sind.
Der Standardfehler ist die Quadratwurzel aus der Varianz des Schätzers (sampling variance).
Im Unterschied zum sampling bias gleicht sich der mit der sampling variance beschriebene Zufallsfehler über alle möglichen Stichproben s aus: E(ȳs) = Ȳ
Was ist eine Punktschätzung?
Angabe eines einzelnen Wertes als besten Schätzwert für den gesuchten Parameter der Grundgesamtheit.
Was ist eine Intervallschätzung?
Angabe eines Intervalls, das den tatsächlichen Grundgesamtheitsparameter mit einer Vertrauenswahrscheinlichkeit enthält.
Was ist ein Konfidenzintervall?
Punktschätzung ± Quantilwert · Standardfehler
Interpretation: In 95% der möglichen einfachen Zufallsstichproben vom Umfang n umschließt das so konstruierte Intervall den gesuchten Wert der Auswahlgesamtheit Ȳ.
Was sind die drei Grundlagen für ein gutes Stichprobendesign?
Was ist eine Zufallsstichprobe?
Jedes Element der Auswahlgesamtheit hat die gleiche oder eine angebbare Chance größer Null, in die Stichprobe zu gelangen. Bei gleicher Auswahlwahrscheinlichkeit sprechen wir auch von epsem-Stichproben (Equal Probability Selection Method).
Bei einer Zufallsstichprobe ist die Auswahl der Elemente das Resultat eines Zufallsprozesses, z.B. in dem Zufallszahlen zur Auswahl der Stichprobe verwandt werden.
Was ist eine einfache Zufallsstichprobe?
Eine einfache Zufallsstichprobe (Simple Random Sample) liegt vor, wenn jede mögliche Stichprobe vom Umfang n dieselbe Auswahlwahrscheinlichkeit hat. Dies beinhaltet, dass jedes Element dieselbe Auswahlwahrscheinlichkeit hat. Man unterscheidet einfache Zufallsstichproben mit Zurücklegen
(SRSWR) und ohne Zurücklegen (SRSWOR).
Was ist eine komplexe Zufallsstichprobe?
Bei komplexen Zufallsstichproben werden
Was ist ein Designeffekt?
DEFF
Der Designeffekt setzt die Varianz eines Kennwertes (z. B des Anteils oder des arithmetischen Mittels ȳ) einer komplexen Stichprobe ins Verhältnis zur Varianz des Kennwertes in einer hypothetischen einfachen Zufallsstichprobe (simple random sample).
Was ist eine Klumpenstichprobe?
Bei einer Klumpenstichprobe werden Gruppen von Elementen (Klumpen, cluster) ausgewählt (z. B. Schulklassen). Alle Elemente der ausgewählten Klumpen gehören zur Stichprobe.
Was ist der Klumpeneffekt?
Die durch Klumpung verursachte Ungenauigkeit der Schätzung wird Klumpeneffekt genannt.
d^2 = 1 + (Klumpengröße∗∗ − 1)· ρ
∗∗ : Bei ungleicher Größe der Klumpen: durchschnittliche Gruppengröße
Die Intraklassenkorrelation ρ kann man interpretieren als die Korrelation zwischen den Werten von zwei Elementen innerhalb eines Klumpens (0 ≤ ρ ≤ 1).
Was sind mehrstufige Auswahlen?
Was ist ein PPS-Design?
PPS-Design (Probability Proportionate to Size)
Was sind geschichtete Stichproben?
Bei einer geschichteten Stichprobe werden die Elemente der Auswahlgesamtheit nach den Ausprägungen eines Merkmales in Gruppen (Schichten, strata) eingeteilt.
Was ist theoretisch-statistische Gewichtung?
„Design-Gewichtung“
Ungleiche Auswahlwahrscheinlichkeiten müssen bei der Schätzung von Parametern der Auswahlgesamtheit (z. B. Ȳ) berücksichtigt werden.
→ führt zu unverzerrten Schätzungen der Parameter der Auswahlgesamtheit
→ Korrektur ungleicher Auswahlwahrscheinlichkeiten.