Was sind die drei Komponenten von Data Literacy?
Wissen (Methoden), Können (Anwendung), Haltung (ethische Reflexion).
Nenne die vier Leitfragen der Data Literacy Charta.
WILL (Ziel), KANN (Methoden), DARF (Regeln), SOLL (Verantwortung).
Wie lautet die Definition von "Daten"?
Objekte, die Beobachtungen über Eigenschaften von Dingen festhalten (inkl. Texte/Bilder, analog/digital).
Welche Stufe der DIKW-Pyramide folgt auf "Information"?
Wissen (z. B. "Bäckerei B ist beliebteste Bäckerei").
Warum sind Daten "das neue Öl"?
Sie sind Rohstoff für Entscheidungen, Werbung und Forschung (Humby).
Welche Funktion hat der ISO 8601-Standard?
Standardisiertes Datumsformat (z. B. 2025-07-07T14:30:00).
Was unterscheidet nominale von ordinalen Skalen?
Nominal: Keine Rangfolge (Blutgruppe). Ordinal: Rangfolge, aber keine Abstände (Schulnoten).
Warum ist die Wahl des Datentyps in der Informatik kritisch?
Falsche Typen führen zu Fehlern (z. B. "1"+"2"="12" statt 3).
Nenne zwei Funktionen von Metadaten.
Kontextsicherung (Einheiten), Langzeit-Interpretierbarkeit.
Kann eine Mitgliedsnummer "346" metrisch sein?
Nein, sie ist nominal (keine interpretierbaren Abstände).
Was bedeutet "FAIR" bei Forschungsdaten?
Findable, Accessible, Interoperable, Reusable.
Wie unterscheiden sich Datenbanken und Repositorien?
Datenbanken: Strukturierte Datensammlungen. Repositorien: Digitale Lager für Volltexte/Daten.
Nenne drei Formen von Open Knowledge.
Open Source, Open Educational Resources (OER), Open Data.
Welche Suchtools eignen sich für Fachdaten?
DBIS, re3data.org, Google Dataset Search.
Was warnt die Regel "Garbage in, garbage out"?
Schlechte Eingangsdaten führen zu unbrauchbaren Ergebnissen.
Warum ist eine Stichprobe nicht immer repräsentativ?
Bei Ad-hoc-Stichproben (z. B. Kommilitonen) ist Verzerrung wahrscheinlich.
Was prüft eine experimentelle Studie, das eine korrelative nicht kann?
Kausalität (durch Manipulation einer Variable).
Definiere "Operationalisierung" am Beispiel Motivation.
Messvorschrift festlegen (z. B. Skala 1–5 oder Sporttage/Woche).
Welche zwei Dokumentationsphasen sind essenziell?
Vorher (Datenerhebungsplan), Nachher (Metadaten/DOI).
Wann ist eine Vollerhebung unmöglich?
Bei hohen Kosten, ethischen Grenzen oder unendlichen Grundgesamtheiten.
Was macht einen Datenmanagementplan (DMP) zum "lebenden Dokument"?
Anpassung bei Projektänderungen (z. B. neue Ziele).
Nenne drei Regeln für Dateibenennung.
ISO-Datum (YYYY-MM-DD), kurz, keine Leerzeichen/Umlaute.
Wie lautet die 3-2-1-Backup-Regel?
3 Kopien, 2 Medien, 1 extern.
Welche Fehler behandelt die Datenaufbereitung?
Fehlende Werte, Ausreißer, Widersprüche.
Was sichert "Semantic Preservation" bei Archivierung?
Inhaltliches Verständnis durch Metadaten/Kontext.
Was ist der Kernunterschied qualitativer/quantitativer Analyse?
Qualitativ: Tiefenverständnis (Texte). Quantitativ: Generalisierbarkeit (Zahlen).
Welche drei Analyseformen gibt es in der Statistik?
Deskriptiv (Darstellung), Induktiv (Schlüsse), Explorative (Muster).
Wann nutzt man ein Sankey-Diagramm?
Für Flussdarstellungen (z. B. Titanic-Überlebende nach Klassen).
Vor was warnt Edward Tufte bei Visualisierungen?
"Chartjunk" – dekorative Elemente, die ablenken.
Welche Streuungsmaße gibt es neben der Standardabweichung?
Varianz, Spannweite, Interquartilsabstand (IQR).
Was zeigt der Framing-Effekt (Tversky & Kahneman)?
Entscheidungen werden durch Formulierung beeinflusst (z. B. "75% fettfrei" vs. "25% Fett").
Warum ist "Korrelation ≠ Kausalität" kritisch?
Eisverkäufe korrelieren mit Badeunfällen – aber Hitze ist die Ursache.
Was unterscheidet Reproduktion von Replikation?
Reproduktion: Dieselben Daten neu analysieren. Replikation: Neue Studie mit neuen Daten.
Welches Problem haben algorithmische Entscheidungssysteme?
Risiken bei Intransparenz (z. B. Kreditablehnung ohne Erklärung).
Warum vertrauen nur 37% der Mitarbeiter datenbasierten Entscheidungen?
Überforderung (63% fühlen sich von Daten überlastet).
Was garantiert "Datensouveränität"?
Kontrolle über eigene Daten (Selbstbestimmung).
Wie entsteht der Selektions-Bias?
Durch nicht-repräsentative Daten (z. B. nur WEIRD-Populationen).
Was fordert der Utilitarismus bei Datenentscheidungen?
Nutzen für die Mehrheit (z. B. Pandemie-Tracking-App vs. Privatsphäre).
Was besagt Kants kategorischer Imperativ für die Datenethik?
Handle nur nach Regeln, die allgemeingültig sein können (z. B. keine heimliche Datensammlung).
Nenne drei Merkmale verantwortungsvoller KI.
Transparenz, Fairness, Rechenschaftspflicht.
Welche Komponenten hat die Von-Neumann-Architektur?
CPU, Speicher (ROM/RAM), I/O-Einheit, Bussysteme.
Wie codiert man -5 im 4-Bit-Zweierkomplement?
1011 (Erstes Bit = 1 für negativ).
Welches Problem haben Fließkommazahlen?
Rundungsfehler durch begrenzte Genauigkeit (z. B. 0.1 + 0.2 ≠ 0.3).
Was erkennt OCR-Software?
Texte in Bildern durch Pixel-Mustervergleich.
Welche Schritte umfasst der Datenanalyse-Workflow?
Fragestellung → Planung → Bereinigung → Analyse → Visualisierung → Interpretation.
Was misst der Interquartilsabstand (IQR)?
Streuung der mittleren 50% der Daten (Q3–Q1).
Wann nutzt man logistische Regression?
Bei kategorialen abhängigen Variablen (z. B. "OK"/"NOK").
Warum ist "Garbage in, garbage out" ein Risiko?
Ungenauigkeiten in Rohdaten verzerren Ergebnisse.
Warum braucht jedes Experiment eine Kontrollgruppe?
Für das "Was-wäre-wenn"-Szenario (z. B. Effekt ohne Stimulus).
Was verhindert Randomisierung?
Selbstselektion (z. B. fleißige Studierende wählen Morgentermin).
Was sichert "interne Validität"?
Nur die untersuchte Variable variiert (keine Störfaktoren).
Wie dokumentiert man Hypothesen vorab?
Durch Pre-Registrierung (verhindert p-hacking).
Was bedeutet p < 0.05?
Wahrscheinlichkeit <5%, dass H₀ fälschlich verworfen wird (signifikant).
Was ist die Zettabyte-Ära
Zeit des exponentiellen Wachstums globaler Datenmengen
Was sind Metadaten?
Strukturierte Informationen über andere Daten.
Was sind Merkmalsträger?
Personen oder Objekte, deren Eigenschaften für eine bestimmte Untersuchung von Interesse sind.
Was ist ein Merkmal?
Eigenschaften, die für eine zu untersuchende Fragestellung relevant sind und statistisch ausgewertet werden
Was sind multivariate Daten?
Mehrere Merkmale oder Variablen, die demselben Merkmalsträger zugeordnet werden
Was sind univariate Daten?
Ein Merkmal bzw. eine Variable über jeden Merkmalsträger
Was ist eine Skala?
Eine Skala repräsentiert eine Vorschrift, die jeder statistischen Einheit einen Beobachtungswert zuordnet. Eine „Messlatte".
Was ist eine Nominalskala?
Skalenniveau für Kategorien ohne Rangordnung (z.B., Blutgruppen)
Was ist eine Ordinalskala?
Skalenniveau mit Rangordnung ohne interpretierbare Abstände (z.B., Schulnoten)
Was ist eine metrische Skala?
Skalenniveau mit interpretierbaren numerischen Abständen (z.B., Temperatur)
Was ist eine Datenerhebung?
Systematischer Vorgang der Ermittlung und Erfassung von Ausprägungen interessierender Merkmale bei Merkmalsträgern.
Was ist eine Merkmalsausprägung?
Konkrete Werte oder Kategorien eines Merkmals (z. B. 180 cm für Körpergröße)
Was ist eine Vollerhebung?
Erfassung aller Merkmalsträger einer Grundgesamtheit
Was ist eine Stichprobe?
Teilmenge der Grundgesamtheit, die untersucht wird
Was ist eine Ad-hoc-Stichprobe?
Auswahl von leicht erreichbaren Merkmalsträgern (z. B. Freunde, Passanten)
Was ist eine Quotenstichprobe?
Stichprobe, bei der bestimmte Merkmale (z. B. Geschlecht, Alter) in festgelegtem Verhältnis berücksichtigt werden
Was ist eine Zufallsauswahl?
Auswahl von Merkmalsträgern durch zufällige Verfahren
Was ist eine geschichtete Auswahl?
Kombination aus Zufallsauswahl und Schichtung nach relevanten Merkmalen
Was ist eine Operationalisierung?
Prozess der Messbarmachung abstrakter Merkmale durch konkrete Verfahren
Was sind qualitative Methoden?
Subjektive Ansätze wie Interviews zur Erfassung tiefergehender Informationen
Was sind quantitative Methoden?
Objektive Ansätze wie Umfragen zur Erhebung messbarer Daten
Was sind experimentelle Studien?
Untersuchungen unter kontrollierten Bedingungen zur Analyse von Ursache-Wirkungs-Zusammenhängen
Was sind korrelative Studien?
Studien zur Untersuchung von Zusammenhängen zwischen Variablen ohne Kausalitätsprüfung
Was sind reaktive Verfahren?
Methoden, bei denen die Erhebung das Verhalten der Merkmalsträger beeinflussen kann
Was sind nicht-reaktive Verfahren?
Methoden ohne direkten Einfluss auf die untersuchten Personen oder Prozesse
Was ist eine Hypothese?
Testbare Aussage über Unterschiede oder Zusammenhänge zwischen Variablen
Was ist eine Unterschiedshypothese?
Vorhersage eines Unterschieds zwischen Gruppen (z. B. mit/ohne Fitnesstracker)
Was ist eine Zusammenhangshypothese?
Vorhersage eines Zusammenhangs zwischen Variablen (z. B. Motivation und Schrittanzahl)
Was ist eine Veränderungshypothese?
Aussage über zeitliche Veränderungen eines Merkmals
Was ist der Datenlebenszyklus?
Phasen des Umgangs mit Daten von der Planung bis zur Löschung
Was versteht man unter Daten Cleaning?
Bereinigung von Inkonsistenzen oder Fehlern in Datensätzen
Was versteht man unter Data Tidying?
Strukturierung der Daten (z.B. Tabellenform)
Was ist die Persistente Identifikation?
Eindeutige Links zu digitalen Objekten wie DOI oder ORCID-ID
Was ist der Modus?
Häufigster Wert in einem Datensatz
Was ist die Standardabweichung?
Maß für die Streuung der Werte um den Mittelwert
Was ist die Induktive Statistik?
Verallgemeinerung von Stichproben auf Grundgesamtheiten
Was sind explorative Analysen?
Entdeckendes Verfahren zur Hypothesengenerierung
Was ist eine Induktion?
Schlussfolgerung vom Speziellen auf das Allgemeine
Was ist eine Deduktion?
Schlussfolgerung vom Allgemeinen auf das Spezielle
Was ist eine Korrelation?
Maß für den statistischen Zusammenhang zwischen zwei Variablen ohne Aussage über Ursache-Wirkung (r)
Was ist eine Kausalität?
Ursache-Wirkungs-Beziehung zwischen Variablen
Was versteht man unter Data-Driven Culture?
Unternehmenskultur, die datenbasierte Entscheidungsfindung fördert
Was ist eine Heuristik?
Vereinfachte Entscheidungsregel oder Faustregel
Was ist eine Algorithmenethik?
Untersuchung ethischer Fragestellungen im Zusammenhang mit algorithmischen Systemen
Was versteht man unter Autonomie?
Selbstbestimmung über das eigene Leben und persönliche Informationen
Was versteht man unter Transparenz?
Nachvollziehbarkeit von Prozessen und Entscheidungen, insbesondere in KI-Systemen
Was ist ein Bias?
Systematische Verzerrung oder Vorurteile in Datensätzen oder Entscheidungen
Was ist die Deontologie?
Ethikansatz, der Handlungen nach moralischen Pflichten unabhängig von Konsequenzen bewertet
Was ist die Tugendethik?
Ethikansatz, der auf die Entwicklung eines moralisch guten Charakters abzielt
Was ist eine CPU?
Central Processing Unit, Prozessor eines Computers
Was versteht man unter RAM?
Flüchtiger Arbeitsspeicher/ Hauptspeicher
Was versteht man unter ROM?
Festwertspeicher für Firmware
Was ist die I/O-Einheit?
Einheit für Ein- und Ausgabe von Daten
Was ist das Binärsystem?
Zahlensystem mit Basis 2
Was ist das Zweierkomplement?
Methode zur Darstellung negativer Zahlen im Binärsystem
Was ist der IEEE-754-Standard?
Standard zur Darstellung von Fließkommazahlen
Was versteht man unter ASCII?
American Standard Code for Information Interchange; Zeichencodierung
Was versteht man unter Unicode?
Zeichencodierung mit internationalem Fokus
Was versteht man unter UTF-8?
Komprimiertes Format zur Darstellung von Unicode-Zeichen
Was ist die Datenaufbereitung?
Vorbereitung von Rohdaten für Analysen durch Bereinigung und Transformation
Was sind Lagemaße?
Statistische Kennzahlen wie Mittelwert oder Median zur Beschreibung zentraler Tendenzen
Was sind Streumaße?
Kennzahlen wie Varianz oder Standardabweichung zur Beschreibung der Variabilität der Daten
Was sind Punktschätzer?
Einzelwert zur Schätzung eines Parameters einer Verteilung (z. B., Mittelwert)
Was ist ein Konfidenzintervall?
Bereich, in dem ein Parameter mit hoher Wahrscheinlichkeit liegt
Was ist ein Hypothesentest?
Statistisches Verfahren zur Überprüfung einer Annahme über eine Grundgesamtheit
Was ist das Bestimmtheitsmaß (R^2)?
Maß für die Güte eines Modells; Werte nahe 1 sind ideal
Was versteht man unter Randomisierung?
Zufällige Zuteilung von Teilnehmern zu Versuchs- oder Kontrollgruppen
Was ist Interne Validität?
Maß dafür, wie gut Störvariablen kontrolliert wurden
Was ist Externe Validität?
Maß dafür, wie gut Ergebnisse auf andere Kontexte übertragbar sind
Was ist die Nullhypothese (H_0)?
Annahme des Nichtvorhandenseins eines Effekts oder Unterschieds
Was ist das Signifikanzniveau (alpha)?
Schwelle zur Ablehnung der Nullhypothese (üblich alpha = 0,05)
Was versteht man unter dem p-Wert?
Wahrscheinlichkeit für das Auftreten eines Ergebnisses unter der Annahme der Nullhypothese
Was ist der t-Test?
Statistischer Test zum Vergleich von Mittelwerten zweier Gruppen
Was ist die Effektgröße?
Maß für die praktische Relevanz eines Effekts oder Unterschieds
Was versteht man unter Data Cleaning?
Erkennung und Behebung von Fehlern:
- Plausibilitätsprüfung (z.B. Wertebereiche prüfen)
- Fehlerdiagnose (z.B. unmögliche Werte identifizieren)
- Fehlerkorrektur: Löschen oder Ändern nur bei klarer Begründung.
Was sind Laborexperimente?
Kontrollierte Bedingungen; Vorteil: hohe interne Validität; Nachteil: künstliches Setting
Was sind Feldexperimente?
Natürliche Bedingungen; Vorteil: realitätsnah; Nachteil: weniger Kontrolle
Was versteht man unter Selbstselektion?
Teilnehmer wählen bevorzugte Gruppen
Was sind Spillover-Effekte?
Informationen zwischen Gruppen werden ausgetauscht
Wie fallen Daten in der Arbeit auf?
Wie fallen Daten im Alltag auf?
Wie finden Daten in der Wissenschaft Anwendung?
Welche Formen von Daten gibt es?
Was ist die DIKW-Pyramide?
Wie lässt sich der Informationsbedarf im zyklischen Modell beschreiben?
Welt als Ausgangspunkt über die wir Erkenntnis erlangen wollen/ Entscheidungsalternativen abwägen
Was ist der Zweck der Datenerhebung im zyklischen Modell?
Datengrundlage generieren
Was ist der Zweck der Analyse im zyklischen Modell?
Datenaufbereitung, Beschreibung, Unterschiede und Zusammenhänge durch statistische Tests
Was soll im Rahmen der Kommunikation im zyklischen Modell gemacht werden?
in Lebenswelt zurückführen → Wissenschaftliche Artikel, Rundmails
Welche Schritte gehören alle zum Datenmanagement im zyklischen Modell?
Verwalten, Zusammenführen, Speichern, Sichern, Archivieren, Bereitstellen
Was ist die Definition der Information Literacy?
Kompetenz Infos aus verschiedenen Formaten zu finden, managen, verwenden
Was ist die Statistical Literacy?
Kompetenz Statistiken die unseren Alltag durchdringen zu verstehen, kritisch zu bewerten
Was ist die Definition von Datenstandards?
Vereinbarte Normen, die verwendet werden und die beste Art und Weise beschreiben etwas zu tun.
Was erleichtern Datenstandards?
Was bewirkt eine Vereinheitlichung?
Was ist die Definition von Daten im Rahmen von Datenstandards?
Menge von Ausprägungen eines/ mehrerer Merkmale an einem/ mehreren Merkmalsträgern
Was ist ein Datentyp und welche gibt es?
Gibt an wie Werte einer Variable durch ein Programm gespeichert und verarbeitet werden kann
→ Integer, String, Boolean, Char
Welche Merkmalstypen gibt es?
Was ist Open Knowledge?
Wie sucht eine Suchmaschine und wie gut ist sie?
Wie suche ich nach Daten?
Welche Dimensionen von Datenqualität gibt es?
Welche Vor- und Nachteile hat eine eigene Erhebung?
Vorteile: Daten passen zum eigenen Infobedarf
Keine urheber- oder lizenzrechtlichen Fragen zu beachten
Nachteile: großer zeitlicher + finanzieller Aufwand
Fragen im Bezug auf den Infobedarf
Welche Erhebungsmethoden gibt es?
Was ist eine Teilerhebung?
Welche Stichprobendesigns gibt es bei Auswahlverfahren?
Was ist die einfache Zufallsauswahl im Rahmen eine randomisierten Auswahl?
Zufällige Auswahl Merkmalsträger aus Grundgesamtheit. Es gibt keine Verzerrung durch Erhebenden, mangelnde Repräsentativität.
Was ist die geschichtete Zufallsauswahl im Rahmen eine randomisierten Auswahl?
prozentualer Anteil Merkmale = Anteil Grundgesamtheit
→ keine Verzerrung, Aussagen über Schichten, Schichtungsmerkmale müssen bekannt sein, großer Aufwand
Was ist Found Data?
Daten die organisch bei digitalen Prozessen, Inter- und Transaktionen anfallen. Diesen digitalen Spuren wird in Erhebungen oft nachgegangen.
Was sind automatisierte Verfahren?
Datenerhebungen durch künstliche Systeme
Was sind nicht automatisierte Verfahren?
Was ist ein Konstrukt?
Merkmal das man nicht direkt beobachten kann, Merkmal vor Operationalisierung
Was ist eine Messung?
Zuordnung von Symbolen/Zahlen zu Eigenschaften der Merkmalsträger
Was ist eine Dokumentation?
Systematisches sammeln von Infos in Dokumenten
Welche Fragen müssen vor einer Erhebung geklärt werden?
Was muss während der Erhebung gemacht werden?
Protokoll → Aufälligkeiten
Was muss nach der Erhebung gemacht werden?
Dokumentation aufbereiten
Was sind Eigenschaften einer guten Dokumentation?
Was ist Datenmanagement und was kostet es?
Was sind Bestandteile von Datenmanagement in wissenschaftlicher Forschung?
Was sind Bestandteile von Datenmanagement im Unternehmen?
Was ist eine Datenmanagementplan?
Dokument zur Strukturierung und Beschreibung des Datenmanagements entsprechend der spezifischen Anforderung im Projekt
Was sind typische Inhalte eines Datenmanagementplans?
Was muss bei der Erstellung eines Datenmanagementplans beachtet werden?
Was sind Vorteile von Datenmanagementplänen?
Am Anfang haben sie einen Mehraufwand. Dann erleichtern sie aber die Zusammenarbeit und stellen sicher dass Daten sinnvoll und nachhaltig genutzt werden können.
Welche Formen der Datenablage gibt es?
Welche Vor- und Nachteile hat das Hierarchische System?
Vorteile:
-> ähnliche Dinge liegen zusammen
-> gut für eindeutige Zuordnung in immer feinere Kategorien
Nachteile:
-> komplizierte Ordnersysteme werden nicht verstanden
-> Dublett-Bildung
-> spätere Änderungen schwierig
Welche Vor- und Nachteile haben Tag-basierte Systeme?
Vorteile:
-> mehrfache Zuordnung möglich
-> interessengeleitete Anzeige von Dateien
-> vereinfachte Ablage und Suche
Nachteile:
-> nicht alle Betriebssysteme unterstützen es
-> Aufwand Planung Tag-Vergabe
Was ist Datensicherung?
Temporäre Duplizierung zur Vermeidung von Datenverlusten aufgrund von Störungen
Was sind die Schritte des Data Cleaning?
1. Rohdaten sichern
2. Plausibilitätsprüfung
3. Fehlerdiagnose
4. Datentransformation
Wie werden Rohdaten richtig gesichert?
Was ist die Plausibilitätsprüfung?
Eine Fehlersuche, bei der auf:
geprüft wird.
Worauf wird bei einer Fehlerdiagnose geprüft?
Es wird nach einer Kriterienliste nach Fehlerursachen geprüft. Die folgende Fehlerkorrektur kann geteilt werden in:
Was ist eine Datentransformation?
Was ist eine Archivierung?
Sichere Aufbewahrung von Daten über einen längeren Zeitraum in verständlicher und nutzbarer Form
Was sind Herausforderungen bei der Datenerhaltung?
Welche Fragen muss man sich beim archivieren stellen?
Welche Schritte hat eine Datenanalyse?
Was sind die Gütekriterien einer quantitativen Datenanalyse?
Was ist eine Quellenkritik?
Was ist eine Statistische Datenanalyse?
Bei der Durchführung werden ein/mehrere Merkmale auf Basis von ausgewählten Merkmalsträgern, im Hinblick auf ihr Erscheinungsbild und Beziehungen untersucht
Was ist eine Deskriptive Analyse?
Was sind die Vorteile einer Deskriptiven Analyse?
Was sind die Nachteile einer Deskriptiven Analyse?
Was ist eine Induktive Analyse?
Was sind die Vorteile einer Induktiven Analyse?
Was sind die Nachteile einer Induktiven Analyse?
Grad der Unsicherheit
Was ist eine Explorative Analyse?
Was sind die Vorteile einer Explorativen Analyse?
Neue Erkenntnisse generieren
Was sind die Nachteile einer Explorativen Analyse?
Welche weitere Arten von Analysen gibt es?
Welche weitere Arten von Visualisierungen gibt es?
Welche ethischen Konzepte im Umgang mit Daten gibt es?
Welche Normative Theorien gibt es?
Was ist die Utilitaristische Ethik?
Wie viele Zeichen gibt es im Unicode?
144.697 Zeichen (über 4 Milliarden möglich)
Was sind Programme?
Dateien die Maschinencode enthalten
Was sind Skripte?
Dateien die Anweisungen für einen Interpreter erhalten
Was sind Speicherabbilder?
Binäre Dateien werden byteweise in Dateien geschrieben
→ nur mit speziellen Porgrammen zu öffnen
→ performante Verarbeitung
Was sind strukturierte Daten?
Was sind die Ziele aus praktischer Sicht von einer Datenanalyse?
⇒ Informationsgewinn aus Daten
Was sind die Anwendungsfälle einer Datenanalyse?
Was ist das Ziel der Datenvorverarbeitung?
Die Erkennung und Behandlung von Fehlern, Ausreißern, Rauscheffekten und Aufbereitung der Daten durch Standardisierung und Zusammenfassung aller benötigten Daten.
Arten von fehlenden Werten
Umgang mit fehlenden Daten
Arten von Datenvorverarbeitung im Bereich Machine Learning
Cleaning → fehlende Daten, Rauschen, Ausreißer
Transformation → Normalisierung, Aggregation
Reduction → Dimensionsreduktion, Diskretisierung
Was ist die deskriptive Datenanalyse?
Daten systematisiert darzustellen, indem Kennziffern bezeichnet werden.
Welche Maße kommen bei der deskriptive Datenanalyse zum Einsatz?
Was ist das Zusammenhangsmaß?
Was ist die induktive Statistik?
Versucht durch geeigneten Einbezug von Wahrscheinlichkeitstheorie und Stochastik über die erhobenen Daten hinaus allgemeinere Schlussfolgerungen für die Grundgesamtheit zu treffen, aus der man die Stichprobendaten gezogen hat
Welche Verfahren finden in der induktiven Statistik Anwendung?
Was sind Punktschätzer?
Was ist ein Konfidenzintervall?
Was ist eine Regression?
Aufgabe die Abhängigkeit einer Variablen Y von den Werten der zweiten Variable x durch eine Regressionsfunktion darzustellen
Worüber geht die Modellbewertung einer Regression?
Was ist RMSE?
Bei was für Variablen findet eine lineare Regression Anwendung?
Bei was für Variablen findet eine logistische Regression Anwendung?
Wie läuft ein Experiment ab?
Warum ist die Randomisierung wichtig?
Wer nimmt am Experiment teil?
Was ist vor einer Datenerhebung zu tun?
Was gehört zu einer Datenauswertung?
Was ist wichtig bei einer Forschungsfrage?
Wie findet man Forschungsfrage?
Was ist eine ungerichtete Hypothese?
Alternativhypothese umfassen positive und negative Abweichungen von der Nullannahme
Was macht gutes Design aus?
Was sind Probleme der internen Validität?
Was sind die Herausforderungen der Externen Validität?
Was heißt WEIRD?
Western
Education
Industrialized
Rich
Democratic
Was sind Lösungsansätze für die Externe Validität?
Was sind Hypothesentests?
Wie läuft ein Hypothesentest ab?
Welche Arten von t-Tests gibt es?
Was sind Manipulationschecks?
Was sind Randomisierungschecks?