Karteikarten im Karteikarten-Set

Noch nicht gestartet (249)

Was sind die drei Komponenten von Data Literacy?

Wissen (Methoden), Können (Anwendung), Haltung (ethische Reflexion).

Nenne die vier Leitfragen der Data Literacy Charta.

WILL (Ziel), KANN (Methoden), DARF (Regeln), SOLL (Verantwortung).

Wie lautet die Definition von "Daten"?

Objekte, die Beobachtungen über Eigenschaften von Dingen festhalten (inkl. Texte/Bilder, analog/digital).

Welche Stufe der DIKW-Pyramide folgt auf "Information"?

Wissen (z. B. "Bäckerei B ist beliebteste Bäckerei").

 Warum sind Daten "das neue Öl"?

Sie sind Rohstoff für Entscheidungen, Werbung und Forschung (Humby).

Welche Funktion hat der ISO 8601-Standard?

Standardisiertes Datumsformat (z. B. 2025-07-07T14:30:00).

Was unterscheidet nominale von ordinalen Skalen?

Nominal: Keine Rangfolge (Blutgruppe). Ordinal: Rangfolge, aber keine Abstände (Schulnoten).

 Warum ist die Wahl des Datentyps in der Informatik kritisch?

Falsche Typen führen zu Fehlern (z. B. "1"+"2"="12" statt 3).

Nenne zwei Funktionen von Metadaten.

 Kontextsicherung (Einheiten), Langzeit-Interpretierbarkeit.

Kann eine Mitgliedsnummer "346" metrisch sein?

 Nein, sie ist nominal (keine interpretierbaren Abstände).

Was bedeutet "FAIR" bei Forschungsdaten?

Findable, Accessible, Interoperable, Reusable.

Wie unterscheiden sich Datenbanken und Repositorien?

Datenbanken: Strukturierte Datensammlungen. Repositorien: Digitale Lager für Volltexte/Daten.

Nenne drei Formen von Open Knowledge.

Open Source, Open Educational Resources (OER), Open Data.

Welche Suchtools eignen sich für Fachdaten?

DBIS, re3data.org, Google Dataset Search.

Was warnt die Regel "Garbage in, garbage out"?

Schlechte Eingangsdaten führen zu unbrauchbaren Ergebnissen.

Warum ist eine Stichprobe nicht immer repräsentativ?

Bei Ad-hoc-Stichproben (z. B. Kommilitonen) ist Verzerrung wahrscheinlich.

Was prüft eine experimentelle Studie, das eine korrelative nicht kann?

Kausalität (durch Manipulation einer Variable).

Definiere "Operationalisierung" am Beispiel Motivation.

Messvorschrift festlegen (z. B. Skala 1–5 oder Sporttage/Woche).

Welche zwei Dokumentationsphasen sind essenziell?

Vorher (Datenerhebungsplan), Nachher (Metadaten/DOI).

Wann ist eine Vollerhebung unmöglich?

 Bei hohen Kosten, ethischen Grenzen oder unendlichen Grundgesamtheiten.



Was macht einen Datenmanagementplan (DMP) zum "lebenden Dokument"?

Anpassung bei Projektänderungen (z. B. neue Ziele).

Nenne drei Regeln für Dateibenennung.

ISO-Datum (YYYY-MM-DD), kurz, keine Leerzeichen/Umlaute.

Wie lautet die 3-2-1-Backup-Regel?

3 Kopien, 2 Medien, 1 extern.

Welche Fehler behandelt die Datenaufbereitung?

 Fehlende Werte, Ausreißer, Widersprüche.

Was sichert "Semantic Preservation" bei Archivierung?

 Inhaltliches Verständnis durch Metadaten/Kontext.



Was ist der Kernunterschied qualitativer/quantitativer Analyse?

Qualitativ: Tiefenverständnis (Texte). Quantitativ: Generalisierbarkeit (Zahlen).

Welche drei Analyseformen gibt es in der Statistik?

Deskriptiv (Darstellung), Induktiv (Schlüsse), Explorative (Muster).

Wann nutzt man ein Sankey-Diagramm?

Für Flussdarstellungen (z. B. Titanic-Überlebende nach Klassen).

Vor was warnt Edward Tufte bei Visualisierungen?

"Chartjunk" – dekorative Elemente, die ablenken.

Welche Streuungsmaße gibt es neben der Standardabweichung?

 Varianz, Spannweite, Interquartilsabstand (IQR).



Was zeigt der Framing-Effekt (Tversky & Kahneman)?

Entscheidungen werden durch Formulierung beeinflusst (z. B. "75% fettfrei" vs. "25% Fett").



Warum ist "Korrelation ≠ Kausalität" kritisch?

Eisverkäufe korrelieren mit Badeunfällen – aber Hitze ist die Ursache.

Was unterscheidet Reproduktion von Replikation?

Reproduktion: Dieselben Daten neu analysieren. Replikation: Neue Studie mit neuen Daten.

Welches Problem haben algorithmische Entscheidungssysteme?

Risiken bei Intransparenz (z. B. Kreditablehnung ohne Erklärung).



Warum vertrauen nur 37% der Mitarbeiter datenbasierten Entscheidungen?

Überforderung (63% fühlen sich von Daten überlastet).



Was garantiert "Datensouveränität"?

Kontrolle über eigene Daten (Selbstbestimmung).

Wie entsteht der Selektions-Bias?

 Durch nicht-repräsentative Daten (z. B. nur WEIRD-Populationen).

 Was fordert der Utilitarismus bei Datenentscheidungen?

Nutzen für die Mehrheit (z. B. Pandemie-Tracking-App vs. Privatsphäre).

Was besagt Kants kategorischer Imperativ für die Datenethik?

Handle nur nach Regeln, die allgemeingültig sein können (z. B. keine heimliche Datensammlung).

Nenne drei Merkmale verantwortungsvoller KI.

Transparenz, Fairness, Rechenschaftspflicht.

Welche Komponenten hat die Von-Neumann-Architektur?

CPU, Speicher (ROM/RAM), I/O-Einheit, Bussysteme.

Wie codiert man -5 im 4-Bit-Zweierkomplement?

1011 (Erstes Bit = 1 für negativ).

Welches Problem haben Fließkommazahlen?

Rundungsfehler durch begrenzte Genauigkeit (z. B. 0.1 + 0.2 ≠ 0.3).

Was erkennt OCR-Software?

Texte in Bildern durch Pixel-Mustervergleich.

Welche Schritte umfasst der Datenanalyse-Workflow?

Fragestellung → Planung → Bereinigung → Analyse → Visualisierung → Interpretation.

Was misst der Interquartilsabstand (IQR)?

 Streuung der mittleren 50% der Daten (Q3–Q1).

Wann nutzt man logistische Regression?

Bei kategorialen abhängigen Variablen (z. B. "OK"/"NOK").

Warum ist "Garbage in, garbage out" ein Risiko?

 Ungenauigkeiten in Rohdaten verzerren Ergebnisse.

Warum braucht jedes Experiment eine Kontrollgruppe?

Für das "Was-wäre-wenn"-Szenario (z. B. Effekt ohne Stimulus).

Was verhindert Randomisierung?

Selbstselektion (z. B. fleißige Studierende wählen Morgentermin).

Was sichert "interne Validität"?

Nur die untersuchte Variable variiert (keine Störfaktoren).

Wie dokumentiert man Hypothesen vorab?

Durch Pre-Registrierung (verhindert p-hacking).

Was bedeutet p < 0.05?

 Wahrscheinlichkeit <5%, dass H₀ fälschlich verworfen wird (signifikant).



Was ist die Zettabyte-Ära

Zeit des exponentiellen Wachstums globaler Datenmengen

Was sind Metadaten?

Strukturierte Informationen über andere Daten.

Was sind Merkmalsträger?

Personen oder Objekte, deren Eigenschaften für eine bestimmte Untersuchung von Interesse sind.

Was ist ein Merkmal?

Eigenschaften, die für eine zu untersuchende Fragestellung relevant sind und statistisch ausgewertet werden

Was sind multivariate Daten?

Mehrere Merkmale oder Variablen, die demselben Merkmalsträger zugeordnet werden

Was sind univariate Daten?

Ein Merkmal bzw. eine Variable über jeden Merkmalsträger

Was ist eine Skala?

Eine Skala repräsentiert eine Vorschrift, die jeder statistischen Einheit einen Beobachtungswert zuordnet. Eine „Messlatte".

Was ist eine Nominalskala?

Skalenniveau für Kategorien ohne Rangordnung (z.B., Blutgruppen)

Was ist eine Ordinalskala?

Skalenniveau mit Rangordnung ohne interpretierbare Abstände (z.B., Schulnoten)

Was ist eine metrische Skala?

Skalenniveau mit interpretierbaren numerischen Abständen (z.B., Temperatur)

Was ist eine Datenerhebung?

Systematischer Vorgang der Ermittlung und Erfassung von Ausprägungen interessierender Merkmale bei Merkmalsträgern.

Was ist eine Merkmalsausprägung?

Konkrete Werte oder Kategorien eines Merkmals (z. B. 180 cm für Körpergröße)

Was ist eine Vollerhebung?

Erfassung aller Merkmalsträger einer Grundgesamtheit

Was ist eine Stichprobe?

Teilmenge der Grundgesamtheit, die untersucht wird

Was ist eine Ad-hoc-Stichprobe?

Auswahl von leicht erreichbaren Merkmalsträgern (z. B. Freunde, Passanten)

Was ist eine Quotenstichprobe?

Stichprobe, bei der bestimmte Merkmale (z. B. Geschlecht, Alter) in festgelegtem Verhältnis berücksichtigt werden

Was ist eine Zufallsauswahl?

Auswahl von Merkmalsträgern durch zufällige Verfahren

Was ist eine geschichtete Auswahl?

Kombination aus Zufallsauswahl und Schichtung nach relevanten Merkmalen

Was ist eine Operationalisierung?

Prozess der Messbarmachung abstrakter Merkmale durch konkrete Verfahren

Was sind qualitative Methoden?

Subjektive Ansätze wie Interviews zur Erfassung tiefergehender Informationen

Was sind quantitative Methoden?

Objektive Ansätze wie Umfragen zur Erhebung messbarer Daten

Was sind experimentelle Studien?

Untersuchungen unter kontrollierten Bedingungen zur Analyse von Ursache-Wirkungs-Zusammenhängen

Was sind korrelative Studien?

Studien zur Untersuchung von Zusammenhängen zwischen Variablen ohne Kausalitätsprüfung

Was sind reaktive Verfahren?

Methoden, bei denen die Erhebung das Verhalten der Merkmalsträger beeinflussen kann

Was sind nicht-reaktive Verfahren?

Methoden ohne direkten Einfluss auf die untersuchten Personen oder Prozesse

Was ist eine Hypothese?

Testbare Aussage über Unterschiede oder Zusammenhänge zwischen Variablen

Was ist eine Unterschiedshypothese?

Vorhersage eines Unterschieds zwischen Gruppen (z. B. mit/ohne Fitnesstracker)

Was ist eine Zusammenhangshypothese?

Vorhersage eines Zusammenhangs zwischen Variablen (z. B. Motivation und Schrittanzahl)

Was ist eine Veränderungshypothese?

Aussage über zeitliche Veränderungen eines Merkmals

Was ist der Datenlebenszyklus?

Phasen des Umgangs mit Daten von der Planung bis zur Löschung

Was versteht man unter Daten Cleaning?

Bereinigung von Inkonsistenzen oder Fehlern in Datensätzen

Was versteht man unter Data Tidying?

Strukturierung der Daten (z.B. Tabellenform)

Was ist die Persistente Identifikation?

Eindeutige Links zu digitalen Objekten wie DOI oder ORCID-ID

Was ist der Modus?

Häufigster Wert in einem Datensatz

Was ist die Standardabweichung?

Maß für die Streuung der Werte um den Mittelwert

Was ist die Induktive Statistik?

Verallgemeinerung von Stichproben auf Grundgesamtheiten

Was sind explorative Analysen?

Entdeckendes Verfahren zur Hypothesengenerierung

Was ist eine Induktion?

Schlussfolgerung vom Speziellen auf das Allgemeine

Was ist eine Deduktion?

Schlussfolgerung vom Allgemeinen auf das Spezielle

Was ist eine Korrelation?

Maß für den statistischen Zusammenhang zwischen zwei Variablen ohne Aussage über Ursache-Wirkung (r)

Was ist eine Kausalität?

Ursache-Wirkungs-Beziehung zwischen Variablen

Was versteht man unter Data-Driven Culture?

Unternehmenskultur, die datenbasierte Entscheidungsfindung fördert

Was ist eine Heuristik?

Vereinfachte Entscheidungsregel oder Faustregel

Was ist eine Algorithmenethik?

Untersuchung ethischer Fragestellungen im Zusammenhang mit algorithmischen Systemen

Was versteht man unter Autonomie?

Selbstbestimmung über das eigene Leben und persönliche Informationen

Was versteht man unter Transparenz?

Nachvollziehbarkeit von Prozessen und Entscheidungen, insbesondere in KI-Systemen

Was ist ein Bias?

Systematische Verzerrung oder Vorurteile in Datensätzen oder Entscheidungen 

Was ist die Deontologie?

Ethikansatz, der Handlungen nach moralischen Pflichten unabhängig von Konsequenzen bewertet

Was ist die Tugendethik?

Ethikansatz, der auf die Entwicklung eines moralisch guten Charakters abzielt

Was ist eine CPU?

Central Processing Unit, Prozessor eines Computers

Was versteht man unter RAM?

Flüchtiger Arbeitsspeicher/ Hauptspeicher

Was versteht man unter ROM?

Festwertspeicher für Firmware

Was ist die I/O-Einheit?

Einheit für Ein- und Ausgabe von Daten

Was ist das Binärsystem?

Zahlensystem mit Basis 2

Was ist das Zweierkomplement?

Methode zur Darstellung negativer Zahlen im Binärsystem

Was ist der IEEE-754-Standard?

Standard zur Darstellung von Fließkommazahlen

Was versteht man unter ASCII?

American Standard Code for Information Interchange; Zeichencodierung

Was versteht man unter Unicode?

Zeichencodierung mit internationalem Fokus 

Was versteht man unter UTF-8?

Komprimiertes Format zur Darstellung von Unicode-Zeichen

Was ist die Datenaufbereitung?

Vorbereitung von Rohdaten für Analysen durch Bereinigung und Transformation

Was sind Lagemaße?

Statistische Kennzahlen wie Mittelwert oder Median zur Beschreibung zentraler Tendenzen

Was sind Streumaße?

Kennzahlen wie Varianz oder Standardabweichung zur Beschreibung der Variabilität der Daten

Was sind Punktschätzer?

Einzelwert zur Schätzung eines Parameters einer Verteilung (z. B., Mittelwert)

Was ist ein Konfidenzintervall?

Bereich, in dem ein Parameter mit hoher Wahrscheinlichkeit liegt

Was ist ein Hypothesentest?

Statistisches Verfahren zur Überprüfung einer Annahme über eine Grundgesamtheit

Was ist das Bestimmtheitsmaß (R^2)?

Maß für die Güte eines Modells; Werte nahe 1 sind ideal

Was versteht man unter Randomisierung?

Zufällige Zuteilung von Teilnehmern zu Versuchs- oder Kontrollgruppen

Was ist Interne Validität?

Maß dafür, wie gut Störvariablen kontrolliert wurden

Was ist Externe Validität?

Maß dafür, wie gut Ergebnisse auf andere Kontexte übertragbar sind

Was ist die Nullhypothese (H_0)?

Annahme des Nichtvorhandenseins eines Effekts oder Unterschieds

Was ist das Signifikanzniveau (alpha)?

Schwelle zur Ablehnung der Nullhypothese (üblich alpha = 0,05)

Was versteht man unter dem p-Wert?

Wahrscheinlichkeit für das Auftreten eines Ergebnisses unter der Annahme der Nullhypothese

Was ist der t-Test?

Statistischer Test zum Vergleich von Mittelwerten zweier Gruppen

Was ist die Effektgröße?

Maß für die praktische Relevanz eines Effekts oder Unterschieds

Was versteht man unter Data Cleaning?

Erkennung und Behebung von Fehlern:

 - Plausibilitätsprüfung (z.B. Wertebereiche prüfen)

 - Fehlerdiagnose (z.B. unmögliche Werte identifizieren)

 - Fehlerkorrektur: Löschen oder Ändern nur bei klarer Begründung.

Was sind Laborexperimente?

Kontrollierte Bedingungen; Vorteil: hohe interne Validität; Nachteil: künstliches Setting

Was sind Feldexperimente?

Natürliche Bedingungen; Vorteil: realitätsnah; Nachteil: weniger Kontrolle

Was versteht man unter Selbstselektion?

Teilnehmer wählen bevorzugte Gruppen

Was sind Spillover-Effekte?

Informationen zwischen Gruppen werden ausgetauscht

Wie fallen Daten in der Arbeit auf?

  • Daten als Entscheidungs- und Prognosebasis für Unternehmen
  • Vernetze Produktion der ,,Industrie 4.0"
  • Algorithmenbasierte Empfehlungssysteme


Wie fallen Daten im Alltag auf?

  • Daten erzeugt durch Social Media Nutzung
  • personalisierte Werbung
  • Aktivitätsmuster in Fitnesstracker


Wie finden Daten in der Wissenschaft Anwendung?

  • empirischen Zugang zur systematischen Beschreibung der Welt
  • empirischen Zugang zur systematischen Erklärung der Welt


Welche Formen von Daten gibt es?

  • analog
  • digital
  • Bilder
  • Zahlen
  • Wörter


Was ist die DIKW-Pyramide?

  • Data-Information-Knowledge-Wisdom



Wie lässt sich der Informationsbedarf im zyklischen Modell beschreiben?

Welt als Ausgangspunkt über die wir Erkenntnis erlangen wollen/ Entscheidungsalternativen abwägen

Was ist der Zweck der Datenerhebung im zyklischen Modell?

Datengrundlage generieren

Was ist der Zweck der Analyse im zyklischen Modell?

Datenaufbereitung, Beschreibung, Unterschiede und Zusammenhänge durch statistische Tests

Was soll im Rahmen der Kommunikation im zyklischen Modell gemacht werden?

in Lebenswelt zurückführen → Wissenschaftliche Artikel, Rundmails

Welche Schritte gehören alle zum Datenmanagement im zyklischen Modell?

Verwalten, Zusammenführen, Speichern, Sichern, Archivieren, Bereitstellen

Was ist die Definition der Information Literacy?

Kompetenz Infos aus verschiedenen Formaten zu finden, managen, verwenden

Was ist die Statistical Literacy?

Kompetenz Statistiken die unseren Alltag durchdringen zu verstehen, kritisch zu bewerten

Was ist die Definition von Datenstandards?

Vereinbarte Normen, die verwendet werden und die beste Art und Weise beschreiben etwas zu tun.

Was erleichtern Datenstandards?

  • Austausch
  • Interpretation
  • Verwaltung
  • Weiterverarbeitung und Modifizierung
  • Veröffentlichung und Nachnutzung


Was bewirkt eine Vereinheitlichung?

  • Zeit aufwendig
  • Verhinderung Fehlinterpretation 
  • Verhinderung Mehraufwand durch nachträgliche Anpassung


Was ist die Definition von Daten im Rahmen von Datenstandards?

Menge von Ausprägungen eines/ mehrerer Merkmale an einem/ mehreren Merkmalsträgern

Was ist ein Datentyp und welche gibt es?

Gibt an wie Werte einer Variable durch ein Programm gespeichert und verarbeitet werden kann

 → Integer, String, Boolean, Char

Welche Merkmalstypen gibt es?

  • Qualitativ → Nominalskala, Ordinalskala
  • Quantitativ → Metrische Skala


Was ist Open Knowledge?

  • Wissen auf das jeder frei zugreifen, nutzen, verändern, teilen 
  • eingeschränkt höchstens durch Maßnahmen die Ursprung und Offenheit des Wissens bewahren

Wie sucht eine Suchmaschine und wie gut ist sie?

  • nur so gut wie sein Index
  • kratzt dennoch nur an der Oberfläche


Wie suche ich nach Daten?

  1. Rechercheziel: Welches Erkenntnis- und Nutzungsinteresse verfolgen wir?
  2. Welche Daten?: Form (Texte, Bilder), Lizenz, Aktualität, Sprache
  3. Welche Suchmaschine/Datenbank?
  4. Welche Suchbegriffe?: Liste mit alternativen Schreibweisen/ Synonyme/ Ober-Unterbegriffe, Suchoperatoren


Welche Dimensionen von Datenqualität gibt es?

  • Inhaltsbezogen → wie genau sind Daten? Fehlersuche, Fehlerfreiheit, Objektivität, Glaubwürdigkeit
  • Kontextbezogen → Mehrwert, Relevanz, Aktualität, Vollständigkeit
  • Darstellungsbezogen → Interpretierbarkeit, Verständlichkeit, Konstanz in Repräsentation, Übersichtlichkeit
  • Zugangsbezogen → Erreichbarkeit, Zugangssicherheit, Rechtliche Nutzbarkeit

Welche Vor- und Nachteile hat eine eigene Erhebung?

Vorteile: Daten passen zum eigenen Infobedarf

Keine urheber- oder lizenzrechtlichen Fragen zu beachten

Nachteile: großer zeitlicher + finanzieller Aufwand


Fragen im Bezug auf den Infobedarf

  • Warum erheben wir Daten?
  • Welche Art von Aussagen wollen wir treffen?
  • Auf welchen existierenden Infos können wir aufbauen?


Welche Erhebungsmethoden gibt es?

  • qualitative oder quantitative Methoden
  • Experiment oder Korrelationsstudie
  • im Labor oder im Feld
  • erheben wir automatisiert?


Was ist eine Teilerhebung?

  • bei Datenerhebungen überwiegend darauf angewiesen
  • Rückschluss auf Grundgesamtheit zum Teil nur eingeschränkt möglich


Welche Stichprobendesigns gibt es bei Auswahlverfahren?

  • Ad-hoc Stichprobe
  • Quotenstichprobe


Was ist die einfache Zufallsauswahl im Rahmen eine randomisierten Auswahl?

Zufällige Auswahl Merkmalsträger aus Grundgesamtheit. Es gibt keine Verzerrung durch Erhebenden, mangelnde Repräsentativität.

Was ist die geschichtete Zufallsauswahl im Rahmen eine randomisierten Auswahl?

prozentualer Anteil Merkmale = Anteil Grundgesamtheit

→ keine Verzerrung, Aussagen über Schichten, Schichtungsmerkmale müssen bekannt sein, großer Aufwand

Was ist Found Data?

Daten die organisch bei digitalen Prozessen, Inter- und Transaktionen anfallen. Diesen digitalen Spuren wird in Erhebungen oft nachgegangen.


Was sind automatisierte Verfahren?

Datenerhebungen durch künstliche Systeme

Was sind nicht automatisierte Verfahren?

  • schätzen
  • selber zählen


Was ist ein Konstrukt?

Merkmal das man nicht direkt beobachten kann, Merkmal vor Operationalisierung

Was ist eine Messung?

Zuordnung von Symbolen/Zahlen zu Eigenschaften der Merkmalsträger

Was ist eine Dokumentation?

Systematisches sammeln von Infos in Dokumenten

Welche Fragen müssen vor einer Erhebung geklärt werden?

  • Wie genau lautet der Infobedarf?
  • auf welcher Basis wurde er hergeleitet?
  • Warum wurde sich für eine bestimmte Art Operationalisierung des Designs der Stichprobe entschieden?
  • Datenerhebungsplan


Was muss während der Erhebung gemacht werden?

Protokoll → Aufälligkeiten

Was muss nach der Erhebung gemacht werden?

Dokumentation aufbereiten

Was sind Eigenschaften einer guten Dokumentation?

  • individuelle Infobedarf
  • Konventionen der Fachdisziplin
  • Richtlinien, Fördergeber verlangen
  • Verständlich
  • Vollständig
  • Menschen- und maschinenlesbar
  • gut zugängliche Dateiformate
  • Eindeutige Zuordnung zum Datensatz
  • angemessene Form wählen


Was ist Datenmanagement und was kostet es?

  • verschiedene Aktivitäten entlang des Datenlebenszyklus die eine gute Qualität und langfristige Nutzbarkeit von (Forschungs-)Daten sicherstellen sollen
  • Aufwand, Zeit, Geld


Was sind Bestandteile von Datenmanagement in wissenschaftlicher Forschung?

  • Transparenz und Nachhaltigkeit
  • Gute wissenschaftliche Praxis
  • Prozesse strukturieren, standardisieren, automatisieren
  • Bessere zusammenarbeit im Team
  • Qualität der Ergebnisse
  • Sichtbarkeit eigener Forschung
  • Erkenntnisse aus Re-Analyse und Kombi von Daten


Was sind Bestandteile von Datenmanagement im Unternehmen?

  • effektive Prozessgestaltung
  • Generierung Wert und Wettbewerbsvorteile
  • Einhaltung rechtlicher Pflichten


Was ist eine Datenmanagementplan?

Dokument zur Strukturierung und Beschreibung des Datenmanagements entsprechend der spezifischen Anforderung im Projekt

Was sind typische Inhalte eines Datenmanagementplans?

  • Administrative Angaben und Projektinfos
  • Beschreibung (Forschungs-)Daten und Methoden
  • Dokumentation und Metadatenmanagement
  • Datenorganisation und Datensicherung
  • Löschung, Archivierung, Zugänglichkeit nach Projektende
  • Rechtliche Aspekte
  • Budget und Verantwortlichkeiten


Was muss bei der Erstellung eines Datenmanagementplans beachtet werden?

  • Vorlagen, Checklisten, Fragenkataloge
  • webbasierte Tools
  • Relevante Aspekte planen
  • lebendiges Dokument
  • für alle nachvollziehbar


Was sind Vorteile von Datenmanagementplänen?

Am Anfang haben sie einen Mehraufwand. Dann erleichtern sie aber die Zusammenarbeit und stellen sicher dass Daten sinnvoll und nachhaltig genutzt werden können.

Welche Formen der Datenablage gibt es?

  • hierarchisches System
  • Tag-basierte Systeme


Welche Vor- und Nachteile hat das Hierarchische System?

Vorteile:

-> ähnliche Dinge liegen zusammen

-> gut für eindeutige Zuordnung in immer feinere Kategorien

Nachteile:

-> komplizierte Ordnersysteme werden nicht verstanden

-> Dublett-Bildung

-> spätere Änderungen schwierig


Welche Vor- und Nachteile haben Tag-basierte Systeme?

Vorteile:

-> mehrfache Zuordnung möglich

-> interessengeleitete Anzeige von Dateien

-> vereinfachte Ablage und Suche

Nachteile:

-> nicht alle Betriebssysteme unterstützen es

-> Aufwand Planung Tag-Vergabe


Was ist Datensicherung?

Temporäre Duplizierung zur Vermeidung von Datenverlusten aufgrund von Störungen

Was sind die Schritte des Data Cleaning?

1. Rohdaten sichern

2. Plausibilitätsprüfung

3. Fehlerdiagnose

4. Datentransformation

Wie werden Rohdaten richtig gesichert?

  • Über Kopien
  • Über Versionierung
  • Über Dokumentation und Automatisierung


Was ist die Plausibilitätsprüfung?

Eine Fehlersuche, bei der auf:

  • Wiederholungen
  • Daten außerhalb des Bereichs
  • Keine Zusammenhänge

geprüft wird.

Worauf wird bei einer Fehlerdiagnose geprüft?

Es wird nach einer Kriterienliste nach Fehlerursachen geprüft. Die folgende Fehlerkorrektur kann geteilt werden in:

  • Werte löschen
  • Werte nicht löschen
  • Werte archivieren


Was ist eine Datentransformation?

  • Um-/Rekodierung: Zusammenfassen
  • Veränderung durch mathematische Transformation
  • Aggregation: Zusammenführen


Was ist eine Archivierung?

Sichere Aufbewahrung von Daten über einen längeren Zeitraum in verständlicher und nutzbarer Form

Was sind Herausforderungen bei der Datenerhaltung?

  • Dateien und Träger veralten
  • Technik verändert sich
  • Verweise und Verknüpfungen zwischen Dateien und Daten gehen verloren


Welche Fragen muss man sich beim archivieren stellen?

  1. Welche Daten müssen wir aufbewahren? 
  2. Welche Daten sollen wir aufbewahren?
  3. Welche Daten sollen wir löschen?
  4. Welche Daten müssen wir löschen?

Welche Schritte hat eine Datenanalyse?

  1. Wahl Erhebungsverfahren
  2. Operationalisierung von Merkmalen
  3. Konkrete Messung
  4. Datenaufbereitung in Form von Fehlerbereinigung
  5. Transformation von Rohdaten
  6. Datenvisualisierung


Was sind die Gütekriterien einer quantitativen Datenanalyse?

  • statistische Schlussvalidität
  • Transparenz durch Dokumentation und Automatisierung
  • Auswertungsobjektivität


Was ist eine Quellenkritik?

  • Ermittlung Erkenntniswerts historischer Quellen für eine Fragestellung
  • Quellenbeschreibung und -interpretation


Was ist eine Statistische Datenanalyse?

Bei der Durchführung werden ein/mehrere Merkmale auf Basis von ausgewählten Merkmalsträgern, im Hinblick auf ihr Erscheinungsbild und Beziehungen untersucht

Was ist eine Deskriptive Analyse?

  • Daten übersichtlicher dargestellt, indem Kennziffern berechnet/grafische Präsentationen erstellt werden
  • Aussagen über Häufigkeit und Verteilung
  • Kennzahlen: Lagemaß, Streuungsmaß


Was sind die Vorteile einer Deskriptiven Analyse?

  • Überblick über Daten
  • Erste Schlüsse
  • weitere Analyseverfahren auswählen


Was sind die Nachteile einer Deskriptiven Analyse?

  • nur Aussage über vorliegende Datenmenge möglich


Was ist eine Induktive Analyse?

  • durch Einbezug Wahrscheinlichkeitstheorie über erhobene Daten hinaus allgemeine Schlussfolgerungen für Grundgesamtheit
  • Schätzung
  • Hypothesenprüfung (t-Test, Korrelations- und Regressionsanalyse)


Was sind die Vorteile einer Induktiven Analyse?

  • Schlussfolgerungen aufgrund von Daten begründen
  • Interessierende Größen schätzen
  • Hypothesen stützen, verwerfen, resultierende Aussagen bewerten


Was sind die Nachteile einer Induktiven Analyse?

Grad der Unsicherheit

Was ist eine Explorative Analyse?

  • Entdeckende Statistik
  • deckt unbekannte Eigenschaften und Strukturen in Daten auf Beschreibung und Visualisierung von Daten

Was sind die Vorteile einer Explorativen Analyse?

Neue Erkenntnisse generieren

Was sind die Nachteile einer Explorativen Analyse?

  • Tiefere Analysekompetenzen vorausgesetzt
  • Selektive Wahrnehmung kann Analyse beeinflussen
  • Nur begrenzt Rückschlüsse auf Grundgesamtheit möglich


Welche weitere Arten von Analysen gibt es?

  • Diagnostische Analyse (Diagnose)
  • Prädiktive Analyse (Vorhersage)
  • Präskriptive Analyse (Entscheidung)


Welche weitere Arten von Visualisierungen gibt es?

  • Histogram
  • Box-Whiskers-Plot
  • Sankey-Plot
  • Rainfall-Plot
  • Infografik
  • Chord-Diagramm


Welche ethischen Konzepte im Umgang mit Daten gibt es?

  • Autonomie und Transport
  • Privatsphäre und Datenschutz
  • Bias und Fairness


Welche Normative Theorien gibt es?

  • Utilitaristische Ethik
  • Deontologische Ethik
  • Tugendethik


Was ist die Utilitaristische Ethik?

  • Familie des Konsequentialismus: Handlungen nach Konsequenzen beurteilt
  • so handeln dass der Nutzen der Handlung für die größtmögliche Anzahl maximiert wird


Wie viele Zeichen gibt es im Unicode?

144.697 Zeichen (über 4 Milliarden möglich)

Was sind Programme?

Dateien die Maschinencode enthalten

Was sind Skripte?

Dateien die Anweisungen für einen Interpreter erhalten

Was sind Speicherabbilder?

Binäre Dateien werden byteweise in Dateien geschrieben

→ nur mit speziellen Porgrammen zu öffnen

→ performante Verarbeitung

Was sind strukturierte Daten?

  • Daten zeichencodiert in Dateien geschrieben
  • mit einfachen/speziellen Texteditoren bearbeiten


Was sind die Ziele aus praktischer Sicht von einer Datenanalyse?

  • Darstellung Situationen und Sachverhalten
  • ,,objektive" Bewertung von Sachverhalten
  • Ursachenforschung
  • Ableiten von Handlungsempfehlungen

⇒ Informationsgewinn aus Daten


Was sind die Anwendungsfälle einer Datenanalyse?

  • Erkennen von unüblichen Verhalten in einem Prozess
  • Rückschluss auf Ursachen eines Problems
  • Vorhersage eines zeitlichen Verlaufs


Was ist das Ziel der Datenvorverarbeitung?

Die Erkennung und Behandlung von Fehlern, Ausreißern, Rauscheffekten und Aufbereitung der Daten durch Standardisierung und Zusammenfassung aller benötigten Daten.

Arten von fehlenden Werten

  • rein zufällig fehlend
  • zufällig fehlend
  • nicht zufällig auftretend


Umgang mit fehlenden Daten

  • Auschluss Datenreihe mit fehlenden Werten
  • Substitution/ Imputation fehlender Werte
  • Aufnahme neuer, vollständiger Daten


Arten von Datenvorverarbeitung im Bereich Machine Learning

Cleaning → fehlende Daten, Rauschen, Ausreißer

Transformation → Normalisierung, Aggregation

Reduction → Dimensionsreduktion, Diskretisierung

Was ist die deskriptive Datenanalyse?

Daten systematisiert darzustellen, indem Kennziffern bezeichnet werden.

Welche Maße kommen bei der deskriptive Datenanalyse zum Einsatz?

  • Lagemaß
  • Streuungsmaß
  • Zusammenhangsmaß


Was ist das Zusammenhangsmaß?

  • Kovarianz
  • Korrelation
  • Gibt es Zusammenhang zw. zwei Merkmalen?


Was ist die induktive Statistik?

Versucht durch geeigneten Einbezug von Wahrscheinlichkeitstheorie und Stochastik über die erhobenen Daten hinaus allgemeinere Schlussfolgerungen für die Grundgesamtheit zu treffen, aus der man die Stichprobendaten gezogen hat

Welche Verfahren finden in der induktiven Statistik Anwendung?

  • Punktschätzer
  • Konfidenzintervalle
  • Hyptothesentests


Was sind Punktschätzer?

  • Erwartungswert
  • Standardabweichung
  • Parameter auf Basis einer Stichprobe schätzen


Was ist ein Konfidenzintervall?

  • Erwartungswert
  • Standardabweichung
  • Bereich, indem Parameter mit gewisser Wahrscheinlichkeit liegen


Was ist eine Regression?

Aufgabe die Abhängigkeit einer Variablen Y von den Werten der zweiten Variable x durch eine Regressionsfunktion darzustellen

Worüber geht die Modellbewertung einer Regression?

  • Kennzahlen (RMSE, R)
  • Graphische Gegenüberstellung von realen Werten und Modellprognosen
  • Komplexität des Modells


Was ist RMSE?

  • Wurzel der mittleren Fehlerquadratsumme
  • am besten Nahe 0


Bei was für Variablen findet eine lineare Regression Anwendung?

  • metrische unabhängige Variable(n)
  • metrische abhängige Variable


Bei was für Variablen findet eine logistische Regression Anwendung?

  • metrische unabhängige Variable(n)
  • kategoriale abhängige Variable


Wie läuft ein Experiment ab?

  1. Forschungsfrage
  2. Hypothese
  3. Versuchsaufbau
  4. Vorbereitung Datenerhebung
  5. Datenerhebung
  6. Datenauswertung
  7. Aufbereitung Ergebnisse
  8. Bericht


Warum ist die Randomisierung wichtig?

  • Vergleichbarkeit Gruppen
  • Ausschluss Selbstselektion


Wer nimmt am Experiment teil?

  • Grundgesamtheit
  • Auswahlgesamtheit
  • Stichprobe


Was ist vor einer Datenerhebung zu tun?

  • Ethikkomission
  • Pre-Registrierung
  • Pre-Analysis Plan
  • ggf. Testlauf


Was gehört zu einer Datenauswertung?

  • Vergleich
  • Interpretation


Was ist wichtig bei einer Forschungsfrage?

  • zu bestimmten Zeitpunkt gestellt
  • in Bezug auf bestimmten Stand in Forschung gestellt
  • oft Beginn eines wissenschaftlichen Erkenntnisprozesses
  • am Untersuchungsende beantwortet


Wie findet man Forschungsfrage?

  • Brainstorming
  • Zufall
  • Eigene Erfahrung
  • Gespräche
  • Literatur basiert
  • Zusammenhang der einen Interssiert
  • Etwas, das einen wundert


Was ist eine ungerichtete Hypothese?

Alternativhypothese umfassen positive und negative Abweichungen von der Nullannahme

Was macht gutes Design aus?

  • Interne Validität → Ergebnisse nicht verzerrt, kausaler Effekt identifizierbar
  • Externe Validität → Ergebnisse auf andere Situationen anwendbar


Was sind Probleme der internen Validität?

  • Spillover-Effekte
  • Zeitdimension
  • Selbstselektion


Was sind die Herausforderungen der Externen Validität?

  • Auswahl Studienortes oft in Europa/Nordamerika → WEIRD
  • Auswahl Teilnehmende
  • Auswahl Kontext
  • Künstlichkeit Laborsituation


Was heißt WEIRD?

Western

Education

Industrialized

Rich

Democratic

Was sind Lösungsansätze für die Externe Validität?

  • Replikationsstudien: ähnliches Design anderer Kontext/Personengruppe
  • Metastudien: aggregieren und Reanalysieren von verschiedenen Studien


Was sind Hypothesentests?

  • geben Auskunft über statistische Signifikanz von Effekten/Unterschieden
  • Signifikanz sagt nichts über Relevanz des Effektes aus


Wie läuft ein Hypothesentest ab?

  1. Nullhypothese → können wir sie ablehnen?
  2. Signifikanzniveau → wie wahrscheinlich Ablehnung ist, obwohl Hypothese wahr
  3. statistischer Test
  4. p-Wert → kleinstes alpha bei dem Nullhypothese noch abgelehnt werden kann


Welche Arten von t-Tests gibt es?

  • Enstichprobentest → Unterschied zw. Mittelwert einer Gruppe + Sollwert
  • Zweistichprobentest → Unterschied zw. Mittelwert zweier Gruppen
  • Paardifferenztest → Unterschied zw. Mittelwerten zweier Variablen innerhalb einer Gruppe
  • Regressionskoeffizienten → Unterschied Regressionskoeffizienten von Null


Was sind Manipulationschecks?

  • bei metrische Merkmalen mittels t-Test
  • wichtig, wenn es in den Ergebnissen keinen Unterschied zw. Versuchs- und Kontrollgruppe gibt
  • Auskunft, ob Manipulation des Stimulus erfolgreich war


Was sind Randomisierungschecks?

  • Überprüfung Vergleichbarkeit Versuchs- und Kontrollgruppe
  • mit t-Tests