Flashcards in the set

Haven't started (24)

Was ist das übergeordnete Ziel der Datenanalyse? (eine richtige Antwort)


  • Schrittweise Abarbeitung eines gesamten Workflows
  • Informationsgewinn aus Daten
  • Ansprechende Darstellung von Daten
  • Vorhersage anhand eines Trendverhaltens


  • Informationsgewinn aus Daten

Welche Schritte sind der eigentlichen Datenanalyse vorgeschaltet? (2 richtige Antworten)


  • Regelung eines betrachteten Prozesses
  • Definition der Fragestellung
  • Darstellung der Analyseergebnisse
  • Beantwortung der gestellten Fragestellung
  • Angabe von Handlungsempfehlungen
  • Datenaufnahme


  • Definition der Fragestellung
  • Datenaufnahme


Welche Verfahren können zum Umgang mit fehlenden Daten genutzt werden?(drei richtige Antworten)


  • Nutzung von lediglich 50% der Daten
  • Ausschluss der Datenreihe mit fehlenden Werten
  • Subjektive Abschätzung der fehlenden Werte
  • Substitution/ Imputation fehlender Werte
  • Aufnahme neuer, vollständiger Daten


  • Ausschluss der Datenreihe mit fehlenden Werten
  • Substitution/ Imputation fehlender Werte
  • Aufnahme neuer, vollständiger Daten


Welche Schritte der Datenvorverarbeitung finden speziell im Bereich Machine Learning Anwendung? (zwei richtige Antworten)

  • Reduction
  • Bildung von Mittelwerten
  • Transformation
  • Darstellung als Boxplot
  • Migration


  • Reduction
  • Transformation


Welche Instrumente der deskriptiven Statistik können genutzt werden, wenn nach dem „durchschnittlich produzierten Durchmesser“ gefragt ist? (zwei richtige Antworten)

  • Arithmetisches Mittel
  • Interquartilsabstand
  • Varianz
  • Korrelation
  • Median


  • Arithmetisches Mittel
  • Median


Was sind keine Instrumente der deskriptiven Statistik? (zwei richtige Antworten)

  • Median
  • Arithmetisches Mittel
  • Interquartilsabstand
  • Hypothesentests
  • Regression


  • Hypothesentests
  • Regression


Was kann mit der induktiven Datenanalyse bestimmt werden? (zwei richtige Antworten)

  • Lageparameter, Streuungsparameter, Korellationen
  • Eine Abschätzung der Verteilungsparameter einer Grundgesamtheit, basieren auf einer Stichprobe
  • Eine übersichtliche Darstellung einer Stichprobe in Kennzahlen
  • Die exakten Verteilungsparameter einer Grundgesamtheit
  • Intervalle, innerhalb derer die Verteilungsparameter mit einer gewissen Wahrscheinlichkeit liegen


  • Eine Abschätzung der Verteilungsparameter einer Grundgesamtheit, basieren auf einer Stichprobe


  • Intervalle, innerhalb derer die Verteilungsparameter mit einer gewissen Wahrscheinlichkeit liegen


Welche Fragestellungen können mit Hilfe der induktiven Statistik beantwortet werden? (drei richtige Antworten)

  • Wie hoch ist die Wahrscheinlichkeit, dass man einen gewissen Durchmesser produziert?
  • In welchem Intervall liegt der erwartete Durchmesser?
  • Weicht der mittlere produzierte Durchmesser signifikant von dem angestrebten Durchmesser ab?
  • Welche Durchmesser-Größe wird am Häufigsten gefertigt?
  • Was ist der geschätzte Anteil der Bauteile, deren Durchmesser außerhalb der Toleranzgrenzen liegt?


  • In welchem Intervall liegt der erwartete Durchmesser?
  • Weicht der mittlere produzierte Durchmesser signifikant von dem angestrebten Durchmesser ab?
  • Was ist der geschätzte Anteil der Bauteile, deren Durchmesser außerhalb der Toleranzgrenzen liegt?



Welche Kennzahlen können zur Bewertung von Modellen herangezogen werden? (zwei Antworten richtig)

  • Bestimmtheitsmaß
  • Interquartilsabstand
  • Arithmetisches Mittel
  • RMSE
  • Standardabweichung


  • Bestimmtheitsmaß
  • RMSE


Mit Hilfe welcher Befehle können in R ein lineares Modell gebildet sowie eine Zusammenfassung dargestellt werden? (zwei Antworten richtig)

  • summary(model)
  • summary(lm)
  • model = lm(y~x)
  • zsf(model)
  • model = linMod(y~x)


  • summary(model)
  • model = lm(y~x)


Was muss erfüllt sein, damit die logistische Regression angewandt werden kann? (zwei Antworten richtig)

  • Kategoriale unabhängige Variablen
  • Kategoriale abhängige Variablen
  • Metrische abhängige Variablen
  • Keiner der Fälle
  • Metrische unabhängige Variablen


  • Kategoriale abhängige Variablen
  • Metrische unabhängige Variablen


Wie verlaufen die Funktionen bei der einfachen Linearen und Logistischen Funktion? (zwei Antworten richtig)

  • Logistisch: Gerade
  • Linear: S-Förmig
  • Logistisch: S-Förmig
  • Logistisch: e-Funktion
  • Linear: Gerade


  • Logistisch: S-Förmig
  • Linear: Gerade


Was gilt es bei der Datenanalyse besonders zu beachten? (drei richtige Antworten)

  • Aus der Kausalität folgt niemals Korrelation
  • Aus der Korrelation darf nicht auf Kausalität geschlossen werden
  • Eine Stichprobe beschreibt stets nur den Teil einer Grundgesamtheit
  • Ist die Qualität der Daten schlecht, sind die Modelle es auch
  • Es liegen oftmals zu viele gute Daten vor
  • Aus der Korrelation darf nicht auf Kausalität geschlossen werden


Welche Aussagen sind korrekt? (zwei Antworten richtig)

  • Konfidenzintervalle eignen sich zur Modellbildung
  • Stichproben stellen immer die Grundgesamtheit perfekt dar
  • Bei der deskriptiven Analyse geht es darum, die vorliegenden Daten zu beschreiben
  • Bei der induktiven Analyse wollen wir die Daten graphisch darstellen
  • Die Regression eignet sich zur Modellbildung
  • Bei der deskriptiven Analyse geht es darum, die vorliegenden Daten zu beschreiben
  • Die Regression eignet sich zur Modellbildung


#data.LAB der Themeneinheit 10#


Bitte ordnen Sie die typischen Schritte der Datenanalyse in der richtigen Reihenfolge an.



14480091156871137a9713a5.21540060php29ocfg7jehe2aWEOoVc.png902055547687118f2802502.36171803phpg6mil7jqvaet936HYQC.png

#data.LAB der Themeneinheit 10#


Welche Verfahren können genutzt werden, um Ausreißer zu erkennen? (2 richtige Antworten)


a. Subjektive Abschätzung

b. Substitution oder Imputation von Datenreihen

c. Graphische Verfahren, z.B. Box Plots

d. Statistische Tests, z.B. Grubbs Test

e. Nutzung weniger Datenreihen

c. Graphische Verfahren, z.B. Box Plots

d. Statistische Tests, z.B. Grubbs Test

#data.LAB der Themeneinheit 10#


Welche R-Funktion eignet sich zum Ausschluss von Datenreihen mit fehlenden Daten? (1 richtige Antwort)


a. boxplot(daten)

b. read.csv2(path)

c. na.omit(daten)

d. median(daten)

c. na.omit(daten)


#data.LAB der Themeneinheit 10#


Bitte ordnen Sie die verschiedenen Verfahren zur Beschreibung eines Datensatzes richtig der entsprechenden Kategorie zu.


  1. Lagemaß
  2. Zusammenhangsmaß
  3. Streuungsmaß


a. Kovarianz à

b. Spannweite à

c. Median à

a. Kovarianz à - 2. Zusammenhangsmaß

b. Spannweite à - 3. Streuungsmaß

c. Median à - 1. Lagemaß


#data.LAB der Themeneinheit 10#


Bitte berechnen Sie das arithmetische Mittel für die folgenden Zahlen: 12,14,23,17,29,13

18

#data.LAB der Themeneinheit 10#


Welches Ziel verfolgt die Induktive Statistik? (1 richtige Antwort)


a. Ermittlung von wenigen charakteristischen Kennzahlen zur Beschreibung vieler Einzeldaten


b. Exakte Vorhersagen für individuelle Fälle zu machen. 


c. Rückschluss von Daten der Stichprobe auf die Grundgesamtheit


d. Nachweisen von kausalen Beziehungen.


e. Beschreibung und Zusammenfassung von Daten.

c. Rückschluss von Daten der Stichprobe auf die Grundgesamtheit

#data.LAB der Themeneinheit 10#


Bei einem Hypothesentest können Alpha- und Beta-Fehler auftreten. Ordne korrekt zu: 

448161106687116340db4c9.94600338php1r7papu09kvj9UA6Eic.png20835543986871196fd35562.77546301php0jvdrdndepi54LgcbyW.png

#data.LAB der Themeneinheit 10#


Mit R wurde ein t-Test für den Erwartungswert mit dem Signifikanzniveau 5% durchgeführt. Der t-Test liefert folgendes Ergebnis: 


 Wie ist das Ergebnis zu interpretieren? Kreuze alle richtigen Antworten an. Es gibt drei richtige Antworten. 


> # t-Test für den Erwartungswert

> t.test(samples$Durchmesser,alternative = "two.sided",mu = 3.2, conf.level = 0.95)

One sample t-test

data: samples$Durchmesser

t = 3.8495, df = 99, p-value = 0.00021

alternative hypothesis: true mean is not equal to 3.2

95 percent confidence interval: 

3.218809 3.258827

sample estimates:

mean of samples$Durchmesser 

3.238818


a. Bei Berücksichtigung des Signifikanzniveaus von 5% wir kein signifikanter Unterschied ermittelt.

b. Der Mittelwert der Stichprobe beträgt ungefähr 3.2388

c. Bei Berücksichtigung des Signifikanzniveaus von 5% wir ein signifikanter Unterschied ermittelt

d. Der Mittelwert der Stichprobe ist signifikant kleiner als der erwartete Wert.

e. Der Mittelwert der Stichprobe weicht signifikant von dem erwarteten Wert 3.2 ab.

b. Der Mittelwert der Stichprobe beträgt ungefähr 3.2388

c. Bei Berücksichtigung des Signifikanzniveaus von 5% wir ein signifikanter Unterschied ermittelt

e. Der Mittelwert der Stichprobe weicht signifikant von dem erwarteten Wert 3.2 ab.

#data.LAB der Themeneinheit 10#


Wann wird welche Art der Regression durchgeführt?


  1. Multiple Regression
  2. Lineare Regression
  3. Logistische Regression



a. Metrische Unabhängige Variable(n), Metrische Abhängige Variable à 


b. Metrische Unabhängige Variable(n), Kategoriale Abhängige Variable à

a. (2) Lineare Regression

b. (3) Logistische Regression


#data.LAB der Themeneinheit 10#


Es soll für den Datensatz „data“ eine lineare Regression durchgeführt werden, bei die Abhängige Variable „Temperatur“ in Abhängigkeit von den unabhängigen Variablen „Kraft“, „Vorschub“ und „Drehzahl“ steht. Wechselwirkungen werden nicht berücksichtigt. 


Wie kann das lineare Modell in R aufgestellt werden? Es sind zwei Aussagen korrekt. 


a. modell = lm(data$Temperatur ~ data$Kraft * data$Vorschub * data$Drehzahl)


b. modell = lm(Temperatur ~ Kraft + Vorschub + Drehzahl, data = data)


c. modell = lm(data$Temperatur ~ data$Kraft + data$Vorschub + data$Drehzahl)


d. modell = lm(Temperatur ~ Kraft * Vorschub * Drehzahl, data = data)

b. modell = lm(Temperatur ~ Kraft + Vorschub + Drehzahl, data = data)


c. modell = lm(data$Temperatur ~ data$Kraft + data$Vorschub + data$Drehzahl)