Statistiken und Big Data

31
Varianz des Produkts abhängiger Variablen

Wie lautet die Formel für die Varianz des Produkts abhängiger Variablen? Bei unabhängigen Variablen ist die Formel einfach: var(XY)=E(X2Y2)−E(XY)2=var(X)var(Y)+var(X)E(Y)2+var(Y)E(X)2var(XY)=E(X2Y2)−E(XY)2=var(X)var(Y)+var(X)E(Y)2+var(Y)E(X)2 {\rm var}(XY) = E(X^{2}Y^{2}) - E(XY)^{2} = {\rm...

31
Warum ist eine Variablenauswahl notwendig?

Gängige datenbasierte Variablenauswahlverfahren (z. B. vorwärts, rückwärts, schrittweise, alle Teilmengen) führen tendenziell zu Modellen mit unerwünschten Eigenschaften, darunter: Koeffizienten von Null weg vorgespannt. Zu kleine Standardfehler und zu enge Konfidenzintervalle. Teststatistiken...

31
libsvm Datenformat [geschlossen]

Ich verwende das Tool libsvm ( http://www.csie.ntu.edu.tw/~cjlin/libsvm/ ) zur Unterstützung der Vektorklassifizierung. Ich bin jedoch verwirrt über das Format der Eingabedaten. Aus der README: Das Format der Trainings- und Testdatendatei ist: <label> <index1>:<value1>...