Zusammenfassung von Häufigkeitsverteilungen und Assoziationsmaße für zwei Merkmale
Häufigkeitsverteilungen & Assoziationsmaße für zwei Merkmale
Einführung
Der Chi-Quadrat-Test ist ein zentrales Prüfverfahren in der Statistik, um zu untersuchen, ob zwei kategoriale Merkmale unabhängig sind. In dieser Einheit lernst du die Berechnung der erwarteten Häufigkeiten unter der Annahme der Unabhängigkeit, die Bildung der Chi-Quadrat-Statistik und die praktische Durchführung des Tests anhand von Beispielen.
Definition: Der Chi-Quadrat-Test ist ein nichtparametrischer Test, der beobachtete Häufigkeiten mit erwarteten Häufigkeiten vergleicht, um Abweichungen von Unabhängigkeit zu prüfen.
Aufbau und Vorbereitung
1) Kontingenztabelle (Vierfeldertafel und allgemeine r×s-Tafeln)
- Eine Kontingenztabelle ordnet die Kombinationen zweier kategorialer Merkmale in Zellen an. Die Zeilen entsprechen Ausprägungen von Merkmal A, die Spalten Ausprägungen von Merkmal B.
- Notation: Beobachtete gemeinsame Häufigkeit $h_{ij}^{o}$, Randhäufigkeiten $h_{i\cdot}^{o}$ (Zeile) und $h_{\cdot j}^{o}$ (Spalte), Gesamtanzahl $N$.
Definition: Eine Kontingenztabelle ist eine r×s-Anordnung von Häufigkeiten $h_{ij}^{o}$ mit Zeilensummen $h_{i\cdot}^{o}$, Spaltensummen $h_{\cdot j}^{o}$ und Gesamtsumme $N$.
2) Erwartete Häufigkeiten bei Unabhängigkeit
- Unter der Nullhypothese $H_0$ der Unabhängigkeit berechnet sich die erwartete Häufigkeit jeder Zelle aus dem Produkt der Randhäufigkeiten geteilt durch $N$.
$$ h_{ij}^{e} = \frac{h_{i\cdot}^{o},h_{\cdot j}^{o}}{N} $$
- Beispiel: Für eine Zelle mit Zeilensumme $h_{i\cdot}^{o}=30$, Spaltensumme $h_{\cdot j}^{o}=40$ und $N=200$ gilt $h_{ij}^{e} = \frac{30\cdot 40}{200} = 6$.
Chi-Quadrat-Statistik
- Die Chi-Quadrat-Statistik quantifiziert die Abweichung zwischen beobachteten und erwarteten Häufigkeiten:
$$ \chi^{2} = \sum_{i=1}^{r} \sum_{j=1}^{s} \frac{\left(h_{ij}^{o} - h_{ij}^{e}\right)^{2}}{h_{ij}^{e}} $$
- Eigenschaften:
- Große Werte von $\chi^{2}$ deuten auf eine Verletzung der Unabhängigkeit hin.
- Die Verteilung des $\chi^{2}$-Werts unter $H_0$ hängt vom Freiheitsgrad ab.
Definition: Die Chi-Quadrat-Statistik $\chi^{2}$ ist die Summe der quadrierten Differenzen zwischen beobachteten und erwarteten Häufigkeiten, gewichtet mit dem Kehrwert der erwarteten Häufigkeiten.
Freiheitsgrade
- Für eine r×s-Tabelle ist die Anzahl der Freiheitsgrade
$$ \text{df} = (r-1)(s-1) $$
- Beispiel: Bei einer 2×3-Tafel ist $\text{df} = 1\cdot 2 = 2$.
Durchführung des Tests (Schritt-für-Schritt)
- Formuliere Hypothesen:
- $H_0$: Die Merkmale sind unabhängig.
- $H_1$: Die Merkmale sind abhängig.
- Erstelle die Kontingenztabelle und bestimme $h_{ij}^{o}$, $h_{i\cdot}^{o}$, $h_{\cdot j}^{o}$ und $N$.
- Berechne $h_{ij}^{e} = \dfrac{h_{i\cdot}^{o} h_{\cdot j}^{o}}{N}$ für alle Zellen.
- Berechne $\chi^{2} = \sum_{i,j} \dfrac{(h_{ij}^{o}-h_{ij}^{e})^{2}}{h_{ij}^{e}}$.
- Bestimme den kritischen Wert $\chi^{2}_{\alpha,,\text{df}}$ aus der $\chi^{2}$-Tabelle oder berechne den p-Wert.
- Entscheide: Falls $\chi^{2} > \chi^{2}_{\alpha,,\text{df}}$ bzw. p-Wert $<\alpha$, lehne $H_0$ ab.
Hinweis: Regeln zur Gültigkeit: Erwartete Häufigkeiten sollten in der Regel nicht zu klein sein (häufige Empfehlung: alle $h_{ij}^{e} \ge 5$). Bei kleineren erwarteten Häufigkeiten sind exaktere Verfahren wie der Fisher-Exakte-Test zu erwägen.
Spezieller Fall: Vierfeldertafel (2×2)
- Für $r=s=2$ lässt sich $\chi^{2}$ alternativ durch eine kompaktere Formel berechnen:
$$ \chi^{2} = \frac{N\left(h_{11}^{o} h_{22}^{o} - h_{12}^{o} h_{21}^{o}\right)^{2}}{h_{1\cdot}^{o} h_{2\cdot}^{o} h_{\cdot 1}^{o} h_{\cdot 2}^{o}} $$
- Diese Formel ist praktisch, wenn du nur vier Zellen hast, da sie Rechenaufwand spart.
Praktisches Beispiel (fiktiv)
- Angenommen, eine Umfrage zu zwei Merkmalen mit 2×2-Tafel ergibt beobachtete Häufigkeiten $h_{11}^{o}=30$, $h_{12}^{o}=20$, $h_{21}^{o}=10$, $h_{22}^{o}=40$, also $N=100$.
- Zeilensummen: $h_{1\cdot}^{o}=50$, $h_{2\cdot}^{o}=50$; Spaltensummen: $h_{\cdot 1}^{o}=40$, $h_{\cdot 2}^{o}=60$.
- Er
Hast du bereits ein Konto? Anmelden
Chi-Quadrat Test Grundlagen
Klíčové pojmy: Kontingenztabelle mit $h_{ij}^{o}$, $h_{i\cdot}^{o}$, $h_{\cdot j}^{o}$ und $N$ erstellen, Erwartete Häufigkeit: $h_{ij}^{e} = \dfrac{h_{i\cdot}^{o} h_{\cdot j}^{o}}{N}$, Chi-Quadrat-Statistik: $\chi^{2} = \sum_{i,j} \dfrac{(h_{ij}^{o}-h_{ij}^{e})^{2}}{h_{ij}^{e}}$, Freiheitsgrade $\text{df}=(r-1)(s-1)$ bestimmen, Für 2×2: spezielle Formel $\chi^{2} = \dfrac{N\left(h_{11}^{o} h_{22}^{o} - h_{12}^{o} h_{21}^{o}\right)^{2}}{h_{1\cdot}^{o} h_{2\cdot}^{o} h_{\cdot 1}^{o} h_{\cdot 2}^{o}}$, Entscheidung: $\chi^{2}>\chi^{2}_{\alpha,\text{df}}$ oder p-Wert $<\alpha$ führt zur Ablehnung von $H_0$, Erwartete Häufigkeiten sollten typischerweise $\ge 5$ sein; bei kleineren Werten Fisher-Test verwenden, Anwendungen: Umfragen, Qualitätskontrolle, Epidemiologie