Summary of Statistical Analysis with R
Statistical Analysis with R: A Student's Guide to Models & Data
Úvod
Tento materiál poskytuje přehled základních konceptů a nástrojů v programovacím jazyce R, zaměřený na samostudium pro neprezenčního studenta. Probíráme práci s daty, základní funkce, datové rámce, průzkumnou analýzu dat (EDA) a základní grafiku. Cílem je poskytnout praktické příklady, které lze ihned spustit v R.
Základní funkce a operace
R obsahuje řadu vestavěných funkcí pro výpočty a práci s vektory.
Definice: Funkce jsou pojmenované operace, které přijímají argumenty v závorkách a vracejí hodnotu.
Užité matematické a transformační funkce
- trigonometrické: sin, cos, tan, asin, acos, atan
- logaritmické: log, log2, log10 (v LaTeXu: log je funkce \log)
- další: sqrt, exp, abs, sum, prod
Praktické poznámky:
- Jména funkcí a proměnných jsou case sensitive (rozlišují velká a malá písmena).
- Podtržítko "_" se v názvech nepoužívá.
- Vektory mohou být numeric, character, logical.
- Argumenty funkcí lze zadávat pojmenovaně nebo implicitně podle pořadí.
Příklad škálování a centrace
Definice: Centrování znamená odečtení průměru; škálování znamená dělení směrodatnou odchylkou.
Ukázka výpočtu a použití scale():
mean(y)
var(y)
y2 <- scale(y)
attr(y2, "scaled:center")
attr(y2, "scaled:scale")
mean(y2)
var(y2)
Vysvětlení: po aplikaci scale() bude průměr transformovaného vektoru $y2$ roven $0$ a rozptyl bude $1$ (pokud se použije výchozí nastavení).
Datové rámce (data.frame)
Datové rámce v R jsou základní strukturou pro tabulková data: sloupce reprezentují proměnné, řádky pozorování.
Definice: Data frame je tabulka, kde všechny sloupce mají stejnou délku; nečíselné sloupce lze převést na faktor (category).
Vytváření a import:
- vytvoření: data.frame, rep, factor, levels, relevel
- export: write.table
- import z Excelu přes clipboard: read.delim("clipboard")
Pravidla:
- první řádek často obsahuje názvy proměnných (bez mezer)
- chybějící data jsou označena jako NA
- všechny sloupce musí mít stejný počet řádků
Funkce pro práci s daty:
- is.na, $, attach, names
Příklad tabulky (obsah datového rámce):
| soil | field | distance | amount |
|---|---|---|---|
| moist | pasture | 12 | 0.22 |
| moist | pasture | 22 | 0.11 |
| moist | pasture | 43 | 0.29 |
| moist | pasture | 23 | 0.33 |
| moist | rape | 32 | 0.19 |
| moist | rape | 67 | 0.39 |
| moist | rape | 54 | 0.18 |
| moist | rape | NA | 0.29 |
| dry | pasture | 11 | 1.16 |
| dry | pasture | 33 | 1.03 |
| dry | pasture | 45 | 1.11 |
| dry | pasture | NA | 1.33 |
| dry | rape | 55 | 1.02 |
| dry | rape | 41 | 1.23 |
| dry | rape | 14 | 1.05 |
| dry | rape | 27 | 1.12 |
Příklad práce s faktory:
size <- rep(c("small","medium","large"), c(4,3,4))
dat <- data.frame(x, y, size)
is.factor(size)
size <- factor(size)
levels(size)
size1 <- relevel(size, ref="medium")
levels(size1)
Vysvětlení: factor() převede znakový vektor na kategorii s úrovněmi; relevel() nastaví preferovanou referenční úroveň.
Průzkumná analýza dat (EDA)
EDA je vizuální a tabulková analýza dat sloužící k odhalení chyb, návrhu modelu, ověření předpokladů a nalezení neočekávaných trendů.
Cíle EDA:
- zkontrolovat chyby v datech
- získat představu o rozdělení a variabilitě
- naznačit vhodné statistické metody
- nastavit hypotézy
Definice: Očekávaná hodnota $E(y)$ je teoretický dlouhodobý průměr proměnné; empirický odhad je aritmetický průměr.
Střední hodnoty a odolné odhady
- průměr: mean()
- medián: median() — odolný při asymetrii
- ořezaný průměr: mean(y, trim=) — odstraní $\alpha n$ pozorování z každého ocasu
Příklad:
mean(amount)
median(amount)
mean(amount, trim=0.1)
Rozptyl a směrodatná odchylka
- rozptyl: var()
- směrodatná odchylka: sd()
- rozsah: range(), min(), max()
- kvantily: quantile()
Definice: Standardní chyba průměru (SEM) je $SEM = \frac{s}{\sqrt{n}}$.
Příklad výpočtu SEM:
var(amount)
sd(amount)
sem <- sd(amount)/sqrt(length(amount))
sem
Konfidenční intervaly (CI) pro střední
Already have an account? Sign in
Programování v R - Základy
Klíčové pojmy: Jména v R rozlišují velká a malá písmena, Funkce scale() provádí centraci a škálování (průměr 0, SD 1), Data frame má sloupce stejné délky a chybějící hodnoty jsou NA, Faktory: vytvoření factor(), změna referenční úrovně relevel(), Mean(), median(), mean(trim=) pro střední hodnoty, Var(), sd(), SEM = $s/\sqrt{n}$ pro variabilitu, Tapply() a table() pro souhrny podle skupin, Plot(), points(), par() pro základní grafiku, qqnorm() a qqline() pro kontrolu normality, summary() poskytne rychlý přehled proměnných