Summary of Statistical Analysis with R

Statistical Analysis with R: A Student's Guide to Models & Data

Úvod

Tento materiál poskytuje přehled základních konceptů a nástrojů v programovacím jazyce R, zaměřený na samostudium pro neprezenčního studenta. Probíráme práci s daty, základní funkce, datové rámce, průzkumnou analýzu dat (EDA) a základní grafiku. Cílem je poskytnout praktické příklady, které lze ihned spustit v R.

Základní funkce a operace

R obsahuje řadu vestavěných funkcí pro výpočty a práci s vektory.

Definice: Funkce jsou pojmenované operace, které přijímají argumenty v závorkách a vracejí hodnotu.

Užité matematické a transformační funkce

  • trigonometrické: sin, cos, tan, asin, acos, atan
  • logaritmické: log, log2, log10 (v LaTeXu: log je funkce \log)
  • další: sqrt, exp, abs, sum, prod

Praktické poznámky:

  • Jména funkcí a proměnných jsou case sensitive (rozlišují velká a malá písmena).
  • Podtržítko "_" se v názvech nepoužívá.
  • Vektory mohou být numeric, character, logical.
  • Argumenty funkcí lze zadávat pojmenovaně nebo implicitně podle pořadí.

Příklad škálování a centrace

Definice: Centrování znamená odečtení průměru; škálování znamená dělení směrodatnou odchylkou.

Ukázka výpočtu a použití scale():

mean(y)
var(y)
y2 <- scale(y)
attr(y2, "scaled:center")
attr(y2, "scaled:scale")
mean(y2)
var(y2)

Vysvětlení: po aplikaci scale() bude průměr transformovaného vektoru $y2$ roven $0$ a rozptyl bude $1$ (pokud se použije výchozí nastavení).

Datové rámce (data.frame)

Datové rámce v R jsou základní strukturou pro tabulková data: sloupce reprezentují proměnné, řádky pozorování.

Definice: Data frame je tabulka, kde všechny sloupce mají stejnou délku; nečíselné sloupce lze převést na faktor (category).

Vytváření a import:

  • vytvoření: data.frame, rep, factor, levels, relevel
  • export: write.table
  • import z Excelu přes clipboard: read.delim("clipboard")

Pravidla:

  • první řádek často obsahuje názvy proměnných (bez mezer)
  • chybějící data jsou označena jako NA
  • všechny sloupce musí mít stejný počet řádků

Funkce pro práci s daty:

  • is.na, $, attach, names

Příklad tabulky (obsah datového rámce):

soilfielddistanceamount
moistpasture120.22
moistpasture220.11
moistpasture430.29
moistpasture230.33
moistrape320.19
moistrape670.39
moistrape540.18
moistrapeNA0.29
drypasture111.16
drypasture331.03
drypasture451.11
drypastureNA1.33
dryrape551.02
dryrape411.23
dryrape141.05
dryrape271.12

Příklad práce s faktory:

size <- rep(c("small","medium","large"), c(4,3,4))
dat <- data.frame(x, y, size)
is.factor(size)
size <- factor(size)
levels(size)
size1 <- relevel(size, ref="medium")
levels(size1)

Vysvětlení: factor() převede znakový vektor na kategorii s úrovněmi; relevel() nastaví preferovanou referenční úroveň.

Průzkumná analýza dat (EDA)

EDA je vizuální a tabulková analýza dat sloužící k odhalení chyb, návrhu modelu, ověření předpokladů a nalezení neočekávaných trendů.

Cíle EDA:

  • zkontrolovat chyby v datech
  • získat představu o rozdělení a variabilitě
  • naznačit vhodné statistické metody
  • nastavit hypotézy

Definice: Očekávaná hodnota $E(y)$ je teoretický dlouhodobý průměr proměnné; empirický odhad je aritmetický průměr.

Střední hodnoty a odolné odhady

  • průměr: mean()
  • medián: median() — odolný při asymetrii
  • ořezaný průměr: mean(y, trim=) — odstraní $\alpha n$ pozorování z každého ocasu

Příklad:

mean(amount)
median(amount)
mean(amount, trim=0.1)

Rozptyl a směrodatná odchylka

  • rozptyl: var()
  • směrodatná odchylka: sd()
  • rozsah: range(), min(), max()
  • kvantily: quantile()

Definice: Standardní chyba průměru (SEM) je $SEM = \frac{s}{\sqrt{n}}$.

Příklad výpočtu SEM:

var(amount)
sd(amount)
sem <- sd(amount)/sqrt(length(amount))
sem

Konfidenční intervaly (CI) pro střední

Zaregistruj se pro celé shrnutí
FlashcardsKnowledge testSummaryPodcastMindmap
Start for free

Already have an account? Sign in

Programování v R - Základy

Klíčové pojmy: Jména v R rozlišují velká a malá písmena, Funkce scale() provádí centraci a škálování (průměr 0, SD 1), Data frame má sloupce stejné délky a chybějící hodnoty jsou NA, Faktory: vytvoření factor(), změna referenční úrovně relevel(), Mean(), median(), mean(trim=) pro střední hodnoty, Var(), sd(), SEM = $s/\sqrt{n}$ pro variabilitu, Tapply() a table() pro souhrny podle skupin, Plot(), points(), par() pro základní grafiku, qqnorm() a qqline() pro kontrolu normality, summary() poskytne rychlý přehled proměnných

## Úvod Tento materiál poskytuje přehled základních konceptů a nástrojů v programovacím jazyce R, zaměřený na samostudium pro neprezenčního studenta. Probíráme práci s daty, základní funkce, datové rámce, průzkumnou analýzu dat (EDA) a základní grafiku. Cílem je poskytnout praktické příklady, které lze ihned spustit v R. ## Základní funkce a operace R obsahuje řadu vestavěných funkcí pro výpočty a práci s vektory. > Definice: Funkce jsou pojmenované operace, které přijímají argumenty v závorkách a vracejí hodnotu. ### Užité matematické a transformační funkce - trigonometrické: sin, cos, tan, asin, acos, atan - logaritmické: log, log2, log10 (v LaTeXu: log je funkce \\log) - další: sqrt, exp, abs, sum, prod Praktické poznámky: - Jména funkcí a proměnných jsou **case sensitive** (rozlišují velká a malá písmena). - Podtržítko "_" se v názvech nepoužívá. - Vektory mohou být **numeric**, **character**, **logical**. - Argumenty funkcí lze zadávat pojmenovaně nebo implicitně podle pořadí. ### Příklad škálování a centrace > Definice: Centrování znamená **odečtení průměru**; škálování znamená **dělení směrodatnou odchylkou**. Ukázka výpočtu a použití scale(): ```r mean(y) var(y) y2 <- scale(y) attr(y2, "scaled:center") attr(y2, "scaled:scale") mean(y2) var(y2) ``` Vysvětlení: po aplikaci scale() bude průměr transformovaného vektoru $y2$ roven $0$ a rozptyl bude $1$ (pokud se použije výchozí nastavení). ## Datové rámce (data.frame) Datové rámce v R jsou základní strukturou pro tabulková data: sloupce reprezentují proměnné, řádky pozorování. > Definice: Data frame je tabulka, kde všechny sloupce mají stejnou délku; nečíselné sloupce lze převést na faktor (category). Vytváření a import: - vytvoření: data.frame, rep, factor, levels, relevel - export: write.table - import z Excelu přes clipboard: read.delim("clipboard") Pravidla: - první řádek často obsahuje názvy proměnných (bez mezer) - chybějící data jsou označena jako NA - všechny sloupce musí mít stejný počet řádků Funkce pro práci s daty: - is.na, $, attach, names Příklad tabulky (obsah datového rámce): | soil | field | distance | amount | | --- | --- | --- | --- | | moist | pasture | 12 | 0.22 | | moist | pasture | 22 | 0.11 | | moist | pasture | 43 | 0.29 | | moist | pasture | 23 | 0.33 | | moist | rape | 32 | 0.19 | | moist | rape | 67 | 0.39 | | moist | rape | 54 | 0.18 | | moist | rape | NA | 0.29 | | dry | pasture | 11 | 1.16 | | dry | pasture | 33 | 1.03 | | dry | pasture | 45 | 1.11 | | dry | pasture | NA | 1.33 | | dry | rape | 55 | 1.02 | | dry | rape | 41 | 1.23 | | dry | rape | 14 | 1.05 | | dry | rape | 27 | 1.12 | Příklad práce s faktory: ```r size <- rep(c("small","medium","large"), c(4,3,4)) dat <- data.frame(x, y, size) is.factor(size) size <- factor(size) levels(size) size1 <- relevel(size, ref="medium") levels(size1) ``` Vysvětlení: factor() převede znakový vektor na kategorii s úrovněmi; relevel() nastaví preferovanou referenční úroveň. ## Průzkumná analýza dat (EDA) EDA je vizuální a tabulková analýza dat sloužící k odhalení chyb, návrhu modelu, ověření předpokladů a nalezení neočekávaných trendů. Cíle EDA: - zkontrolovat chyby v datech - získat představu o rozdělení a variabilitě - naznačit vhodné statistické metody - nastavit hypotézy > Definice: Očekávaná hodnota $E(y)$ je teoretický dlouhodobý průměr proměnné; empirický odhad je aritmetický průměr. ### Střední hodnoty a odolné odhady - průměr: mean() - medián: median() — odolný při asymetrii - ořezaný průměr: mean(y, trim=) — odstraní $\\alpha n$ pozorování z každého ocasu Příklad: ```r mean(amount) median(amount) mean(amount, trim=0.1) ``` ### Rozptyl a směrodatná odchylka - rozptyl: var() - směrodatná odchylka: sd() - rozsah: range(), min(), max() - kvantily: quantile() > Definice: Standardní chyba průměru (SEM) je $SEM = \frac{s}{\sqrt{n}}$. Příklad výpočtu SEM: ```r var(amount) sd(amount) sem <- sd(amount)/sqrt(length(amount)) sem ``` ### Konfidenční intervaly (CI) pro střední