Streszczenie Statystyczne modelowanie i detekcja anomalii
Statystyczne modelowanie i detekcja anomalii: Przewodnik GMM
Wprowadzenie
Niniejszy materiał przedstawia podstawowe pojęcia i praktyczne zastosowanie gęstości prawdopodobieństwa oraz rozkładu normalnego (Gaussa). Celem jest wyjaśnienie, jak na podstawie zmierzonych danych tworzymy ciągłe modele prawdopodobieństwa, jak interpretować histogramy oraz jak pracować z rozkładem normalnym w praktyce.
Definicja: Gęstość prawdopodobieństwa jest funkcją $f(x)$ taką, że prawdopodobieństwo, że ciągła zmienna losowa $X$ leży w przedziale $[a,b]$, jest dane polem pod krzywą: $$P(a,b)=\int_{a}^{b} f(x),dx.$$
1. Uogólnienie i motywacja
- Systemy rzeczywiste często nie dają się dokładnie opisać; pracujemy z ograniczonymi lub częściowymi pomiarami.
- Na podstawie dostępnych sygnałów wyznaczamy rozkład zmiennej losowej, który następnie wykorzystujemy do modelowania i symulacji.
Histogram jako pierwszy krok
- Histogram przedstawia częstość występowania wartości w danych i służy jako dyskretne przybliżenie gęstości.
- Zalecana liczba klas histogramu: $k \approx 2{,}46 \cdot (N-1)^{0{,}4}$ lub $k \approx \sqrt{N}$, gdzie $N$ to liczba pomiarów.
- Histogram pozwala nam ocenić normalność, symetrię, wielomodalność oraz wartości odstające.
Definicja: Histogram to rozkład danych na klasy (przedziały) z osią poziomą dla wartości i osią pionową dla częstości; powierzchnia każdego słupka odpowiada częstości danej klasy.
2. Gęstość prawdopodobieństwa (Probability Density Function)
Podstawowe właściwości
- Dla ciągłej zmiennej losowej $X$ istnieje funkcja $f(x)$ taka, że $$f(x)=\lim_{\Delta x\to 0}\frac{P(x,x+\Delta x)}{\Delta x}.$$
- Całkowite prawdopodobieństwo wynosi 1: $$\int_{-\infty}^{\infty} f(x),dx=1.$$
- Prawdopodobieństwo w przedziale: $$P(a,b)=\int_{a}^{b} f(x),dx.$$
Dystrybuanta
- Dystrybuanta $F(x)$ jest funkcją pierwotną gęstości: $$F(x)=\int_{-\infty}^{x} f(t),dt.$$
- Właściwości $F(x)$: jest niemalejąca, $\lim_{x\to -\infty}F(x)=0$, $\lim_{x\to +\infty}F(x)=1$.
3. Rozkład normalny (Gaussa)
Definicja: Rozkład normalny z parametrami $\mu$ i $\sigma$ ma gęstość $$f(x)=\frac{1}{\sigma\sqrt{2\pi}}\exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right).$$
Wyjaśnienie parametrów
- $\mu$ jest wartością oczekiwaną i jednocześnie położeniem maksimum krzywej.
- $\sigma$ jest odchyleniem standardowym; większe $\sigma$ oznacza szerszą i niższą krzywą, tak aby pole pod krzywą pozostało równe 1.
Właściwości rozkładu normalnego
- Symetria wokół $\mu$.
- Aproksymuje wiele zjawisk naturalnych (błędy pomiarowe, wielkości biologiczne, IQ w populacji) dzięki centralnemu twierdzeniu granicznemu.
- Dokładne prawdopodobieństwa między punktami obliczamy za pomocą całek z funkcji gęstości; w praktyce używa się tablic lub funkcji dystrybuanty (CDF).
Praktyczne zastosowanie
- Modelowanie błędów pomiarowych: różnicę między wartością rzeczywistą a obserwowaną często traktujemy jako zmienną o rozkładzie normalnym.
- Testowanie hipotez i przedziały ufności w wnioskowaniu statystycznym.
- Symulacja zmiennych losowych w metodach Monte Carlo.
Definicja: Standardowy rozkład normalny ma $\mu=0$, $\sigma=1$ oraz gęstość $$\varphi(z)=\frac{1}{\sqrt{2\pi}}\exp\left(-\frac{z^2}{2}\right).$$
Przykłady
- Pomiar długości części: mierzone odchylenia od długości nominalnej $\approx$ o rozkładzie w przybliżeniu normalnym z $\mu=0$, z $\sigma$ oszacowanym na podstawie danych.
- Wzrost dorosłych w populacji: jeśli dane są symetryczne i jednowierzchołkowe, można je aproksymować rozkładem normalnym i obliczyć procenty powyżej/poniżej określonej wartości za pomocą dystrybuanty (CDF).
Porównanie ze statystykami z próby (tabela)
| Liczebność danych | Histogram | Gęstość (PDF) |
|---|---|---|
| Typ | dyskretne przybliżenie | funkcja ciągła |
| Wartość | częstość w przedziale (binie) | wartość $f(x)$ (nie jest prawdopodobieństwem dla punktu) |
| Zastosowanie | szybka wizualizacja | obliczenia prawdopodobieństw i wnioskowanie statystyczne |
4. Jak określić, czy dane
Masz już konto? Zaloguj się
Gęstość prawdopodobieństwa i rozkład normalny
Klíčové pojmy: Histogram przedstawia częstość wartości i służy jako dyskretne przybliżenie gęstości, Liczba binów: $k\approx2{,}46\cdot(N-1)^{0{,}4}$ lub $k\approx\sqrt{N}$, Gęstość $f(x)$ spełnia $\int_{-\infty}^{\infty} f(x)\,dx=1$, Prawdopodobieństwo w przedziale: $P(a,b)=\int_{a}^{b} f(x)\,dx$, Dystrybuanta: $F(x)=\int_{-\infty}^{x} f(t)\,dt$, Gęstość rozkładu normalnego: $f(x)=\dfrac{1}{\sigma\sqrt{2\pi}}\exp\left(-\dfrac{(x-\mu)^2}{2\sigma^2}\right)$, Gęstość standardowego rozkładu normalnego: $\varphi(z)=\dfrac{1}{\sqrt{2\pi}}\exp\left(-\dfrac{z^2}{2}\right)$, Transformacja: jeśli $Z\sim N(0,1)$, to $X=\mu+\sigma Z\sim N(\mu,\sigma^2)$, Użyj wykresu Q-Q i testów (Shapiro-Wilka) do sprawdzenia normalności, Wartość $f(x)$ nie jest prawdopodobieństwem punktu, prawdopodobieństwo to pole pod krzywą