Streszczenie Statystyczne modelowanie i detekcja anomalii

Statystyczne modelowanie i detekcja anomalii: Przewodnik GMM

Wprowadzenie

Niniejszy materiał przedstawia podstawowe pojęcia i praktyczne zastosowanie gęstości prawdopodobieństwa oraz rozkładu normalnego (Gaussa). Celem jest wyjaśnienie, jak na podstawie zmierzonych danych tworzymy ciągłe modele prawdopodobieństwa, jak interpretować histogramy oraz jak pracować z rozkładem normalnym w praktyce.

Definicja: Gęstość prawdopodobieństwa jest funkcją $f(x)$ taką, że prawdopodobieństwo, że ciągła zmienna losowa $X$ leży w przedziale $[a,b]$, jest dane polem pod krzywą: $$P(a,b)=\int_{a}^{b} f(x),dx.$$

1. Uogólnienie i motywacja

  • Systemy rzeczywiste często nie dają się dokładnie opisać; pracujemy z ograniczonymi lub częściowymi pomiarami.
  • Na podstawie dostępnych sygnałów wyznaczamy rozkład zmiennej losowej, który następnie wykorzystujemy do modelowania i symulacji.

Histogram jako pierwszy krok

  • Histogram przedstawia częstość występowania wartości w danych i służy jako dyskretne przybliżenie gęstości.
  • Zalecana liczba klas histogramu: $k \approx 2{,}46 \cdot (N-1)^{0{,}4}$ lub $k \approx \sqrt{N}$, gdzie $N$ to liczba pomiarów.
  • Histogram pozwala nam ocenić normalność, symetrię, wielomodalność oraz wartości odstające.

Definicja: Histogram to rozkład danych na klasy (przedziały) z osią poziomą dla wartości i osią pionową dla częstości; powierzchnia każdego słupka odpowiada częstości danej klasy.

2. Gęstość prawdopodobieństwa (Probability Density Function)

Podstawowe właściwości

  • Dla ciągłej zmiennej losowej $X$ istnieje funkcja $f(x)$ taka, że $$f(x)=\lim_{\Delta x\to 0}\frac{P(x,x+\Delta x)}{\Delta x}.$$
  • Całkowite prawdopodobieństwo wynosi 1: $$\int_{-\infty}^{\infty} f(x),dx=1.$$
  • Prawdopodobieństwo w przedziale: $$P(a,b)=\int_{a}^{b} f(x),dx.$$

Dystrybuanta

  • Dystrybuanta $F(x)$ jest funkcją pierwotną gęstości: $$F(x)=\int_{-\infty}^{x} f(t),dt.$$
  • Właściwości $F(x)$: jest niemalejąca, $\lim_{x\to -\infty}F(x)=0$, $\lim_{x\to +\infty}F(x)=1$.

3. Rozkład normalny (Gaussa)

Definicja: Rozkład normalny z parametrami $\mu$ i $\sigma$ ma gęstość $$f(x)=\frac{1}{\sigma\sqrt{2\pi}}\exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right).$$

Wyjaśnienie parametrów

  • $\mu$ jest wartością oczekiwaną i jednocześnie położeniem maksimum krzywej.
  • $\sigma$ jest odchyleniem standardowym; większe $\sigma$ oznacza szerszą i niższą krzywą, tak aby pole pod krzywą pozostało równe 1.

Właściwości rozkładu normalnego

  • Symetria wokół $\mu$.
  • Aproksymuje wiele zjawisk naturalnych (błędy pomiarowe, wielkości biologiczne, IQ w populacji) dzięki centralnemu twierdzeniu granicznemu.
  • Dokładne prawdopodobieństwa między punktami obliczamy za pomocą całek z funkcji gęstości; w praktyce używa się tablic lub funkcji dystrybuanty (CDF).

Praktyczne zastosowanie

  • Modelowanie błędów pomiarowych: różnicę między wartością rzeczywistą a obserwowaną często traktujemy jako zmienną o rozkładzie normalnym.
  • Testowanie hipotez i przedziały ufności w wnioskowaniu statystycznym.
  • Symulacja zmiennych losowych w metodach Monte Carlo.

Definicja: Standardowy rozkład normalny ma $\mu=0$, $\sigma=1$ oraz gęstość $$\varphi(z)=\frac{1}{\sqrt{2\pi}}\exp\left(-\frac{z^2}{2}\right).$$

Przykłady

  1. Pomiar długości części: mierzone odchylenia od długości nominalnej $\approx$ o rozkładzie w przybliżeniu normalnym z $\mu=0$, z $\sigma$ oszacowanym na podstawie danych.
  2. Wzrost dorosłych w populacji: jeśli dane są symetryczne i jednowierzchołkowe, można je aproksymować rozkładem normalnym i obliczyć procenty powyżej/poniżej określonej wartości za pomocą dystrybuanty (CDF).

Porównanie ze statystykami z próby (tabela)

Liczebność danychHistogramGęstość (PDF)
Typdyskretne przybliżeniefunkcja ciągła
Wartośćczęstość w przedziale (binie)wartość $f(x)$ (nie jest prawdopodobieństwem dla punktu)
Zastosowanieszybka wizualizacjaobliczenia prawdopodobieństw i wnioskowanie statystyczne

4. Jak określić, czy dane

Zarejestruj się po pełne podsumowanie
FiszkiTest wiedzyStreszczeniePodcastMapa myśli
Zacznij za darmo

Masz już konto? Zaloguj się

Gęstość prawdopodobieństwa i rozkład normalny

Klíčové pojmy: Histogram przedstawia częstość wartości i służy jako dyskretne przybliżenie gęstości, Liczba binów: $k\approx2{,}46\cdot(N-1)^{0{,}4}$ lub $k\approx\sqrt{N}$, Gęstość $f(x)$ spełnia $\int_{-\infty}^{\infty} f(x)\,dx=1$, Prawdopodobieństwo w przedziale: $P(a,b)=\int_{a}^{b} f(x)\,dx$, Dystrybuanta: $F(x)=\int_{-\infty}^{x} f(t)\,dt$, Gęstość rozkładu normalnego: $f(x)=\dfrac{1}{\sigma\sqrt{2\pi}}\exp\left(-\dfrac{(x-\mu)^2}{2\sigma^2}\right)$, Gęstość standardowego rozkładu normalnego: $\varphi(z)=\dfrac{1}{\sqrt{2\pi}}\exp\left(-\dfrac{z^2}{2}\right)$, Transformacja: jeśli $Z\sim N(0,1)$, to $X=\mu+\sigma Z\sim N(\mu,\sigma^2)$, Użyj wykresu Q-Q i testów (Shapiro-Wilka) do sprawdzenia normalności, Wartość $f(x)$ nie jest prawdopodobieństwem punktu, prawdopodobieństwo to pole pod krzywą

## Wprowadzenie Niniejszy materiał przedstawia podstawowe pojęcia i praktyczne zastosowanie **gęstości prawdopodobieństwa** oraz **rozkładu normalnego (Gaussa)**. Celem jest wyjaśnienie, jak na podstawie zmierzonych danych tworzymy ciągłe modele prawdopodobieństwa, jak interpretować histogramy oraz jak pracować z rozkładem normalnym w praktyce. > **Definicja:** Gęstość prawdopodobieństwa jest funkcją $f(x)$ taką, że prawdopodobieństwo, że ciągła zmienna losowa $X$ leży w przedziale $[a,b]$, jest dane polem pod krzywą: $$P(a,b)=\int_{a}^{b} f(x)\,dx.$$ ## 1. Uogólnienie i motywacja - Systemy rzeczywiste często nie dają się dokładnie opisać; pracujemy z ograniczonymi lub częściowymi pomiarami. - Na podstawie dostępnych sygnałów wyznaczamy rozkład zmiennej losowej, który następnie wykorzystujemy do modelowania i symulacji. ### Histogram jako pierwszy krok - Histogram przedstawia częstość występowania wartości w danych i służy jako dyskretne przybliżenie gęstości. - Zalecana liczba klas histogramu: $k \approx 2{,}46 \cdot (N-1)^{0{,}4}$ lub $k \approx \sqrt{N}$, gdzie $N$ to liczba pomiarów. - Histogram pozwala nam ocenić normalność, symetrię, wielomodalność oraz wartości odstające. > **Definicja:** Histogram to rozkład danych na klasy (przedziały) z osią poziomą dla wartości i osią pionową dla częstości; powierzchnia każdego słupka odpowiada częstości danej klasy. ## 2. Gęstość prawdopodobieństwa (Probability Density Function) ### Podstawowe właściwości - Dla ciągłej zmiennej losowej $X$ istnieje funkcja $f(x)$ taka, że $$f(x)=\lim_{\Delta x\to 0}\frac{P(x,x+\Delta x)}{\Delta x}.$$ - Całkowite prawdopodobieństwo wynosi 1: $$\int_{-\infty}^{\infty} f(x)\,dx=1.$$ - Prawdopodobieństwo w przedziale: $$P(a,b)=\int_{a}^{b} f(x)\,dx.$$ ### Dystrybuanta - Dystrybuanta $F(x)$ jest funkcją pierwotną gęstości: $$F(x)=\int_{-\infty}^{x} f(t)\,dt.$$ - Właściwości $F(x)$: jest niemalejąca, $\lim_{x\to -\infty}F(x)=0$, $\lim_{x\to +\infty}F(x)=1$. ## 3. Rozkład normalny (Gaussa) > **Definicja:** Rozkład normalny z parametrami $\mu$ i $\sigma$ ma gęstość $$f(x)=\frac{1}{\sigma\sqrt{2\pi}}\exp\left( -\frac{(x-\mu)^2}{2\sigma^2} \right).$$ ### Wyjaśnienie parametrów - $\mu$ jest wartością oczekiwaną i jednocześnie położeniem maksimum krzywej. - $\sigma$ jest odchyleniem standardowym; większe $\sigma$ oznacza szerszą i niższą krzywą, tak aby pole pod krzywą pozostało równe 1. ### Właściwości rozkładu normalnego - Symetria wokół $\mu$. - Aproksymuje wiele zjawisk naturalnych (błędy pomiarowe, wielkości biologiczne, IQ w populacji) dzięki centralnemu twierdzeniu granicznemu. - Dokładne prawdopodobieństwa między punktami obliczamy za pomocą całek z funkcji gęstości; w praktyce używa się tablic lub funkcji dystrybuanty (CDF). ### Praktyczne zastosowanie - Modelowanie błędów pomiarowych: różnicę między wartością rzeczywistą a obserwowaną często traktujemy jako zmienną o rozkładzie normalnym. - Testowanie hipotez i przedziały ufności w wnioskowaniu statystycznym. - Symulacja zmiennych losowych w metodach Monte Carlo. > **Definicja:** Standardowy rozkład normalny ma $\mu=0$, $\sigma=1$ oraz gęstość $$\varphi(z)=\frac{1}{\sqrt{2\pi}}\exp\left(-\frac{z^2}{2}\right).$$ ### Przykłady 1) Pomiar długości części: mierzone odchylenia od długości nominalnej $\approx$ o rozkładzie w przybliżeniu normalnym z $\mu=0$, z $\sigma$ oszacowanym na podstawie danych. 2) Wzrost dorosłych w populacji: jeśli dane są symetryczne i jednowierzchołkowe, można je aproksymować rozkładem normalnym i obliczyć procenty powyżej/poniżej określonej wartości za pomocą dystrybuanty (CDF). ### Porównanie ze statystykami z próby (tabela) | Liczebność danych | Histogram | Gęstość (PDF) | |---|---:|---:| | Typ | dyskretne przybliżenie | funkcja ciągła | | Wartość | częstość w przedziale (binie) | wartość $f(x)$ (nie jest prawdopodobieństwem dla punktu) | | Zastosowanie | szybka wizualizacja | obliczenia prawdopodobieństw i wnioskowanie statystyczne | ## 4. Jak określić, czy dane