Zhrnutie na Digitálne spracovanie zvuku a psychoakustika

Digitálne spracovanie zvuku a psychoakustika pre študentov

Úvod

Tento materiál predstavuje základné princípy kvantizácie a entropického kódovania v kontexte kompresie a kódovania zvuku. Zameriame sa na: čo je kvantizácia, typy kvantizérov, bitové prideľovanie a základné bezstratové (noiseless) metódy entropického kódovania. Cieľom je získať praktické pochopenie pre návrh a analýzu QBE (kvantizácia–bitová alokácia–entropia) modulu v audio kodekoch.

1. Základné pojmy

Definícia: Kvantizácia je proces mapovania spojitých alebo veľkého počtu hodnot vstupného signálu na konečnú množinu diskrétnych hodnôt.

Definícia: Entropia náhodnej veličiny $X$ s hodnotami ${v_1,\dots,v_K}$ a pravdepodobnosťami $p_i$ je $H(X)= -\sum_{i=1}^K p_i\log_2(p_i)$.

Definícia: QBE modul (kvantizácia–bitová alokácia–entropia) v audio kodeku zahŕňa kvantizáciu koeficientov, rozhodovanie o počte bitov pre každý koeficient a následné bezstratové kódovanie kvôli ďalšej redukcii dátovej rýchlosti.

2. Hustoty pravdepodobnosti a prečo na nich záleží

  • PDF (pravdepodobnostná hustota) $p(x)$ popisuje, ako sú hodnoty signálu rozložené; pri návrhu kvantizéra využívame tvar PDF.
  • Bežné PDF v audio spracovaní: uniformná, Gaussova a Laplaceova
    • Uniformná: $p_U(x)=\dfrac{1}{2S}\quad\text{pre }x\in(-S,S)$
    • Gaussova (nulový priemer): $p_G(x)=\dfrac{1}{\sqrt{2\pi\sigma_x^2}}\exp\left(-\dfrac{x^2}{2\sigma_x^2}\right)$
    • Laplaceova: $p_L(x)=\dfrac{1}{\sqrt{2},\sigma_x}\exp\left(-\dfrac{\sqrt{2},|x|}{\sigma_x}\right)$
💡 Vedeli ste?Did you know that many krátkodobé spektrálne koeficienty v audiosúboroch majú rozloženie bližšie k Laplaceovej ako k Gaussovej distribúcii? Táto vlastnosť motivuje použitie špecifických entropických kódov a špeciálnych kvantizérov.

3. Skalárna kvantizácia

3.1 Uniformná kvantizácia (PCM)

  • Uniformný kvantizér používa konštantný krok $\Delta$ medzi susednými kvantizačnými hladinami.
  • Ak je signál obmedzený na $s\in(-s_{max},s_{max})$ a používame $R_b$ bitov, počet hladín $Q=2^{R_b}$ a krok $$\Delta = \dfrac{2s_{max}}{2^{R_b}}.$$
  • Pri predpoklade, že kvantizačná chyba $e_q$ má rovnomerné rozdelenie na $\left(-\dfrac{\Delta}{2},\dfrac{\Delta}{2}\right)$, jej disperzia je $$\sigma_{e_q}^2 = \dfrac{\Delta^2}{12}.$$
  • Pravidlo: približne +6,02 dB SNR na každý pridaný bit: $$\text{SNR}_{\text{PCM}}\approx 6{.}02,R_b + K_1\ \text{(dB)},$$ kde $K_1$ závisí od zaťaženia a spektrálnej charakteristiky vstupu.

3.2 Nonuniformná kvantizácia a kompandovanie

  • Pri signáloch s nejednotným PDF sú efektívnejšie neuniformné kroky: jemnejšie okolo často sa vyskytujúcich hodnôt, hrubšie inde.
  • Praktické riešenie: kompresor $g(\cdot)$ pred lineárnym kvantizérom a expander $g^{-1}(\cdot)$ v dekóderi.
  • Telekomunikačné štandardy používajú log-kompandovanie: $\mu$-law a A-law
    • $\mu$-law (približne pre $\mu=255$): $$\left|g(s)\right| = \dfrac{\log\left(1+\mu\left|\dfrac{s}{s_{max}}\right|\right)}{\log(1+\mu)}.$$
    • A-law: definované po kusoch, s podobnou myšlienkou lineárnej odozvy pri malých amplitúdach a log pri veľkých.
  • Adaptívne schémy (APCM) menia $\Delta$ na základe okolitých vzoriek; krok môže byť prenášaný ako side-info alebo odhadnutý z histórie.

3.3 DPCM, delta modulačné metódy

  • DPCM kóduje rozdiel medzi aktuálnym a predikovaným vzorkom; využíva koreláciu v čase.
  • Výhodou je zníženie spektra chýb a menšia potreba bitov pri rovnakej kvalite oproti PCM.

4. Skalárna vs. vektorová kvantizácia

  • Skalárna: kvantuje sa každá vzorka samostatne.
  • Vektorová (VQ): kvantizuje sa blok $N$ vzoriek ako jeden vektor; výsledkom je tabuľka prototypov (codebook) s $L$ položkami.

Tabuľka: porovnanie

VlastnosťSkalárna (SQ)Vektorová (VQ)
Dimenzia1$N$
Potreba pamätenízkavysoká (codebook)
Kompresný ziskmenšíväčší pri štruktúrach
Výpočetná náročnosťnízkavysoká pri hľadaní najbližšieho vektora
  • Štruktúrované VQ (split-VQ, multi-stage VQ, conjugate-structure VQ) znižujú výpočtové náklady a pamäťovú
Zaregistruj sa pre celé zhrnutie
KartičkyTest znalostíZhrnutiePodcastMyšlienková mapa
Začni zadarmo

Už máš účet? Prihlásiť sa

Kvantizácia a entropia (zvuk)

Klíčová slova: Kepstrálna a cepstrálna analýza, Transformácie a FFT v audio DSP, Akustika a priestorové audio - spracovanie a efekty, DSP pre zvukové signály, Percepcia a biologické základy sluchu - anatómia ucha, Percepcia a biologické základy sluchu - vnímanie zvuku, Vzorkovanie a konverzia v DSP, Kódovanie reči a spektrálna analýza, Kompresia a kodeky zvuku — všeobecné kódovanie audia, Kompresia a kodeky zvuku — bezztrátové kódovanie, Fonológia, prozódia a reprezentácie reči — Reprezentácie a spracovanie signálu, Kompresia a kodeky zvuku — spracovanie signálov, Kompresia a kodeky zvuku — kódovanie reči, Kódovanie a spracovanie zvuku, Kompresia a kodeky zvuku — psychoakustika a modely, Kompresia a kodeky zvuku — filtre a transformácie, Kvantizácia a numerika v DSP, Filtre a banky v audio DSP, Pokročilé filtre a nelinearity v DSP, Akustika a priestorové audio - meranie a simulácia, Efekty, dynamika a priestorové audio, Kompresia a kodeky zvuku — kódovanie zvuku, Kompresia a kodeky zvuku — MPEG a štandardy, Kompresia a kodeky zvuku — perceptívne kódovanie, Kompresia a kodeky zvuku — digitálne kódovanie, Základy digitálneho spracovania signálu, Stochastické procesy a štatistika v DSP, Kompresia a kodeky zvuku — kvantizácia a entropia, Kompresia a kodeky zvuku — predikčné a rečové kódovanie, Kompresia a kodeky zvuku — modelové a parametrické kodeky, Kompresia a kodeky zvuku — komerčné kodeky a štandardy, Kompresia a kodeky zvuku — hodnotenie a testovanie, Spracovanie reči – základné oblasti, Spracovanie reči – akustika a signály, Rozpoznávanie reči a jazyka, Spracovanie prirodzeného jazyka v reči, Fonológia, prozódia a reprezentácie reči — Fonologické a morfologické štruktúry, Strojové učenie pre rozpoznávanie reči, Modely a metódy pre rozpoznávanie reči, Akustické modelovanie reči, Akustika a priestorové audio - mikrofóny a polia, Robustnosť a odolnosť rozpoznávania reči, Jazykové modelovanie a parsing, Jazykové modelovanie pre rozpoznávanie reči, Algoritmy vyhľadávania v grafoch, Algoritmy rozpoznávania reči, Vyhľadávacie metódy v rozpoznávaní reči, Vyhľadávanie v rozsiahlych slovníkoch, Vyhľadávanie v rečových modeloch, Text-to-Speech (TTS) – analýza a spracovanie, Text-to-Speech (TTS) – systémy, Fonológia, prozódia a reprezentácie reči — Rečová syntéza a prozódia, Fonológia, prozódia a reprezentácie reči — Intonácia a prosódia, Syntéza reči a prosódia, Porozumenie hovorenému jazyku a SLU, Dialógové a konverzačné systémy, Hlasové rozhrania a UX

Klíčové pojmy: Kvantizácia mapuje spojité hodnoty na konečnú množinu diskrétnych hodnôt., Pri uniformnej kvantizácii platí $\sigma_{e_q}^2=\dfrac{\Delta^2}{12}$ a ~+6.02 dB SNR na bit., Nonuniformné kvantizátory (kompandovanie) zlepšujú kvalitu pre neuniformné PDF, napr. $\mu$-law., DPCM znižuje redundanciu využitím predikcie medzi vzorkami., Vektorová kvantizácia (VQ) kvantizuje bloky signálu a často poskytuje lepší kompresný zisk než SQ., Bitová alokácia rieši minimalizáciu MSE pri obmedzenom počte bitov a často vyžaduje log-energetické kritériá., Huffman je prefixový kód blízky entropii pre stabilné pravdepodobnosti; aritmetické kódovanie je efektívnejšie pre krátke alebo adaptívne zdroje., Rice/Golomb sú výhodné pri exponenciálne klesajúcich rozdeleniach (run-length, Laplace)., Split- a multi-stage VQ znižujú komplexitu hľadania codebooku pri prijateľnej strate výkonu., Pri návrhu vždy porovnajte modelované PDF koeficientov so skutočnými histogramami a vyberte zodpovedajúcu metódu.

## Úvod Tento materiál predstavuje základné princípy kvantizácie a entropického kódovania v kontexte kompresie a kódovania zvuku. Zameriame sa na: čo je kvantizácia, typy kvantizérov, bitové prideľovanie a základné bezstratové (noiseless) metódy entropického kódovania. Cieľom je získať praktické pochopenie pre návrh a analýzu QBE (kvantizácia–bitová alokácia–entropia) modulu v audio kodekoch. ## 1. Základné pojmy > Definícia: **Kvantizácia** je proces mapovania spojitých alebo veľkého počtu hodnot vstupného signálu na konečnú množinu diskrétnych hodnôt. > Definícia: **Entropia** náhodnej veličiny $X$ s hodnotami $\{v_1,\dots,v_K\}$ a pravdepodobnosťami $p_i$ je $H(X)= -\sum_{i=1}^K p_i\log_2(p_i)$. > Definícia: **QBE modul** (kvantizácia–bitová alokácia–entropia) v audio kodeku zahŕňa kvantizáciu koeficientov, rozhodovanie o počte bitov pre každý koeficient a následné bezstratové kódovanie kvôli ďalšej redukcii dátovej rýchlosti. ## 2. Hustoty pravdepodobnosti a prečo na nich záleží - PDF (pravdepodobnostná hustota) $p(x)$ popisuje, ako sú hodnoty signálu rozložené; pri návrhu kvantizéra využívame tvar PDF. - Bežné PDF v audio spracovaní: uniformná, Gaussova a Laplaceova - Uniformná: $p_U(x)=\dfrac{1}{2S}\quad\text{pre }x\in(-S,S)$ - Gaussova (nulový priemer): $p_G(x)=\dfrac{1}{\sqrt{2\pi\sigma_x^2}}\exp\left(-\dfrac{x^2}{2\sigma_x^2}\right)$ - Laplaceova: $p_L(x)=\dfrac{1}{\sqrt{2}\,\sigma_x}\exp\left(-\dfrac{\sqrt{2}\,|x|}{\sigma_x}\right)$ Did you know that many krátkodobé spektrálne koeficienty v audiosúboroch majú rozloženie bližšie k Laplaceovej ako k Gaussovej distribúcii? Táto vlastnosť motivuje použitie špecifických entropických kódov a špeciálnych kvantizérov. ## 3. Skalárna kvantizácia ### 3.1 Uniformná kvantizácia (PCM) - Uniformný kvantizér používa konštantný krok $\Delta$ medzi susednými kvantizačnými hladinami. - Ak je signál obmedzený na $s\in(-s_{max},s_{max})$ a používame $R_b$ bitov, počet hladín $Q=2^{R_b}$ a krok $$\Delta = \dfrac{2s_{max}}{2^{R_b}}.$$ - Pri predpoklade, že kvantizačná chyba $e_q$ má rovnomerné rozdelenie na $\left(-\dfrac{\Delta}{2},\dfrac{\Delta}{2}\right)$, jej disperzia je $$\sigma_{e_q}^2 = \dfrac{\Delta^2}{12}.$$ - Pravidlo: približne +6,02 dB SNR na každý pridaný bit: $$\text{SNR}_{\text{PCM}}\approx 6{.}02\,R_b + K_1\ \text{(dB)},$$ kde $K_1$ závisí od zaťaženia a spektrálnej charakteristiky vstupu. ### 3.2 Nonuniformná kvantizácia a kompandovanie - Pri signáloch s nejednotným PDF sú efektívnejšie neuniformné kroky: jemnejšie okolo často sa vyskytujúcich hodnôt, hrubšie inde. - Praktické riešenie: kompresor $g(\cdot)$ pred lineárnym kvantizérom a expander $g^{-1}(\cdot)$ v dekóderi. - Telekomunikačné štandardy používajú log-kompandovanie: $\mu$-law a A-law - $\mu$-law (približne pre $\mu=255$): $$\left|g(s)\right| = \dfrac{\log\left(1+\mu\left|\dfrac{s}{s_{max}}\right|\right)}{\log(1+\mu)}.$$ - A-law: definované po kusoch, s podobnou myšlienkou lineárnej odozvy pri malých amplitúdach a log pri veľkých. - Adaptívne schémy (APCM) menia $\Delta$ na základe okolitých vzoriek; krok môže byť prenášaný ako side-info alebo odhadnutý z histórie. ### 3.3 DPCM, delta modulačné metódy - DPCM kóduje rozdiel medzi aktuálnym a predikovaným vzorkom; využíva koreláciu v čase. - Výhodou je zníženie spektra chýb a menšia potreba bitov pri rovnakej kvalite oproti PCM. ## 4. Skalárna vs. vektorová kvantizácia - **Skalárna**: kvantuje sa každá vzorka samostatne. - **Vektorová (VQ)**: kvantizuje sa blok $N$ vzoriek ako jeden vektor; výsledkom je tabuľka prototypov (codebook) s $L$ položkami. Tabuľka: porovnanie | Vlastnosť | Skalárna (SQ) | Vektorová (VQ) | |---|---:|---:| | Dimenzia | 1 | $N$ | | Potreba pamäte | nízka | vysoká (codebook) | | Kompresný zisk | menší | väčší pri štruktúrach | | Výpočetná náročnosť | nízka | vysoká pri hľadaní najbližšieho vektora | - Štruktúrované VQ (split-VQ, multi-stage VQ, conjugate-structure VQ) znižujú výpočtové náklady a pamäťovú