Summary of Data and Big Data Fundamentals

Data and Big Data Fundamentals: A Student's Guide

Úvod

Velká data (Big Data) zahrnují rozsáhlé, rychle se tvořící a heterogenní soubory dat, které nelze efektivně zpracovat tradičními nástroji na jednom počítači. Cílem tohoto materiálu je vysvětlit základní pojmy, typy dat, technologie a formáty používané při práci s velkými daty, ukázat datový životní cyklus a role v datových týmech a uvést praktické příklady aplikací.

Definice: Velká data jsou množiny dat tak velké, rychlé nebo různorodé, že vyžadují speciální technologie a přístupy k ukládání, zpracování a analýze.

1. Typy dat

1.1 Klasifikace podle charakteru

  • Strukturovaná data: tabulky, relační databáze, pevné schéma.
  • Polostrukturovaná data (semi-structured): XML, JSON, HTML — data mají částečnou strukturu nebo metadata.
  • Nestrukturovaná data: obrázky, video, audio, PDF — struktura není definována.

Definice: Strukturovaná data jsou data uložená v předem definované podobě (např. tabulka), polostrukturovaná obsahují značky nebo metadata a nestrukturovaná data nemají jednotné uspořádání.

1.2 Další běžné kategorie

  • Nominalní, Ordinální, Diskrétní, Kontinuální
  • Kvantitativní vs. Kvalitativní
  • Datové typy v programování: $\text{Integer}$, $\text{Float}$, $\text{Boolean}$, $\text{String}$, pole, slovníky

V praxi je důležité rozlišit, zda data potřebujeme především číst rychle (OLAP) nebo zapisovat často (OLTP).

2. Datový životní cyklus (Data Lifecycle)

  1. Plán (Business case / problém)
  2. Identifikace dat
  3. Nákup / sběr / generace dat
  4. Získání a extrakce
  5. Čištění a validace (data munging)
  6. Agregace a uložení
  7. Průzkumná analýza (EDA)
  8. Vizualizace
  9. Využití a sdílení
  10. Archivace a odstranění

Definice: Datový životní cyklus popisuje postup od vytvoření dat až po jejich zničení, včetně zpracování, uchovávání a použití.

💡 Did you know?Did you know že správné zavedení datových zásad a DataOps vede k rychlejšímu nasazení analytiky a lepší spolupráci mezi týmy?

2.1 DataOps

  • Metodologie pro automatizaci a orchestraci datových toků.
  • Cíl: zvýšit komunikaci, integraci a automatizaci mezi „data producers“ a „data consumers“.
💡 Did you know?Fun fact: DataOps často využívá principy DevOps přenesené do datové domény, včetně CI/CD pro datové pipelines.

3. Role v datových týmech

  • Data Analyst: analýza číselných dat, vizualizace, podpora rozhodování; obvykle pracuje se strukturovanými daty.
  • Data Engineer: staví datovou infrastrukturu, ETL/ELT pipeline, správa úložišť a zpracování.
  • Data Scientist: modelování, strojové učení, prediktivní analýza, statistika.
  • Dále: databázoví administrátoři, architekti, BI specialisté, ML inženýři, bezpečnostní experti.

Definice: Data Engineer připravuje a zaručuje dostupnost a kvalitu dat pro analytické a modelovací úlohy.

4. Charakteristiky velkých dat (5V)

  • Volume (Objem): stovky GB, TB a více; HDFS rozděluje soubory na bloky typicky $128,\text{MB}$.
  • Velocity (Rychlost): tempo tvorby dat a potřeba průběžného zpracování.
  • Variety (Různorodost): logy, senzory, sociální sítě, databáze, multimédia.
  • Veracity (Důvěryhodnost): kvalita, konzistence a úplnost dat.
  • Value (Hodnota): cíl získat ekonomický nebo provozní přínos.
💡 Did you know?Věděli jste, že Hadoop a Spark jsou často používány společně, kde Hadoop slouží jako úložiště (HDFS) a Spark jako rychlý engine pro zpracování?

5. Architektury a systémy

5.1 Hadoop a HDFS

  • Apache Hadoop: open-source framework pro distribuované ukládání a zpracování velkých objemů dat.
  • HDFS: distribuovaný souborový systém, dělí soubory do bloků (výchozí $128,\text{MB}$) a replikuje je (výchozí 3 kopie).

Definice: HDFS je navržen pro vysokou propustnost čtení dat nad velkými soubory a odolnost vůči selhání uzlů.

5.2 Klíčové komponenty ekosystému

  • YARN: resource manager pro cluster.
  • Spark: in-memory engine pro rychlé zpracování dat.
  • Hive, HBase, Impala: různé nástroje pro dotazování a ukládání.
  • Kafka, Flume, Sqoop, NiFi: n
Sign up for the full summary
FlashcardsKnowledge testSummaryPodcastMindmap
Start for free

Already have an account? Sign in

Velká data - přehled

Klíčové pojmy: Velká data definice a 5V (Volume, Velocity, Variety, Veracity, Value), Rozdíl mezi strukturovanými, polostrukturovanými a nestrukturovanými daty, Datový životní cyklus: plán, sběr, čištění, ukládání, analýza, archivace, DataOps zlepšuje automatizaci a komunikaci v datových tocích, Role: Data Engineer připravuje data, Data Analyst analyzuje, Data Scientist modeluje, Hadoop/HDFS: distribuce, bloky typicky $128\,\text{MB}$, replikace 3, Formáty: Avro pro write-heavy a schema evolution, Parquet/ORC pro read-heavy analytiku, Row-store vs Column-store: OLTP vs OLAP rozdíly, Výběr formátu ovlivňuje výkon, kompresi a možnost rozdělení souborů, Praktické pipeline: ingest (Kafka), zpracování (Spark), úložiště (Parquet/HDFS)

## Úvod Velká data (Big Data) zahrnují rozsáhlé, rychle se tvořící a heterogenní soubory dat, které nelze efektivně zpracovat tradičními nástroji na jednom počítači. Cílem tohoto materiálu je vysvětlit základní pojmy, typy dat, technologie a formáty používané při práci s velkými daty, ukázat datový životní cyklus a role v datových týmech a uvést praktické příklady aplikací. > **Definice:** Velká data jsou množiny dat tak velké, rychlé nebo různorodé, že vyžadují speciální technologie a přístupy k ukládání, zpracování a analýze. ## 1. Typy dat ### 1.1 Klasifikace podle charakteru - **Strukturovaná data**: tabulky, relační databáze, pevné schéma. - **Polostrukturovaná data (semi-structured)**: XML, JSON, HTML — data mají částečnou strukturu nebo metadata. - **Nestrukturovaná data**: obrázky, video, audio, PDF — struktura není definována. > **Definice:** Strukturovaná data jsou data uložená v předem definované podobě (např. tabulka), polostrukturovaná obsahují značky nebo metadata a nestrukturovaná data nemají jednotné uspořádání. ### 1.2 Další běžné kategorie - **Nominalní, Ordinální, Diskrétní, Kontinuální** - **Kvantitativní vs. Kvalitativní** - **Datové typy v programování**: $\text{Integer}$, $\text{Float}$, $\text{Boolean}$, $\text{String}$, pole, slovníky V praxi je důležité rozlišit, zda data potřebujeme především číst rychle (OLAP) nebo zapisovat často (OLTP). ## 2. Datový životní cyklus (Data Lifecycle) 1. Plán (Business case / problém) 2. Identifikace dat 3. Nákup / sběr / generace dat 4. Získání a extrakce 5. Čištění a validace (data munging) 6. Agregace a uložení 7. Průzkumná analýza (EDA) 8. Vizualizace 9. Využití a sdílení 10. Archivace a odstranění > **Definice:** Datový životní cyklus popisuje postup od vytvoření dat až po jejich zničení, včetně zpracování, uchovávání a použití. Did you know že správné zavedení datových zásad a DataOps vede k rychlejšímu nasazení analytiky a lepší spolupráci mezi týmy? ### 2.1 DataOps - Metodologie pro automatizaci a orchestraci datových toků. - Cíl: zvýšit komunikaci, integraci a automatizaci mezi „data producers“ a „data consumers“. Fun fact: DataOps často využívá principy DevOps přenesené do datové domény, včetně CI/CD pro datové pipelines. ## 3. Role v datových týmech - **Data Analyst**: analýza číselných dat, vizualizace, podpora rozhodování; obvykle pracuje se strukturovanými daty. - **Data Engineer**: staví datovou infrastrukturu, ETL/ELT pipeline, správa úložišť a zpracování. - **Data Scientist**: modelování, strojové učení, prediktivní analýza, statistika. - Dále: databázoví administrátoři, architekti, BI specialisté, ML inženýři, bezpečnostní experti. > **Definice:** Data Engineer připravuje a zaručuje dostupnost a kvalitu dat pro analytické a modelovací úlohy. ## 4. Charakteristiky velkých dat (5V) - **Volume (Objem)**: stovky GB, TB a více; HDFS rozděluje soubory na bloky typicky $128\,\text{MB}$. - **Velocity (Rychlost)**: tempo tvorby dat a potřeba průběžného zpracování. - **Variety (Různorodost)**: logy, senzory, sociální sítě, databáze, multimédia. - **Veracity (Důvěryhodnost)**: kvalita, konzistence a úplnost dat. - **Value (Hodnota)**: cíl získat ekonomický nebo provozní přínos. Věděli jste, že Hadoop a Spark jsou často používány společně, kde Hadoop slouží jako úložiště (HDFS) a Spark jako rychlý engine pro zpracování? ## 5. Architektury a systémy ### 5.1 Hadoop a HDFS - **Apache Hadoop**: open-source framework pro distribuované ukládání a zpracování velkých objemů dat. - **HDFS**: distribuovaný souborový systém, dělí soubory do bloků (výchozí $128\,\text{MB}$) a replikuje je (výchozí 3 kopie). > **Definice:** HDFS je navržen pro vysokou propustnost čtení dat nad velkými soubory a odolnost vůči selhání uzlů. ### 5.2 Klíčové komponenty ekosystému - **YARN**: resource manager pro cluster. - **Spark**: in-memory engine pro rychlé zpracování dat. - **Hive, HBase, Impala**: různé nástroje pro dotazování a ukládání. - **Kafka, Flume, Sqoop, NiFi**: n