Summary of Data and Big Data Fundamentals
Data and Big Data Fundamentals: A Student's Guide
Úvod
Velká data (Big Data) zahrnují rozsáhlé, rychle se tvořící a heterogenní soubory dat, které nelze efektivně zpracovat tradičními nástroji na jednom počítači. Cílem tohoto materiálu je vysvětlit základní pojmy, typy dat, technologie a formáty používané při práci s velkými daty, ukázat datový životní cyklus a role v datových týmech a uvést praktické příklady aplikací.
Definice: Velká data jsou množiny dat tak velké, rychlé nebo různorodé, že vyžadují speciální technologie a přístupy k ukládání, zpracování a analýze.
1. Typy dat
1.1 Klasifikace podle charakteru
- Strukturovaná data: tabulky, relační databáze, pevné schéma.
- Polostrukturovaná data (semi-structured): XML, JSON, HTML — data mají částečnou strukturu nebo metadata.
- Nestrukturovaná data: obrázky, video, audio, PDF — struktura není definována.
Definice: Strukturovaná data jsou data uložená v předem definované podobě (např. tabulka), polostrukturovaná obsahují značky nebo metadata a nestrukturovaná data nemají jednotné uspořádání.
1.2 Další běžné kategorie
- Nominalní, Ordinální, Diskrétní, Kontinuální
- Kvantitativní vs. Kvalitativní
- Datové typy v programování: $\text{Integer}$, $\text{Float}$, $\text{Boolean}$, $\text{String}$, pole, slovníky
V praxi je důležité rozlišit, zda data potřebujeme především číst rychle (OLAP) nebo zapisovat často (OLTP).
2. Datový životní cyklus (Data Lifecycle)
- Plán (Business case / problém)
- Identifikace dat
- Nákup / sběr / generace dat
- Získání a extrakce
- Čištění a validace (data munging)
- Agregace a uložení
- Průzkumná analýza (EDA)
- Vizualizace
- Využití a sdílení
- Archivace a odstranění
Definice: Datový životní cyklus popisuje postup od vytvoření dat až po jejich zničení, včetně zpracování, uchovávání a použití.
2.1 DataOps
- Metodologie pro automatizaci a orchestraci datových toků.
- Cíl: zvýšit komunikaci, integraci a automatizaci mezi „data producers“ a „data consumers“.
3. Role v datových týmech
- Data Analyst: analýza číselných dat, vizualizace, podpora rozhodování; obvykle pracuje se strukturovanými daty.
- Data Engineer: staví datovou infrastrukturu, ETL/ELT pipeline, správa úložišť a zpracování.
- Data Scientist: modelování, strojové učení, prediktivní analýza, statistika.
- Dále: databázoví administrátoři, architekti, BI specialisté, ML inženýři, bezpečnostní experti.
Definice: Data Engineer připravuje a zaručuje dostupnost a kvalitu dat pro analytické a modelovací úlohy.
4. Charakteristiky velkých dat (5V)
- Volume (Objem): stovky GB, TB a více; HDFS rozděluje soubory na bloky typicky $128,\text{MB}$.
- Velocity (Rychlost): tempo tvorby dat a potřeba průběžného zpracování.
- Variety (Různorodost): logy, senzory, sociální sítě, databáze, multimédia.
- Veracity (Důvěryhodnost): kvalita, konzistence a úplnost dat.
- Value (Hodnota): cíl získat ekonomický nebo provozní přínos.
5. Architektury a systémy
5.1 Hadoop a HDFS
- Apache Hadoop: open-source framework pro distribuované ukládání a zpracování velkých objemů dat.
- HDFS: distribuovaný souborový systém, dělí soubory do bloků (výchozí $128,\text{MB}$) a replikuje je (výchozí 3 kopie).
Definice: HDFS je navržen pro vysokou propustnost čtení dat nad velkými soubory a odolnost vůči selhání uzlů.
5.2 Klíčové komponenty ekosystému
- YARN: resource manager pro cluster.
- Spark: in-memory engine pro rychlé zpracování dat.
- Hive, HBase, Impala: různé nástroje pro dotazování a ukládání.
- Kafka, Flume, Sqoop, NiFi: n
Already have an account? Sign in
Velká data - přehled
Klíčové pojmy: Velká data definice a 5V (Volume, Velocity, Variety, Veracity, Value), Rozdíl mezi strukturovanými, polostrukturovanými a nestrukturovanými daty, Datový životní cyklus: plán, sběr, čištění, ukládání, analýza, archivace, DataOps zlepšuje automatizaci a komunikaci v datových tocích, Role: Data Engineer připravuje data, Data Analyst analyzuje, Data Scientist modeluje, Hadoop/HDFS: distribuce, bloky typicky $128\,\text{MB}$, replikace 3, Formáty: Avro pro write-heavy a schema evolution, Parquet/ORC pro read-heavy analytiku, Row-store vs Column-store: OLTP vs OLAP rozdíly, Výběr formátu ovlivňuje výkon, kompresi a možnost rozdělení souborů, Praktické pipeline: ingest (Kafka), zpracování (Spark), úložiště (Parquet/HDFS)