Zhrnutie na Kľúčové koncepty IT manažmentu a architektúry
Kľúčové Koncepty IT Manažmentu a Architektúry: Sprievodca
Úvod
Tento materiál sa zaoberá dostupnosťou a kontinuitou IT služieb z pohľadu definícií, meraní a plánovania obnovy po incidentoch. Zameriame sa na vzťah medzi SLA, SLO a SLI, na riadenie kontinuity podnikania (BCM), kľúčové parametre RTO a RPO, typy zálohovania a disaster recovery lokalít a základné komponenty IT architektúry relevantné pre dostupnosť.
Definícia: SLA (Service Level Agreement) je dohodnutý dokument s externým alebo interným zákazníkom; SLO (Service Level Objective) je konkrétny cieľ kvality služby (napr. 99,9 % dostupnosť); SLI (Service Level Indicator) je metrika merajúca tento cieľ (napr. % času dostupnosti).
SLA, SLO a SLI — vzťah a príklady
Základná myšlienka
- SLA je formálny dokument/dohoda. V SLA sú definované SLO. Každé SLO má presne jedno SLI, ktoré sa meria.
Definícia: SLO je cieľ úrovne služby; SLI je merateľná indikácia, ktorou overujeme, či bolo SLO splnené.
Prečo neklesať (alebo zvyšovať) SLO na 100 %?
- Každé percento dostupnosti navyše zvyšuje náklady: redundancie, viac personálu na pohotovosti, druhá lokalita atď.
- Napríklad 99,9 % dostupnosť typicky vyžaduje 24/7 monitoring a personál na pohotovosti alebo priamu prítomnosť v datacentre.
- Ekonomický príklad: Agendový systém na ministerstve, ktorý funguje v čase 7:00–17:00, nemusí vyžadovať SLO 99,9 %; postačí nižšie SLO z hľadiska nákladov versus prínosu.
Praktický príklad merania
- SLO: 99,9 % dostupnosť
- SLI: percento času, kedy služba odpovedá v čase sledovaného obdobia
- Interpretácia: Ak monitoring ukáže dostupnosť 99,7 %, SLO 99,9 % nie je splnené a treba eskalovať podľa SLA.
Biznis kontinuity manažment (BCM)
Definícia: BCM (Business Continuity Management) je stratégia a súbor dokumentov popisujúcich, ako organizácia bude fungovať pri vážnych udalostiach (požiar, povodeň, evakuácia, výpadok serverovne).
Kľúčové parametre BCM
- RTO — Recovery Time Objective
- Maximálna akceptovateľná doba obnovy systému po incidente, vyjadrená v čase.
- Príklad: RTO = 4 hodiny znamená, že do 4 hodín od výpadku musia byť systémy obnovené a používatelia musia byť schopní sa pripojiť.
- RPO — Recovery Point Objective
- Maximálna akceptovateľná strata dát vyjadrená v čase (ako "staré" môžu byť dáta po obnove).
- Príklad: RPO = 15 minút znamená, že záloha môže byť maximálne 15 minút stará; pri obnove stratíme najviac 15 minút práce.
- Príklad: RPO = 4 dni pri obnove zo zálohy na páskach znamená, že môžeme stratiť až 4 dni dát.
Ako RTO a RPO ovplyvňujú dizajn riešenia
- Nižšie RTO a RPO zvyčajne vyžadujú drahšie riešenia (hot standby, replikácia dát v reálnom čase).
- Vyššie RTO/RPO umožňujú lacnejšie zálohovacie stratégie (páskové zálohovanie, cold site).
Zálohovanie — typy a porovnanie
Definícia: Zálohovanie je proces vytvárania kópií dát, ktoré sa použijú na obnovu po strate alebo poškodeni.
| Typ zálohovania | Popis | RTO/RPO | Cena |
|---|---|---|---|
| Hot standby (záložná lokalita) | Kontinuálna synchronizácia, prepnutie za minúty | Nízke RTO/RPO | Najdrahšie |
| Warm site | Hardvér prítomný a čiastočne nakonfigurovaný; obnova trvá hodiny | Stredné RTO/RPO | Stredne drahý |
| Cold site | Len hardvér a sieť; inštalácia a konfigurácia trvá dni | Vysoké RTO/RPO | Lacnejší |
| Páskové zálohovanie | Zálohy na pásky odnášané fyzicky na iné miesto | Vysoké RTO/RPO (hodiny–dni) | Najlacnejšie |
- Inkrementálna vs. diferenčná vs. plná záloha — výber závisí od RPO, dostupného miesta a času na obnovu.
Typy disaster recovery lokalít — oprava rozdelenia
- Hot site — plne prevádzkovaná lokalita, dáta synchronizované v reálnom čase, prepnutie za minúty, najdrahšia.
- Warm site — lokalita s pripraveným hardvérom a čiastočnou konfiguráciou; obnova trvá hodiny; stredne drahá.
- Cold site — len základná infraštruktúra; obnova trvá dni; najlacnejšia.
- Be
Už máš účet? Prihlásiť sa
Dostupnosť a kontinuita
Klíčové pojmy: SLA obsahuje SLO; každé SLO má jedno merateľné SLI, SLO = cieľ dostupnosti, SLI = metrika merania, Každé zvýšenie percenta dostupnosti zvyšuje náklady, RTO = maximálna akceptovateľná doba obnovy, RPO = maximálna akceptovateľná strata dát v čase, Hot site má najnižšie RTO/RPO, cold site najvyššie, Inkrementálna, diferenčná a plná záloha ovplyvňujú RTO/RPO, Pravidelné testovanie obnovy odhaľuje procedurálne chyby, Firewall a load balancer zvyšujú dostupnosť siete, Vyberajte RTO/RPO podľa obchodnej hodnoty služby, Monitorujte SLI kontinuálne a nastavte eskalácie, Nekritické systémy nemusia používať najdrahšie DR riešenia