Profese
SRE (site reliability engineer)inženýr spolehlivosti systémů
Také se říká: site reliability engineer (inženýr spolehlivosti provozu), SRE inženýr, reliability engineer (inženýr spolehlivosti)
Co v této práci budete opravdu dělat
SRE se stará o to, aby weby a aplikace, na kterých firma stojí, běžely rychle, stabilně a bez výpadků — a když spadnou, aby byly co nejdřív zpátky. Přístup vymysleli v Googlu: provoz systémů se řeší jako programátorská úloha. Nastavujete cílové úrovně dostupnosti SLO (service level objectives — závazek, kolik procent času musí služba fungovat), stavíte monitoring v nástrojích typu Prometheus a Grafana, automatizujete nasazování a opravy, aby ruční práci nahradil skript. Součástí života jsou pohotovosti (on-call): když ve tři ráno přijde poplach, řešíte výpadek vy. Po incidentu píšete rozbor bez hledání viníka — cílem je, aby se chyba neopakovala. Pracujete s technologiemi jako Kubernetes (systém pro správu aplikací v kontejnerech) a Terraform (popis infrastruktury kódem). Zaměstnávají vás e-shopy, banky, softwarové firmy — každý, koho hodina výpadku stojí jmění. Kariéra vede k architektuře nebo vedení provozních týmů. Obvyklá cesta: praxe správce systémů či vývojáře, formální škola se řeší málokdy. Vyrostla z profese popsané v hesle Správce IT systémů a počítačových sítí, heslo Správce IT systémů a počítačových sítí. Hranice mezi SRE a devops (propojení vývoje a provozu) si každá firma kreslí jinak. Proč není v katalogu: vznikla z technologií, název se ustálil až v posledních letech.