Наблюдаемость
Метрики, логи, трейсы. Что смотреть, когда продакшн молчит.
Три типа сигналов наблюдаемости: на какой вопрос отвечает каждый и когда какой смотреть.
DEBUG/INFO/WARN/ERROR, зачем уровни, structured logging в JSON и что нельзя писать в логи.
Как Prometheus снимает метрики: pull-модель, типы метрик, /metrics эндпоинт и зачем нужны лейблы.
Зачем визуализировать метрики, как устроены дашборды и панели и почему хороший дашборд отвечает на вопрос, а не показывает всё подряд.
Как метрики превращаются в оповещения: правила алертов, маршрутизация и группировка в Alertmanager, борьба с шумом.
Как измерять надёжность числами: SLI как метрика качества, SLO как цель и error budget как право на риск.