Wiki
DevOps

SLO, SLA, SLI — что это простыми словами

SLI — метрика (uptime %). SLO — цель (99.9 %). SLA — контракт с деньгами за нарушение. Основа SRE-подхода Google.

SLI (Service Level Indicator) — измеряемая метрика качества сервиса. Примеры: availability (% успешных запросов), latency (p99 < 500ms), error rate (< 0.1 %). Одно число за интервал (обычно 30 дней).

SLO (Service Level Objective) — целевое значение SLI. "99.9 % запросов должны отвечать за < 500 ms в течение 30 дней". SLO задаётся вами внутри команды без внешних обязательств. Основа планирования: если SLO 99.9 %, вы имеете error budget = 43 минуты downtime в месяц.

SLA (Service Level Agreement) — контрактное обязательство перед клиентом с финансовыми последствиями за нарушение. Обычно SLA слабее SLO (SLO 99.95 %, SLA 99.9 %) — оставляете буфер. Пример: "при uptime < 99.9 % возвращаем 10 % месячной платы".

Практика: SRE-книга Google рекомендует: (1) не гнаться за 100 % — дорого и не нужно, (2) сформулировать SLO, посчитать error budget, (3) когда бюджет исчерпан — freeze features, чинить надёжность. У нас SLA 99.9 % на VPS, SLO внутри — 99.95 % (буфер).

Частые вопросы

Как определить свой SLO?
Смотрите бизнес: SaaS для энтерпрайза — 99.9 %+. Внутренний dev-tool — 99 %. Каждая "девятка" удорожает решение в разы.
Что если SLA нарушен?
Автоматический credit на счёт клиента по формуле в договоре. У нас — публично на /legal/sla.

Смотрите также