me_edu
Cloud, DevOps и SRE: Kubernetes, CI/CD и надежная эксплуатацияШаг 14 из 15 · 0% пройдено
CI/CD и надежный релиз

SRE: SLO, error budget, incident

Шаг 14 из 1511 минТеория
Цель

Понять основной механизм темы «SRE: SLO, error budget, incident» без заучивания отдельных терминов.

Как работать

Прочитайте блок один раз целиком, затем вернитесь к схеме или примеру и перескажите идею своими словами.

Критерий

Сформулированное правило, пример применения и одно ограничение метода.

ITERATION CYCLEdetectmitigaterestorelearnprevent
SRE-цикл: обнаружить, ограничить ущерб, восстановить, извлечь урок и предотвратить повтор
Опорная идея

SRE превращает надежность в измеримую инженерную дисциплину. SLI — показатель, например доля успешных запросов. SLO — цель, например 99,9% успешных запросов за 30 дней. Error budget показывает, сколько ошибок система может позволить себе без нарушения обещания пользователю. Если бюджет сгорает, команда уменьшает риск релизов и занимается надежностью.

Инцидент разбирают через timeline: обнаружение, влияние, причина, восстановление, предотвращение. Цель postmortem — улучшить систему, а не найти виноватого.

Назад

Обсуждение

Войдите, чтобы участвовать в обсуждении.

Пока нет сообщений.