Rozdział 8 z 15

Incydenty i czasy reakcji

Incydent to zapisana historia jednej sprawy: od chwili, w której coś przestało działać, przez wysłane powiadomienia i moment przejęcia przez człowieka, po rozwiązanie i podsumowanie. Na tych zapisach opiera się rozliczenie dostępności i czasu reakcji, więc warto wiedzieć, co je otwiera i co je zamyka.

Cykl życia zdarzenia

AwariaStrona główna nie odpowiada (HTTP 503)czas trwania: 34 min
  1. 12:04Wykryciedrugie nieudane sprawdzenie z rzędu potwierdziło awarię
  2. 12:04Odpowiedź serweracytat ze strony błędu: „Error establishing a database connection"
  3. 12:06Powiadomieniae-mail, aplikacja i SMS do dwóch osób
  4. 12:11Reakcjazdarzenie przejęte, status: w toku
  5. 12:38Rozwiązaniesprawdzenie potwierdziło powrót, incydent zamknięty z podsumowaniem
Makieta Oś czasu incydentu. Każdy wpis ma godzinę i autora, także wtedy, gdy autorem jest monitoring.
  • Otwarcie. Zdarzenie otwiera potwierdzone nieudane sprawdzenie, wykrycie krytyczne z przeglądu treści lub kontroli integralności albo sygnał z pakietu zainstalowanego na stronie.
  • Powiadomienia. Wychodzą po odczekaniu, kanałami wybranymi przez każdą osobę. Na osi czasu widać, co i do kogo poszło.
  • Reakcja. Moment, w którym człowiek przejmuje sprawę. Od niego liczy się czas reakcji.
  • Rozwiązanie. Zdarzenie zamyka poprawne sprawdzenie albo osoba z zespołu, dopisując podsumowanie.

Rodzaje zdarzeń i czasy reakcji

Nie każde zdarzenie jest tak samo pilne, więc cel czasu reakcji jest inny dla każdego rodzaju. Wartość podstawową ustawiasz w „Ustawieniach" strony, a pozostałe wyliczają się z niej.

RodzajKiedy powstajeCel czasu reakcji
Awariastrona lub jej kluczowa część nie odpowiadawartość ustawiona w „Ustawieniach"
Błąd krytycznyusługa działa, ale coś istotnego jest zepsute, na przykład poczta wychodzącajak przy awarii
Incydentsprawa wymagająca uwagi, ale niewyłączająca stronydwa razy dłużej niż przy awarii
Podatnośćzmiana grożąca bezpieczeństwem, na przykład nowy obcy skryptcztery razy dłużej niż przy awarii

Czyja to reakcja

W pakietach poniżej Enterprise cele czasu reakcji są Twoje: służą do mierzenia i porządkowania pracy Twojego zespołu. Nasze zobowiązanie do reakcji obejmuje pakiet Enterprise i wynika z umowy. Monitoring i powiadomienia działają tak samo w każdym pakiecie.

Ekran incydentu

Nagłówek zdarzenia podaje monitor, którego dotyczy, początek, czas trwania i czas reakcji zespołu. Poniżej stoi wyjaśnienie, co się stało, napisane zwykłym językiem, a przy nim zapis techniczny z chwili wykrycia.

  • „Odpowiedź serwera": dosłowny cytat ze strony błędu. To on najczęściej rozstrzyga, czy sprawa należy do firmy hostingowej, czy do osoby odpowiedzialnej za kod strony.
  • „Oś czasu incydentu": wykrycie, powiadomienia, notatki zespołu, zmiany statusu i rozwiązanie.
  • „Edytuj status i podsumowanie": status zdarzenia, rodzaj, przyczyna, podjęte kroki i rozwiązanie. To z tych pól powstaje opis w raporcie.
  • „Zweryfikuj ponownie": powtarza sprawdzenie i wymaga krótkiego komentarza, który zostaje na osi czasu.

Zdarzenie zamknięte jako zmiana zaplanowana

Część zdarzeń ma sprawcę po stronie klienta: ktoś celowo usunął podstronę, wyłączył wtyczkę albo dodał konto administratora. Wykrycie było poprawne, więc wpis zostaje w historii, ale nie powinien obciążać statystyk. Służy do tego przycisk „To była zaplanowana zmiana", dostępny dla roli administratora, z obowiązkowym uzasadnieniem.

  • Zdarzenie przestaje pomniejszać dostępność, liczbę zdarzeń i średni czas reakcji.
  • Zostaje w historii, w raporcie i w kanale zdarzeń razem z informacją, kto je zamknął i dlaczego.
  • Nie wycisza źródła: jeżeli monitor nadal zgłasza błąd, kolejne sprawdzenie otworzy nowe zdarzenie. Wtedy właściwym krokiem jest wyciszenie wykrycia albo wstrzymanie monitora.

Jak liczymy dostępność

Dostępność to udział czasu, w którym strona odpowiadała poprawnie, w całym wybranym okresie. Podajemy ją razem z liczbą minut przerwy, bo „99,5 procent" znaczy co innego w tygodniu, a co innego w kwartale.

  • Do przerw nie wliczamy zdarzeń zamkniętych jako zmiana zaplanowana ani czasu zapowiedzianych prac serwisowych.
  • Wstrzymany monitor nie liczy się w żadną stronę: ani na plus, ani na minus.
  • Błąd krytyczny, który nie wyłącza strony (na przykład niedziałająca poczta), nie pomniejsza dostępności, bo odwiedzający widzi w tym czasie stronę normalnie.
  • Na liście incydentów widać „Budżet SLA", czyli ile minut przerwy zostało do wybranego celu dostępności w bieżącym okresie.

Czegoś tu brakuje albo coś działa inaczej, niż opisujemy? Napisz do nas. Dokumentację poprawiamy razem z produktem.