Co oznacza decyzja
Serwer może być zdrowy, podczas gdy praca klienta jest zablokowana. Monitorować wynik, który aplikacja ma wytwarzać obok awarii technicznych. Dla każdego ważnego procesu pracy należy określić zdarzenie początkowe, trwałe stany pośrednie i dowody ukończenia. Odległość między tymi państwami często wyjaśnia problem, który liczba błędów pomija.
Role i alternatywy
Zacznij od małego zestawu sygnałów, na które ludzie mogą działać. Dostępność i czas reakcji opisują aplikację; najstarsze prace oczekujące, niepowodzenia w ukończeniu i nietypowy brak spodziewanych zdarzeń opisują proces. Rozdział monitorowania SRE Google odróżnia objawy od przyczyn. Użyj widocznych przez klienta objawów, aby zdecydować o pilności, a następnie szczegóły techniczne do zbadania, a nie wzywanie kogoś do każdego odizolowanego wpisu dziennika.
Przejdź przez zmiany
W przykładowym procesie kwotowania, formularz oszczędza żądanie i kolejkuje zgłoszenie. Strona zwraca się z powodzeniem, ale pracownik poczty zatrzymuje. Oglądaj wiek najstarszego niewysyłanego powiadomienia, nie tylko błędy w sieci. Alarm powinien zidentyfikować kolejkę, dać polecenie bezpiecznej inspekcji i wyjaśnić, kiedy ponownie spróbować. Odzysk jest potwierdzony, gdy oczekujące prace są dostarczane bez utraty lub duplikowania podstawowego wniosku.
Sprawdź ścieżki awarii
Cicha deska rozdzielcza może oznaczać brak popytu, zepsuty zbieracz danych lub zablokowany punkt wejścia. Rozróżnij te przypadki. Unikaj alarmów bez właściciela lub użytecznej odpowiedzi i nie umieszczaj osobistych wiadomości w paylots alarmowych. Monitorowanie testowe poprzez wstrzymanie pracy miejscowego pracownika lub symulowanie niesprawności w zakresie zależności, a następnie sprawdzenie zarówno stanu alarmowego, jak i stanu odzysku.
Udziel każdemu alarmowi praktycznej odpowiedzi
Dla przykładu powiadomienia należy zapisać ostrzeżenie w odniesieniu do opóźnionej pracy klienta, a nie tylko nazwę procesu. Włączyć dotkniętą kolejkę, najstarszy wiek oczekującego elementu, czas obserwacji i link lub polecenie dla autoryzowanego operatora, aby go sprawdzić. Utrzymuj zawartość wiadomości osobistych z dala od wpisu. Pierwszy respondent potrzebuje wystarczająco dużo kontekstu, aby odróżnić zatrzymanego pracownika od słabej zależności poczty bez otrzymywania szczegółów każdego klienta.
Określić, co operator może bezpiecznie zrobić. Książka startowa może rozpocząć się od sprawdzenia zdrowia pracowników, przeglądu niedawnych awarii sanitarnych i kontroli, czy praca jest dzierżawiona lub już zakończona. Powinna ona wyjaśniać, kiedy ponowna próba jest bezpieczna, kiedy można odzyskać utraconą dzierżawę oraz kiedy przestać i eskalować. Cofnięcie każdej pozycji ślepo może powtórzyć działanie zewnętrzne, które zakończyło się przed utratą odpowiedzi. W przypadku gdy system zewnętrzny nie jest w stanie udzielić jasnej odpowiedzi, należy odnotować niepewność i pogodzić ją zamiast wynaleźć stan czystego sukcesu.
Przetestować całą ścieżkę alarmową w kontrolowanym środowisku. Wstrzymać pracownika, stworzyć fikcyjny wniosek i patrzeć, jak stan się rozwija. Potwierdź, że wpis dociera do zamierzonego lokalnego biorcy, a następnie przywróć pracownika i zweryfikuj jego ukończenie oraz powiadomienie o odzyskaniu lub status. Sprawdź również kolektor: jeśli obserwacje przestaną przychodzić, cichy wykres nie może wyglądać jak zdrowa pusta kolejka. Sprawdź przydatność ostrzeżenia po incydencie. Usunąć duplikat hałasu, dostosować właściciela i poprawić pierwszy krok diagnostyczny, ale nie tłumić objaw tylko dlatego, że stał się znajomy. Celem jest osoba podejmująca właściwe działania w sprawie właściwej pracy.
Lista kontrolna przeglądu operacyjnego
| Pytanie | Przydatne dowody |
|---|---|
| Czy możemy odróżnić brak pracy od braku pomiaru? | Ostatnie udane obserwacje są widoczne oddzielnie od liczby oczekujących elementów. |
| Czy wpis identyfikuje właściciela? | Nazwa zna swoje okienko odpowiedzi, trasę kontroli i kontakt eskalacji. |
| Czy rehabilitacja jest zakończona? | Oczekiwanie na pracę dociera do zamierzonego stanu działalności gospodarczej; ponowne rozpoczęcie samego procesu nie zamyka incydentu. |
| Czy można powtórzyć działanie niepożądane? | W książce biegłych sprawdza się dowody ukończenia i traktuje niejednoznaczne wyniki zewnętrzne jako działanie pojednawcze, a nie automatyczne niepowodzenie. |
Uzgodnij te zasady
Co oznacza sukces dla tego przepływu pracy? Jak długo praca może czekać, zanim ktoś będzie musiał interweniować? Kto otrzymuje ostrzeżenie i co może bezpiecznie zrobić? Przegląd oprogramowania użytkownika powinien stworzyć krótką mapę operacyjną, a nie ścianę metryczną, której nikt nie używa.
Źródła i dalsza lektura
Oprogramowanie na zamówienie
Oprogramowanie dopasowane do sposobu działania Twojej firmy.
Porozmawiaj o tej usłudze