O significado da decisão

Um servidor saudável pode esconder trabalho de cliente parado. Monitore o resultado esperado junto aos erros técnicos. Para cada fluxo importante, identifique início, estados intermediários duráveis e prova de conclusão. A distância entre estados pode explicar o que o contador de erros não mostra.

Papéis e alternativas

Comece por sinais acionáveis. Disponibilidade e resposta descrevem a aplicação; idade do trabalho pendente, falhas de conclusão e ausência incomum de eventos descrevem o processo. O Google SRE distingue sintomas e causas. Priorize sintomas percebidos pelo cliente e investigue detalhes técnicos, sem alertar para cada registro isolado.

Percorrer a mudança

Num orçamento ilustrativo, o formulário salva a solicitação e enfileira uma notificação. A web responde bem, mas o trabalhador de e-mail para. Observe a idade da mensagem pendente mais antiga. O alerta identifica a fila, explica inspeção segura e quando repetir. Recuperar significa entregar pendências sem perder nem duplicar a solicitação.

Verificar as falhas

Um painel quieto pode indicar ausência de demanda, coletor quebrado ou entrada travada. Diferencie os casos. Evite alertas sem responsável ou ação útil e mensagens pessoais no conteúdo. Pause um worker local ou simule falha de dependência para verificar alerta e recuperação.

Dar a cada alerta uma resposta prática

Descreva trabalho atrasado, não só nome do processo. Inclua fila, idade do item mais antigo, hora da observação e caminho seguro de inspeção. Exclua conteúdo pessoal. A pessoa precisa diferenciar worker parado e dependência de e-mail falha sem receber detalhes de todos os clientes.

Defina ações seguras. O guia verifica saúde, falha recente saneada e trabalho reservado ou concluído. Explique quando repetir, recuperar reserva vencida ou escalar. Repetir tudo pode duplicar ação externa concluída cuja resposta se perdeu. Sem certeza, registre e concilie, em vez de inventar sucesso limpo.

Teste a cadeia em ambiente controlado: pause worker, crie solicitação fictícia e observe pendência. Confirme alerta ao destinatário local, retome e verifique conclusão e recuperação. Teste o coletor também; silêncio não deve parecer fila vazia saudável. Depois do incidente, elimine ruído duplicado, ajuste responsáveis e melhore o primeiro diagnóstico. Não suprima um sintoma só por ser habitual.

Lista de revisão operacional

PerguntaEvidência útil
Sem trabalho ou sem medição?A última observação correta aparece separada da quantidade pendente.
Alerta tem responsável?Um papel conhece janela de resposta, inspeção e escalonamento.
A recuperação acabou?Trabalho chega ao estado de negócio; reiniciar não encerra sozinho o incidente.
Repetir duplica um efeito?O guia examina evidência de conclusão e trata resultado externo ambíguo como conciliação.

Combinar estas regras

O que significa sucesso? Quanto o trabalho pode esperar? Quem recebe o alerta e o que pode fazer com segurança? A revisão deve produzir um mapa operacional curto, não uma parede de métricas sem uso.

Fontes e outras leituras

  1. Google SRE — Monitoring distributed systems
Serviços

Software sob medida

Software que acompanha a forma como seu negócio trabalha.

Converse sobre este serviço