Use uma referência do ambiente
Observe a carga normal e os períodos de pico antes de escolher limites. CPU alta por alguns segundos pode fazer parte de uma tarefa prevista. Combine valor, duração e impacto para diferenciar uma oscilação comum de uma condição que precisa de atenção.
Defina abertura e recuperação
No Zabbix, expressões de trigger avaliam os dados coletados; no Grafana, regras de alerta também relacionam consultas e condições. Planeje quando o problema abre e quando é considerado resolvido. Critérios de recuperação adequados ajudam a evitar notificações repetidas durante oscilações próximas ao limite.
Inclua uma ação possível
Informe serviço, equipamento, período e um link para o painel relevante. Defina o canal e quem assume o atendimento. Simule uma falha e a recuperação para testar a cadeia inteira. Revise alertas ignorados ou duplicados para reduzir o tempo de diagnóstico da equipe.
Antes de começar
- Relacione limite, duração e impacto.
- Teste a abertura e a recuperação.
- Inclua responsável e próxima ação.
