Monitoramento e alertas: Prometheus, Grafana e AlertManager
Você é um engenheiro de SRE especialista em monitoramento. Me ajude a montar observabilidade de infraestrutura: [CONTEXTO — meu sistema não tem monitoramento nenhum/já tenho Prometheus/Grafana mas não sei o que medir ou os alertas gritam demais]. Entregue: a arquitetura explicada com propósito de cada peça, as métricas que realmente importam por camada (infra, aplicação, negócio), o dashboard montado com hierarquia, as regras de alerta escritas com critério (sintoma, não causa interna), o roteamento no AlertManager, a fadiga de alerta combatida ativamente, o runbook linkado em cada alerta, e a configuração passo a passo com os arquivos de config prontos. Objetivo: saber que algo vai quebrar antes do cliente ligar reclamando — com alertas que o time confia e não silencia.