Disponibilidade, resiliência e desempenho: o que deve medir
Disponibilidade, resiliência e desempenho respondem a perguntas diferentes.
Disponibilidade pergunta se o serviço está acessível; resiliência pergunta se recupera e continua a operar sob falha; desempenho pergunta se responde dentro de um tempo aceitável para a pessoa e para o processo.
Uptime sozinho engana
Um health check pode receber HTTP 200 enquanto o checkout está lento, a pesquisa não devolve resultados ou um utilizador não consegue concluir uma operação. Meça pelo menos o percurso crítico do negócio, não apenas o processo que responde ao ping.
Defina o que significa serviço disponível para quem o utiliza.
Métricas que conversam entre si
Acompanhe taxa de sucesso, latência por percentis, erros, saturação, filas, consumo de CPU e memória, disponibilidade de dependências e tempo de recuperação. Médias escondem picos; p95 e p99 mostram melhor as experiências lentas.
Para cada métrica deve existir um limiar, um responsável e uma acção recomendada.
Testar resiliência sem improvisar
Resiliência pode ser testada com exercícios controlados: reiniciar uma instância, bloquear uma dependência em ambiente de teste, restaurar uma cópia, simular uma falha de rede ou executar um failover documentado.
Comece em staging, defina a janela, o critério de interrupção e o rollback. Não faça experiências destrutivas em produção sem autorização e plano.
Desempenho é contexto
Uma página rápida num escritório com fibra pode ser lenta num telemóvel ou numa rede congestionada. Use dados de laboratório e dados reais, observe Core Web Vitals quando há web pública e meça também APIs, jobs e operações internas.
Optimizar não é tornar tudo máximo: é cumprir um orçamento adequado à importância da tarefa.
A leitura da PontoTi
A operação madura liga SLOs, alertas e capacidade a impacto empresarial. Quando um limite é ultrapassado, a equipa deve saber se reduz carga, activa fallback, comunica, escala recursos ou abre incidente.
Sem runbook e revisão pós-incidente, o dashboard apenas descreve o problema depois de ele acontecer.