Todos los artículos

Disponibilidade, resiliência e desempenho: o que deve medir

Disponibilidade, resiliência e desempenho respondem a perguntas diferentes.

Disponibilidade pergunta se o serviço está acessível; resiliência pergunta se recupera e continua a operar sob falha; desempenho pergunta se responde dentro de um tempo aceitável para a pessoa e para o processo.

Uptime sozinho engana

Um health check pode receber HTTP 200 enquanto o checkout está lento, a pesquisa não devolve resultados ou um utilizador não consegue concluir uma operação. Meça pelo menos o percurso crítico do negócio, não apenas o processo que responde ao ping.

Defina o que significa serviço disponível para quem o utiliza.

Métricas que conversam entre si

Acompanhe taxa de sucesso, latência por percentis, erros, saturação, filas, consumo de CPU e memória, disponibilidade de dependências e tempo de recuperação. Médias escondem picos; p95 e p99 mostram melhor as experiências lentas.

Para cada métrica deve existir um limiar, um responsável e uma acção recomendada.

Testar resiliência sem improvisar

Resiliência pode ser testada com exercícios controlados: reiniciar uma instância, bloquear uma dependência em ambiente de teste, restaurar uma cópia, simular uma falha de rede ou executar um failover documentado.

Comece em staging, defina a janela, o critério de interrupção e o rollback. Não faça experiências destrutivas em produção sem autorização e plano.

Desempenho é contexto

Uma página rápida num escritório com fibra pode ser lenta num telemóvel ou numa rede congestionada. Use dados de laboratório e dados reais, observe Core Web Vitals quando há web pública e meça também APIs, jobs e operações internas.

Optimizar não é tornar tudo máximo: é cumprir um orçamento adequado à importância da tarefa.

A leitura da PontoTi

A operação madura liga SLOs, alertas e capacidade a impacto empresarial. Quando um limite é ultrapassado, a equipa deve saber se reduz carga, activa fallback, comunica, escala recursos ou abre incidente.

Sem runbook e revisão pós-incidente, o dashboard apenas descreve o problema depois de ele acontecer.

Fuentes consultadas