Todos os artigos

Observabilidade digital: o que monitorizar num serviço

Monitorizar não é encher um painel de gráficos. É criar evidência suficiente para saber se um serviço está disponível, se está a degradar-se, o que mudou e se a equipa consegue recuperar.

Health checks, métricas, logs e alertas devem formar uma história operacional coerente.

Disponibilidade não é só ping

Um processo pode responder a ping e, ainda assim, não conseguir servir pedidos reais. Separe um health check de processo de um readiness check que valida dependências essenciais.

Uma verificação deve ser rápida, autenticada quando necessário e suficientemente específica para detectar falhas relevantes.

As quatro perguntas de um painel

Um painel operacional deve ajudar a responder: está disponível? está lento? está a falhar? conseguimos recuperar? Para isso, acompanhe latência, taxa de erros, saturação de CPU/memória/disco, filas, dependências, certificados e sucesso de backups.

Cada gráfico deve ter uma decisão associada.

Logs com contexto e sem segredos

Logs estruturados com timestamp, serviço, ambiente, request_id e severidade tornam uma investigação mais rápida. Não devem conter tokens, passwords, dados pessoais desnecessários ou payloads completos de clientes.

Retenção, acesso e rotação fazem parte do desenho e não são um detalhe posterior.

Alertas que conduzem a uma acção

Um alerta deve explicar o que aconteceu, qual o impacto provável, quando começou e que runbook consultar. Alertar para cada flutuação cria fadiga e faz a equipa ignorar sinais importantes. Prefira alertas por sintomas e tendência a limiares isolados sem contexto.

Health check em tempo real não é SLA

Mostrar o estado actual de um serviço é útil para diagnóstico e transparência. Não equivale a uma garantia de disponibilidade, a um SLA ou a uma medição histórica completa.

Para falar de fiabilidade é necessário guardar histórico, definir janela de medição e explicar o que foi ou não observado.

A leitura da PontoTi

Prometheus, Grafana, Uptime Kuma, logs e health endpoints podem formar uma base sólida para os serviços PontoTi.

O valor aparece quando a observabilidade está ligada a ownership, incidentes, backups, patching e melhoria contínua — não quando existe apenas uma parede de dashboards.

Fontes consultadas