// glossário
Uptime, downtime e as outras dez, sem palavreado.
Doze palavras que aparecem sempre que se fala de disponibilidade — o que é uptime, o que é downtime, o que é uma status page, o que é um SLA. Escritas para serem repetidas a quem não é técnico, não para passar num exame. Cinco delas têm página própria, com o detalhe que não cabe numa definição.
- Certificado TLS (SSL)
- O ficheiro que faz o cadeado aparecer no browser. Tem validade — 90 dias no Let’s Encrypt — e renova-se normalmente sozinho. Quando a renovação automática falha em silêncio, o site deixa de abrir de um dia para o outro, com um aviso de segurança em ecrã inteiro que assusta qualquer visitante. É a falha mais evitável que existe e continua a ser das mais comuns. Para veres o estado do teu, há o verificador de certificado. Verificar um certificado →
- Código de estado HTTP
- O número com que o servidor responde a cada pedido. 200 é "aqui está"; 301 e 302 são "mudou-se para outro sítio"; 404 é "isso não existe"; 500 é "avariei-me"; 503 é "estou sobrecarregado". Para monitorização, a linha que interessa é entre os 200 e os 500: um site que responde 500 está em baixo, mesmo estando a responder. O diagnóstico de cada código →
- DNS
- O sistema que traduz o nome do site para o endereço do servidor. Quando falha, o site fica inacessível sem que o servidor tenha problema nenhum — e é por isso que "o servidor está a funcionar" não é resposta suficiente quando um cliente diz que não consegue entrar. Quando o DNS não resolve →
- Downtime
- O tempo em que o site não respondeu como devia. Conta-se do primeiro pedido falhado ao primeiro pedido bem sucedido a seguir — o que significa que a frequência de verificação define a precisão. Uma ferramenta que verifica de cinco em cinco minutos não sabe se a falha durou dez segundos ou quatro minutos e meio. O que é downtime, em detalhe →
- Falso positivo
- Um alerta de falha quando o site estava bom. Normalmente um soluço da rede entre quem verifica e quem é verificado. É o problema mais corrosivo da monitorização: passados uns meses de alertas que não eram nada, as pessoas deixam de os abrir — e nessa altura o sistema deixou de servir para o que foi montado. É por isto que confirmamos a falha antes de avisar.
- Janela de manutenção
- Um período combinado em que o site pode estar em baixo de propósito — uma migração, uma actualização grande. Marcar a janela evita que a intervenção conte como incidente e estrague o número do relatório.
- Latência
- Quanto tempo o servidor demorou a responder, em milissegundos. Serve de aviso prévio: um site que passou de 200 ms para 1 400 ms ao longo de uma semana está a caminho de cair, e vê-se no gráfico antes de haver falha nenhuma. Quando o site está muito lento →
- SLA
- Service Level Agreement: o compromisso contratual de disponibilidade. Um SLA de 99,9% dá direito a cerca de 43 minutos de falha por mês. Só faz sentido assinar um se houver registo independente para o comprovar — sem histórico, o SLA é uma frase no contrato. SLA de disponibilidade, em detalhe →
- Status page
- Uma página pública que mostra o estado actual de um serviço e o histórico de incidentes. Serve para o cliente confirmar sozinho o que está a acontecer, sem escrever a ninguém — o que reduz o número de mensagens durante um incidente e evita a pergunta "já sabem?". Em português diz-se página de estado, mas quem procura escreve status page. O que é uma status page →
- TTFB
- Time To First Byte — o tempo até chegar o primeiro byte da resposta. É a parte da latência que depende do servidor e da base de dados, sem contar com o tempo de descarregar imagens e scripts. Sobe quando a base de dados fica lenta.
- Uptime
- A percentagem de tempo em que o site respondeu como devia, num dado período. Se um site esteve em baixo 43 minutos num mês, teve 99,9% de uptime. É a métrica que se põe num relatório, mas não diz tudo: 43 minutos seguidos num sábado à noite não é a mesma coisa que 43 minutos espalhados por uma terça-feira de manhã. O que é uptime, em detalhe →
- Uptime monitoring
- A prática de verificar automaticamente, a intervalos regulares, se um site responde — e avisar alguém quando deixa de responder. É o oposto de olhar quando alguém se queixa. Em português diz-se monitorização de uptime, mas o termo que se procura é o inglês. O que é uptime monitoring →
// a seguir
Da definição para o problema concreto.
Se chegaste aqui por causa de um site que não abre, o "Está em baixo, ou és só tu?" responde em segundos e não pede conta — e o diagnóstico por erro tem uma página por mensagem, do 500 ao DNS. Se o aviso falar em segurança, é o certificado. E se o que estás a montar é a avença que paga tudo isto, a manutenção de sites é a outra metade da conversa.